Data engineering: pipelines de datos que corren sin que nadie los empuje
Diseñamos y construimos pipelines de datos en BigQuery, Airflow y Dataform: ingesta desde SAP y otras fuentes, modelamiento por capas y cargas automatizadas.
El problema que resuelve
El dato existe, pero llegar a él cuesta. Alguien descarga un Excel del ERP, lo cruza a mano con otras dos planillas y publica el reporte el jueves. Cuando el proceso se cae, nadie se entera hasta que aparece un número raro en una reunión.
Ese trabajo manual no escala y no es auditable: no hay forma de reconstruir de dónde salió una cifra, ni de repetir el cálculo sin la persona que lo hizo.
Qué entregamos
- Ingesta desde ERP (SAP), bases transaccionales, APIs y archivos, con cargas incrementales y reproceso controlado.
- Modelamiento por capas (raw, staging, core, marts) con las reglas de negocio versionadas en SQL, no escondidas dentro de un tablero.
- Orquestación en Airflow (Cloud Composer) o Dataform, con dependencias explícitas, reintentos y ventanas de carga.
- Tests de calidad sobre los datos: unicidad, integridad referencial, frescura y rangos esperados.
- Documentación y código en tu repositorio, desplegable desde cero sin nosotros.
Stack tecnológico
- BigQuery
- Airflow / Cloud Composer
- Dataform
- Google Cloud
- Microsoft Fabric
- Cloud Run
- Python
- SQL
Casos de uso
Situaciones típicas en las que entra este servicio.
- Consolidar compras y consumo de materiales de SAP MM en BigQuery, para dejar de pedirle una extracción a TI cada vez.
- Reemplazar una planilla mensual que cruzaba tres fuentes a mano por una carga diaria automatizada con control de errores.
- Unificar datos de varias plantas o filiales con estructuras distintas en un solo modelo comparable.
- Preparar una capa analítica para tableros que hoy consultan la base transaccional y la dejan lenta.
Preguntas frecuentes
- ¿Qué hace un ingeniero de datos?
- Construye y mantiene el camino que recorre un dato desde el sistema donde nace hasta el reporte donde se usa: extracción, limpieza, modelamiento, orquestación y monitoreo. No es lo mismo que un analista, que interpreta el dato, ni que un desarrollador de aplicaciones, que construye el sistema de origen.
- ¿Hay que migrar todo a la nube para empezar?
- No. Casi siempre partimos por un dominio acotado —compras, inventario, ventas—, lo dejamos funcionando de punta a punta y recién ahí se decide qué sigue. Migrar todo de una es la forma más cara de descubrir que el modelo estaba mal.
- ¿Cuánto demora tener el primer pipeline en producción?
- Con un dominio acotado y acceso a las fuentes, entre 4 y 8 semanas hasta tener carga automática, tests y un tablero encima. Lo que más mueve el plazo es conseguir los accesos a los sistemas de origen, no el desarrollo.
- ¿Trabajan con datos de SAP?
- Sí, y es parte de por qué existimos: uno de los dos socios viene de SAP MM y operaciones. Extraemos los datos y además sabemos qué proceso los generó, que es de donde suelen venir las diferencias entre el ERP y el reporte.
¿Te suena conocido?
Cuéntanos qué tienes hoy y qué te está doliendo. Respondemos con un alcance acotado o te decimos derechamente que no somos los indicados.