Data engineering: pipelines de datos que corren sin que nadie los empuje

Diseñamos y construimos pipelines de datos en BigQuery, Airflow y Dataform: ingesta desde SAP y otras fuentes, modelamiento por capas y cargas automatizadas.

El problema que resuelve

El dato existe, pero llegar a él cuesta. Alguien descarga un Excel del ERP, lo cruza a mano con otras dos planillas y publica el reporte el jueves. Cuando el proceso se cae, nadie se entera hasta que aparece un número raro en una reunión.

Ese trabajo manual no escala y no es auditable: no hay forma de reconstruir de dónde salió una cifra, ni de repetir el cálculo sin la persona que lo hizo.

Qué entregamos

  • Ingesta desde ERP (SAP), bases transaccionales, APIs y archivos, con cargas incrementales y reproceso controlado.
  • Modelamiento por capas (raw, staging, core, marts) con las reglas de negocio versionadas en SQL, no escondidas dentro de un tablero.
  • Orquestación en Airflow (Cloud Composer) o Dataform, con dependencias explícitas, reintentos y ventanas de carga.
  • Tests de calidad sobre los datos: unicidad, integridad referencial, frescura y rangos esperados.
  • Documentación y código en tu repositorio, desplegable desde cero sin nosotros.

Stack tecnológico

  • BigQuery
  • Airflow / Cloud Composer
  • Dataform
  • Google Cloud
  • Microsoft Fabric
  • Cloud Run
  • Python
  • SQL

Casos de uso

Situaciones típicas en las que entra este servicio.

  • Consolidar compras y consumo de materiales de SAP MM en BigQuery, para dejar de pedirle una extracción a TI cada vez.
  • Reemplazar una planilla mensual que cruzaba tres fuentes a mano por una carga diaria automatizada con control de errores.
  • Unificar datos de varias plantas o filiales con estructuras distintas en un solo modelo comparable.
  • Preparar una capa analítica para tableros que hoy consultan la base transaccional y la dejan lenta.

Preguntas frecuentes

¿Qué hace un ingeniero de datos?
Construye y mantiene el camino que recorre un dato desde el sistema donde nace hasta el reporte donde se usa: extracción, limpieza, modelamiento, orquestación y monitoreo. No es lo mismo que un analista, que interpreta el dato, ni que un desarrollador de aplicaciones, que construye el sistema de origen.
¿Hay que migrar todo a la nube para empezar?
No. Casi siempre partimos por un dominio acotado —compras, inventario, ventas—, lo dejamos funcionando de punta a punta y recién ahí se decide qué sigue. Migrar todo de una es la forma más cara de descubrir que el modelo estaba mal.
¿Cuánto demora tener el primer pipeline en producción?
Con un dominio acotado y acceso a las fuentes, entre 4 y 8 semanas hasta tener carga automática, tests y un tablero encima. Lo que más mueve el plazo es conseguir los accesos a los sistemas de origen, no el desarrollo.
¿Trabajan con datos de SAP?
Sí, y es parte de por qué existimos: uno de los dos socios viene de SAP MM y operaciones. Extraemos los datos y además sabemos qué proceso los generó, que es de donde suelen venir las diferencias entre el ERP y el reporte.

¿Te suena conocido?

Cuéntanos qué tienes hoy y qué te está doliendo. Respondemos con un alcance acotado o te decimos derechamente que no somos los indicados.