Práctica 02

Infraestructura de datos

Cuando los datos están fragmentados entre ERP, CRM, planillas y sistemas locales, todo lo que se construya encima hereda esa fragilidad. Construimos una base única, versionada y auditable, con calidad medida y seguridad diseñada dentro.

Qué problemas resuelve
  • Datos en silos: cada área tiene su versión de la verdad y los reportes no cuadran.
  • Reportes que llegan tarde o se arman a mano cada mes.
  • Nadie puede explicar de dónde salió una cifra ni quién la modificó.
  • No es posible entrenar ni operar modelos porque no hay datos confiables ni frescos.
Cómo lo resolvemos
01

Ingesta e integración

Conectores a ERPs, CRMs, SaaS locales (Defontana, Bsale, Nubox, Jumpseller), medios de pago (Transbank, Flow, Mercado Pago), bases de datos y APIs. Batch (ELT) y streaming, con CDC cuando el negocio necesita datos frescos.

02

Lakehouse y transformación

Warehouse serverless (BigQuery por defecto) con datos crudos en almacenamiento de objetos, y transformación con dbt: SQL modular, versionado, con tests automáticos.

03

Calidad como contrato

Tests de calidad y validaciones con SLAs de frescura y exactitud. Si un dato se rompe, se detecta antes de que llegue a un tablero o a un modelo.

04

Seguridad y trazabilidad por diseño

Cifrado en tránsito y reposo, control de acceso a nivel de fila y columna, linaje completo y auditoría. La misma infraestructura que exige la ley es la que habilita IA confiable.

Qué se logra

Menos costo operativo

Se elimina el trabajo manual de consolidación y conciliación mensual; el equipo deja de armar planillas y pasa a analizar.

Decisiones más rápidas

Información diaria u horaria en lugar de cierres mensuales, con una sola versión de la verdad.

Habilita todo lo demás

Con la base construida, cada caso de ML o IA posterior cuesta una fracción de lo que costaría partiendo de cero.

Costo cloud bajo control

Arquitectura serverless y monitoreo de consumo: se paga por uso real, no por capacidad ociosa.

Qué queda operando
  • Lakehouse operativo en la nube del cliente
  • Pipelines de ingesta y orquestación productivos
  • Modelos de datos versionados con tests de calidad y SLAs
  • Catálogo, linaje y controles de acceso implementados

Stack de referencia: BigQuery, dbt Core, Airflow / Cloud Composer, Pub/Sub o Kafka, GCS, IAM. Agnóstico: AWS y Azure según residencia y stack existente.