Data lake
Término 81 de 314 · Tecnología
En una frase
Un data lake es un repositorio central que almacena datos en su formato crudo y a cualquier escala, sin transformarlos al ingresar. Guarda datos estructurados, semiestructurados y no estructurados, y aplica el esquema recién al momento de leerlos.
Un data lake (lago de datos) es un repositorio centralizado que almacena grandes volúmenes de datos en su formato nativo y crudo, sin imponer una estructura previa al momento de cargarlos. A diferencia de una base de datos tradicional, recibe por igual tablas relacionales, archivos JSON, logs, correos, imágenes, audio o video, y deja la organización del dato para más adelante.
Su rasgo definitorio es el esquema en lectura (schema-on-read): en lugar de modelar y transformar los datos antes de guardarlos, el data lake los conserva tal cual llegan y aplica la estructura recién cuando alguien los consulta. Esto lo hace flexible y económico para almacenar todo lo que una empresa genera, incluso aquello cuyo uso futuro todavía no está definido.
En la práctica, un data lake suele ser la capa de almacenamiento crudo sobre la que después se construye la analítica de negocio. Esa explotación (modelado, métricas y tableros) es parte de lo que resuelve Metrix, que convierte ese volumen disperso en información accionable.
Un data lake nació como respuesta a un problema concreto: las empresas generan cada vez más datos que no encajan en filas y columnas. Un correo de un cliente, las coordenadas de un camión, una foto de góndola, los clics en un sitio o las conversaciones de WhatsApp son datos valiosos que un esquema rígido obliga a descartar o deformar. El data lake los acepta a todos en su estado original y los guarda baratos, a la espera de darles uso.
Cómo funciona por dentro
La idea central es separar el almacenamiento del procesamiento. El dato entra crudo y se deposita en un almacenamiento de objetos de bajo costo (en la nube o en infraestructura propia). No se lo transforma al ingresar: esa es la diferencia con el clásico ETL, donde primero se limpia y modela y recién después se carga. En un data lake suele invertirse el orden (cargar primero, transformar después), porque el objetivo es no perder nada y decidir el modelado cuando aparece la pregunta de negocio.
Un data lake bien gestionado se organiza por zonas, normalmente tres:
- Zona cruda (raw): el dato tal cual llegó de la fuente, sin tocar. Es la copia fiel y auditable.
- Zona procesada (curada): datos ya limpios, validados y enriquecidos, listos para análisis confiable.
- Zona de consumo: vistas y conjuntos modelados para tableros, reportes o modelos de machine learning.
Por qué le importa al negocio
El valor real de un data lake no es guardar por guardar: es habilitar preguntas que antes no se podían responder. Al concentrar en un solo lugar datos de ventas, marketing, logística y finanzas, una empresa puede cruzar información que vivía en silos. También es el insumo natural de la IA: los modelos de machine learning y los proyectos de análisis predictivo necesitan grandes volúmenes de datos históricos crudos para entrenarse, y el data lake es donde viven.
Ejemplo concreto (LATAM)
Pensá en una distribuidora de Consumo Masivo en Argentina. Sus pedidos están en el ERP, las visitas de los vendedores en una app, las fotos de exhibición en otra herramienta y las quejas de clientes en WhatsApp. Por separado, cada fuente cuenta media historia. Volcando todo a un data lake, el equipo puede preguntarse si las sucursales con mejor exhibición en góndola venden más del SKU promocionado. Esa correlación, imposible con datos aislados, surge al tener todo bajo un mismo techo. Después, una capa de analítica modela esos datos crudos en métricas comparables.
Data lake vs data warehouse
Es la comparación más útil para entender el concepto. No son rivales: muchas empresas usan los dos, y el data lake suele alimentar al warehouse.
| Aspecto | Data lake | Data warehouse |
|---|---|---|
| Tipo de dato | Crudo: estructurado, semi y no estructurado | Estructurado y modelado |
| Esquema | En lectura (schema-on-read) | En escritura (schema-on-write) |
| Costo de almacenamiento | Bajo | Más alto |
| Usuario típico | Científico de datos, ingeniero | Analista de negocio, gerencia |
| Uso principal | Exploración, IA, datos sin destino fijo | Reportes y métricas conocidas |
| Riesgo principal | Convertirse en pantano de datos | Rigidez ante nuevos tipos de dato |
El error más común: el data swamp
El mayor riesgo de un data lake es degenerar en un pantano de datos (data swamp): un depósito gigante donde nadie sabe qué hay, de dónde vino ni si es confiable. Sin gobierno de datos, catálogo y metadatos, el lago se vuelve inservible. Por eso un data lake sano es inseparable del gobierno de datos y de la calidad del dato: no alcanza con acumular, hay que documentar el linaje, controlar accesos y garantizar que el dato curado sea creíble. Otros errores frecuentes son tratarlo como un simple disco de respaldo, no separar las zonas crudas de las consumibles, y subir datos sin ninguna política de retención ni catalogación.
Preguntas frecuentes sobre Data lake
¿Qué es un data lake?
¿Qué es un data lake?
Un data lake, o lago de datos, es un repositorio central que almacena grandes volúmenes de datos en su formato crudo y original, sin transformarlos al ingresar. Acepta datos estructurados (tablas), semiestructurados (JSON, logs) y no estructurados (imágenes, audio, texto libre), y aplica la estructura recién cuando se consultan. Su ventaja es la flexibilidad y el bajo costo para guardar todo lo que una empresa genera, incluso datos cuyo uso futuro todavía no está definido.
¿Cuál es la diferencia entre un data lake y un data warehouse?
¿Cuál es la diferencia entre un data lake y un data warehouse?
La diferencia clave está en cómo tratan el dato. Un data warehouse guarda datos ya estructurados y modelados, definiendo el esquema al escribir (schema-on-write), y sirve para reportes y métricas conocidas. Un data lake guarda datos crudos de cualquier tipo y define la estructura recién al leer (schema-on-read), lo que lo hace ideal para exploración, ciencia de datos e inteligencia artificial. No son excluyentes: muchas empresas usan ambos, y el data lake suele alimentar al warehouse.
¿Qué es un data swamp o pantano de datos?
¿Qué es un data swamp o pantano de datos?
Un data swamp es un data lake que se degeneró por falta de gestión: un depósito enorme de datos donde nadie sabe qué hay, de dónde vino ni si es confiable, por lo que se vuelve prácticamente inservible. Ocurre cuando se acumulan datos sin gobierno, sin catálogo, sin metadatos ni control de calidad. Para evitarlo hay que documentar el linaje del dato, organizar el lago en zonas (cruda, curada y de consumo), controlar accesos y aplicar políticas claras de retención y catalogación.
¿Para qué sirve un data lake en una empresa?
¿Para qué sirve un data lake en una empresa?
Sirve para concentrar en un solo lugar datos que normalmente viven en silos: ventas, marketing, logística, finanzas, atención al cliente. Al tenerlos juntos y en formato crudo, la empresa puede cruzar información y responder preguntas de negocio que antes eran imposibles. Además es el insumo natural de la inteligencia artificial, porque los modelos de machine learning y los proyectos de análisis predictivo necesitan grandes volúmenes de datos históricos para entrenarse, y esos datos viven en el data lake.
¿Un data lake reemplaza a una base de datos tradicional?
¿Un data lake reemplaza a una base de datos tradicional?
No, cumplen roles distintos. Una base de datos relacional o transaccional está optimizada para operaciones del día a día, con datos estructurados, consultas rápidas y consistencia inmediata. Un data lake está pensado para almacenar masivamente datos crudos de cualquier tipo con fines analíticos y de exploración, no para operar el negocio en tiempo real. En la mayoría de las arquitecturas conviven: las bases operativas alimentan al data lake, y desde ahí se construye la analítica y la IA.
Calculadora del Cuello de Botella de BI
Cuánto cuesta cada 'te lo paso mañana'.
Abrir la herramientaEste número, actualizado solo
Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- Data warehouseUn data warehouse es un repositorio central que integra datos de múltiples sistemas, ya limpios y estructurados, optimizado para consultas analíticas y reportes. A diferencia de una base operativa, está pensado para responder preguntas de negocio sobre datos históricos.
- Gobierno de datosEl gobierno de datos es el conjunto de políticas, roles y procesos que define quién puede usar qué datos, cómo y para qué, garantizando que la información sea confiable, segura y consistente en toda la organización.
- ETLETL (Extract, Transform, Load) es el proceso que extrae datos de varias fuentes, los transforma a un formato limpio y consistente, y los carga en un destino central como un data warehouse para analizarlos de forma confiable.
- Datos no estructuradosLos datos no estructurados son información sin un modelo predefinido de filas y columnas: facturas en PDF, correos, fotos, audios, contratos y mensajes de WhatsApp. Concentran cerca del 80% de la información de una empresa y exigen IA para volverse explotables.
- Data qualityData quality (calidad de datos) es el grado en que los datos de una organización son exactos, completos, consistentes, vigentes y únicos para el uso que se les quiere dar. Cuando es alta, las decisiones, reportes y modelos de IA son confiables.
- ELTEl ELT es un enfoque de integración de datos que extrae la información de las fuentes, la carga cruda en el destino, habitualmente un data warehouse en la nube, y recién ahí la transforma, aprovechando el cómputo del propio almacén.
Preguntas relacionadas
Metrix
Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.
Así lo resuelve MetrixSeguí leyendo en Pulse
Masterclass » Desarrollar con IA en Salesforce: Casos reales y los Trucos [que nadie te cuenta]
Descubrí cómo la IA transforma el desarrollo en Salesforce. Aprendé a usar prototipos funcionales y MCP para validar requisitos, optimizar flujos de trabajo y entregar proyectos más rápido con Vantegr
La IA no le va a Responder todo a tu Equipo: Le va a responder bien lo que importa [y eso vale oro]
El text-to-SQL en producción todavía falla más de lo que el marketing admite. Pero el BI conversacional resuelve bien las preguntas frecuentes, y hoy solo el 25% de tus empleados usa los datos. La verdad sobre la analítica con IA.
Lo que la inteligencia artificial le está haciendo a la logística (y casi nadie lo está aprovechando)
Descubrí cómo la inteligencia artificial en la logística reduce costos, optimiza la última milla y predice la demanda con datos reales. Una guía práctica para empezar hoy, sin transformar todo de golpe.
Ahora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.


