GlosarioTecnología

Data lake

Término 81 de 314 · Tecnología

En una frase

Un data lake es un repositorio central que almacena datos en su formato crudo y a cualquier escala, sin transformarlos al ingresar. Guarda datos estructurados, semiestructurados y no estructurados, y aplica el esquema recién al momento de leerlos.

Definición

Un data lake (lago de datos) es un repositorio centralizado que almacena grandes volúmenes de datos en su formato nativo y crudo, sin imponer una estructura previa al momento de cargarlos. A diferencia de una base de datos tradicional, recibe por igual tablas relacionales, archivos JSON, logs, correos, imágenes, audio o video, y deja la organización del dato para más adelante.

Su rasgo definitorio es el esquema en lectura (schema-on-read): en lugar de modelar y transformar los datos antes de guardarlos, el data lake los conserva tal cual llegan y aplica la estructura recién cuando alguien los consulta. Esto lo hace flexible y económico para almacenar todo lo que una empresa genera, incluso aquello cuyo uso futuro todavía no está definido.

En la práctica, un data lake suele ser la capa de almacenamiento crudo sobre la que después se construye la analítica de negocio. Esa explotación (modelado, métricas y tableros) es parte de lo que resuelve Metrix, que convierte ese volumen disperso en información accionable.

Un data lake nació como respuesta a un problema concreto: las empresas generan cada vez más datos que no encajan en filas y columnas. Un correo de un cliente, las coordenadas de un camión, una foto de góndola, los clics en un sitio o las conversaciones de WhatsApp son datos valiosos que un esquema rígido obliga a descartar o deformar. El data lake los acepta a todos en su estado original y los guarda baratos, a la espera de darles uso.

Cómo funciona por dentro

La idea central es separar el almacenamiento del procesamiento. El dato entra crudo y se deposita en un almacenamiento de objetos de bajo costo (en la nube o en infraestructura propia). No se lo transforma al ingresar: esa es la diferencia con el clásico ETL, donde primero se limpia y modela y recién después se carga. En un data lake suele invertirse el orden (cargar primero, transformar después), porque el objetivo es no perder nada y decidir el modelado cuando aparece la pregunta de negocio.

Un data lake bien gestionado se organiza por zonas, normalmente tres:

  • Zona cruda (raw): el dato tal cual llegó de la fuente, sin tocar. Es la copia fiel y auditable.
  • Zona procesada (curada): datos ya limpios, validados y enriquecidos, listos para análisis confiable.
  • Zona de consumo: vistas y conjuntos modelados para tableros, reportes o modelos de machine learning.

Por qué le importa al negocio

El valor real de un data lake no es guardar por guardar: es habilitar preguntas que antes no se podían responder. Al concentrar en un solo lugar datos de ventas, marketing, logística y finanzas, una empresa puede cruzar información que vivía en silos. También es el insumo natural de la IA: los modelos de machine learning y los proyectos de análisis predictivo necesitan grandes volúmenes de datos históricos crudos para entrenarse, y el data lake es donde viven.

Ejemplo concreto (LATAM)

Pensá en una distribuidora de Consumo Masivo en Argentina. Sus pedidos están en el ERP, las visitas de los vendedores en una app, las fotos de exhibición en otra herramienta y las quejas de clientes en WhatsApp. Por separado, cada fuente cuenta media historia. Volcando todo a un data lake, el equipo puede preguntarse si las sucursales con mejor exhibición en góndola venden más del SKU promocionado. Esa correlación, imposible con datos aislados, surge al tener todo bajo un mismo techo. Después, una capa de analítica modela esos datos crudos en métricas comparables.

Data lake vs data warehouse

Es la comparación más útil para entender el concepto. No son rivales: muchas empresas usan los dos, y el data lake suele alimentar al warehouse.

AspectoData lakeData warehouse
Tipo de datoCrudo: estructurado, semi y no estructuradoEstructurado y modelado
EsquemaEn lectura (schema-on-read)En escritura (schema-on-write)
Costo de almacenamientoBajoMás alto
Usuario típicoCientífico de datos, ingenieroAnalista de negocio, gerencia
Uso principalExploración, IA, datos sin destino fijoReportes y métricas conocidas
Riesgo principalConvertirse en pantano de datosRigidez ante nuevos tipos de dato

El error más común: el data swamp

El mayor riesgo de un data lake es degenerar en un pantano de datos (data swamp): un depósito gigante donde nadie sabe qué hay, de dónde vino ni si es confiable. Sin gobierno de datos, catálogo y metadatos, el lago se vuelve inservible. Por eso un data lake sano es inseparable del gobierno de datos y de la calidad del dato: no alcanza con acumular, hay que documentar el linaje, controlar accesos y garantizar que el dato curado sea creíble. Otros errores frecuentes son tratarlo como un simple disco de respaldo, no separar las zonas crudas de las consumibles, y subir datos sin ninguna política de retención ni catalogación.

Compartir
Preguntas frecuentes

Preguntas frecuentes sobre Data lake

¿Qué es un data lake?

Un data lake, o lago de datos, es un repositorio central que almacena grandes volúmenes de datos en su formato crudo y original, sin transformarlos al ingresar. Acepta datos estructurados (tablas), semiestructurados (JSON, logs) y no estructurados (imágenes, audio, texto libre), y aplica la estructura recién cuando se consultan. Su ventaja es la flexibilidad y el bajo costo para guardar todo lo que una empresa genera, incluso datos cuyo uso futuro todavía no está definido.

¿Cuál es la diferencia entre un data lake y un data warehouse?

La diferencia clave está en cómo tratan el dato. Un data warehouse guarda datos ya estructurados y modelados, definiendo el esquema al escribir (schema-on-write), y sirve para reportes y métricas conocidas. Un data lake guarda datos crudos de cualquier tipo y define la estructura recién al leer (schema-on-read), lo que lo hace ideal para exploración, ciencia de datos e inteligencia artificial. No son excluyentes: muchas empresas usan ambos, y el data lake suele alimentar al warehouse.

¿Qué es un data swamp o pantano de datos?

Un data swamp es un data lake que se degeneró por falta de gestión: un depósito enorme de datos donde nadie sabe qué hay, de dónde vino ni si es confiable, por lo que se vuelve prácticamente inservible. Ocurre cuando se acumulan datos sin gobierno, sin catálogo, sin metadatos ni control de calidad. Para evitarlo hay que documentar el linaje del dato, organizar el lago en zonas (cruda, curada y de consumo), controlar accesos y aplicar políticas claras de retención y catalogación.

¿Para qué sirve un data lake en una empresa?

Sirve para concentrar en un solo lugar datos que normalmente viven en silos: ventas, marketing, logística, finanzas, atención al cliente. Al tenerlos juntos y en formato crudo, la empresa puede cruzar información y responder preguntas de negocio que antes eran imposibles. Además es el insumo natural de la inteligencia artificial, porque los modelos de machine learning y los proyectos de análisis predictivo necesitan grandes volúmenes de datos históricos para entrenarse, y esos datos viven en el data lake.

¿Un data lake reemplaza a una base de datos tradicional?

No, cumplen roles distintos. Una base de datos relacional o transaccional está optimizada para operaciones del día a día, con datos estructurados, consultas rápidas y consistencia inmediata. Un data lake está pensado para almacenar masivamente datos crudos de cualquier tipo con fines analíticos y de exploración, no para operar el negocio en tiempo real. En la mayoría de las arquitecturas conviven: las bases operativas alimentan al data lake, y desde ahí se construye la analítica y la IA.

Herramienta gratuita
Dirección / Datos

Calculadora del Cuello de Botella de BI

Cuánto cuesta cada 'te lo paso mañana'.

Abrir la herramienta

Este número, actualizado solo

Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.

El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.

Seguí explorando

Términos relacionados

Del glosario

Preguntas relacionadas

Lo resolvemos con

Metrix

Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.

Así lo resuelve Metrix
En Pulse

Seguí leyendo en Pulse

La suite completa

Ahora que sabés qué es, mirá cómo se resuelve

Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.