Data warehouse
Término 83 de 314 · Tecnología
En una frase
Un data warehouse es un repositorio central que integra datos de múltiples sistemas, ya limpios y estructurados, optimizado para consultas analíticas y reportes. A diferencia de una base operativa, está pensado para responder preguntas de negocio sobre datos históricos.
Un data warehouse (almacén de datos) es un repositorio central donde se consolidan datos provenientes de muchos sistemas distintos (CRM, ERP, e-commerce, facturación, planillas) ya limpios, integrados y estructurados para el análisis. Su propósito no es operar el negocio del día a día, sino responder preguntas analíticas: cómo evolucionaron las ventas por región, qué clientes están en riesgo de abandono o cuál es el margen real por producto.
La diferencia clave con una base de datos tradicional es la orientación. Una base operativa (OLTP) está optimizada para transacciones rápidas (registrar una venta, actualizar un pedido). El data warehouse usa un modelo analítico (OLAP), optimizado para leer y agregar grandes volúmenes de datos históricos sin frenar los sistemas que están operando. Por eso una consulta pesada de reportería no afecta al sistema de facturación.
Los datos llegan al warehouse mediante procesos de ETL o ELT, que extraen, transforman y cargan la información desde cada fuente. Una vez consolidado, el warehouse se vuelve la base sobre la que corren los tableros y el análisis: es parte del trabajo de integración y modelado de datos que potencia Metrix.
Por qué importa para el negocio
En la mayoría de las empresas la información vive dispersa y duplicada: el equipo comercial mira el CRM, finanzas mira el ERP, marketing mira su plataforma de campañas y nadie comparte las mismas cifras. El resultado típico son reuniones donde cada área llega con un número distinto de ventas para el mismo mes. Un data warehouse resuelve ese problema de raíz al consolidar todo en un solo lugar con definiciones consistentes, acercándose al ideal de una única fuente de verdad.
El valor no es técnico, es de decisión. Cuando los datos están integrados y son confiables, la dirección puede preguntar "¿cuál fue mi cliente más rentable del trimestre?" y obtener una respuesta en segundos, sin esperar dos días a que alguien arme un Excel cruzando exportaciones de cinco sistemas. Esa velocidad para responder preguntas es lo que convierte el dato en ventaja competitiva.
Cómo se estructura por dentro
El corazón del data warehouse es el modelo dimensional, habitualmente un esquema en estrella. Se distingue entre:
- Tablas de hechos: registran los eventos medibles del negocio (cada venta, cada despacho, cada cobro) con sus métricas numéricas (monto, cantidad, costo).
- Tablas de dimensiones: describen el contexto de esos hechos (qué cliente, qué producto, qué fecha, qué región, qué vendedor).
- Capa semántica: traduce los nombres técnicos de las columnas a conceptos de negocio entendibles, para que cualquier usuario consulte "facturación neta" sin saber SQL.
Esta estructura es lo que hace que un dashboard cargue rápido aunque detrás haya millones de filas: las consultas analíticas están pensadas para recorrer hechos y agruparlos por dimensiones de forma eficiente.
Ejemplo concreto en LATAM
Pensá en una empresa de Consumo Masivo en Argentina que vende a supermercados y al canal tradicional. Sus ventas viven en el ERP, los datos de góndola los carga la fuerza de ventas en una app, y las promociones se gestionan en otra herramienta. Sin un warehouse, calcular el sell-out real por marca y región es un trabajo manual de días. Con un data warehouse, esos tres orígenes se cargan a diario, se cruzan automáticamente, y la gerencia comercial ve en un tablero qué SKU rota en qué cadena y dónde hay quiebre de stock, todo con la misma definición de "venta" para todos.
Data warehouse, data lake y data mart
Suelen confundirse. La diferencia está en qué tan estructurado llega el dato y para quién es:
| Concepto | Qué guarda | Cuándo se estructura | Para quién |
|---|---|---|---|
| Data warehouse | Datos limpios e integrados | Antes de cargar (schema-on-write) | Análisis y reportería de negocio |
| Data lake | Datos crudos de cualquier tipo | Al consultar (schema-on-read) | Ciencia de datos, IA, exploración |
| Data mart | Subconjunto temático del warehouse | Ya estructurado | Un área puntual (ventas, finanzas) |
En la práctica conviven: el data lake recibe todo crudo, el data warehouse guarda lo modelado y confiable, y los data marts son recortes para cada equipo.
Errores comunes
- Cargar datos sin gobierno: un warehouse sin reglas de calidad de dato ni un gobierno de datos claro termina siendo un "pantano de datos" en el que nadie confía.
- Confundirlo con un backup: no es un depósito pasivo; su valor está en el modelado y la integración, no en acumular tablas.
- Saltearse la capa semántica: sin nombres de negocio, solo el equipo técnico puede consultarlo y se pierde la autonomía analítica.
- Pensar que reemplaza al CRM o al ERP: convive con ellos. Los sistemas operativos siguen registrando las transacciones; el warehouse las consolida para analizarlas.
Bien implementado, el data warehouse deja de ser un proyecto de IT para convertirse en la infraestructura sobre la que la empresa toma decisiones con datos confiables y compartidos por todas las áreas.
Preguntas frecuentes sobre Data warehouse
¿Qué es un data warehouse?
¿Qué es un data warehouse?
Un data warehouse es un repositorio central donde se consolidan datos de muchos sistemas distintos (CRM, ERP, e-commerce, facturación) ya limpios, integrados y estructurados para el análisis. No sirve para operar el negocio del día a día, sino para responder preguntas analíticas y de reportería sobre datos históricos, como la evolución de ventas, la rentabilidad por cliente o el comportamiento de un producto en el tiempo.
¿Cuál es la diferencia entre un data warehouse y una base de datos?
¿Cuál es la diferencia entre un data warehouse y una base de datos?
Una base de datos tradicional (operativa u OLTP) está optimizada para transacciones rápidas del día a día, como registrar una venta o actualizar un pedido. Un data warehouse usa un modelo analítico (OLAP), optimizado para leer y agregar grandes volúmenes de datos históricos en consultas complejas. Por eso una consulta pesada de reportería en el warehouse no frena los sistemas que están operando el negocio.
¿Cuál es la diferencia entre un data warehouse y un data lake?
¿Cuál es la diferencia entre un data warehouse y un data lake?
Un data warehouse guarda datos ya limpios, integrados y estructurados antes de cargarlos, pensados para análisis y reportería de negocio. Un data lake almacena datos crudos de cualquier tipo (estructurados y no estructurados) y se estructuran recién al momento de consultarlos, lo que lo hace ideal para ciencia de datos, IA y exploración. En arquitecturas modernas conviven: el lake recibe todo crudo y el warehouse guarda lo modelado y confiable.
¿Cómo llegan los datos a un data warehouse?
¿Cómo llegan los datos a un data warehouse?
Los datos llegan mediante procesos de ETL o ELT, que extraen la información desde cada sistema fuente, la transforman para limpiarla e integrarla (unificar formatos, eliminar duplicados, aplicar definiciones de negocio) y la cargan en el warehouse. Estos procesos suelen correr de forma automática y programada, por ejemplo cada noche, para que los datos estén actualizados sin trabajo manual.
¿Para qué sirve un data warehouse en una empresa?
¿Para qué sirve un data warehouse en una empresa?
Sirve para tener una sola versión confiable de los datos y poder responder preguntas de negocio con velocidad. Al consolidar la información de todas las áreas con definiciones consistentes, elimina las discusiones sobre quién tiene el número correcto y permite que tableros y análisis carguen rápido aunque haya millones de registros. Es la base sobre la que se construyen los reportes, los indicadores y, cada vez más, los modelos de IA.
Calculadora del Cuello de Botella de BI
Cuánto cuesta cada 'te lo paso mañana'.
Abrir la herramientaEste número, actualizado solo
Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- ETLETL (Extract, Transform, Load) es el proceso que extrae datos de varias fuentes, los transforma a un formato limpio y consistente, y los carga en un destino central como un data warehouse para analizarlos de forma confiable.
- Data lakeUn data lake es un repositorio central que almacena datos en su formato crudo y a cualquier escala, sin transformarlos al ingresar. Guarda datos estructurados, semiestructurados y no estructurados, y aplica el esquema recién al momento de leerlos.
- Capa semánticaLa capa semántica es una traducción entre los datos técnicos de una empresa y el lenguaje del negocio: define métricas, dimensiones y reglas una sola vez para que todos midan igual sin importar qué herramienta usen.
- Única fuente de verdadLa única fuente de verdad (SSOT) es la práctica de centralizar cada dato del negocio en un único repositorio autoritativo, para que todos los sistemas y equipos lean el mismo valor confiable en vez de copias dispersas que se contradicen.
- ELTEl ELT es un enfoque de integración de datos que extrae la información de las fuentes, la carga cruda en el destino, habitualmente un data warehouse en la nube, y recién ahí la transforma, aprovechando el cómputo del propio almacén.
- EmbeddingsLos embeddings son representaciones numéricas (vectores) que codifican el significado de un texto, imagen o dato, de modo que conceptos parecidos quedan cerca en el espacio. Permiten que la IA mida similitud semántica y busque por sentido, no por palabras exactas.
Preguntas relacionadas
Metrix
Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.
Así lo resuelve MetrixSeguí leyendo en Pulse
Masterclass » Desarrollar con IA en Salesforce: Casos reales y los Trucos [que nadie te cuenta]
Descubrí cómo la IA transforma el desarrollo en Salesforce. Aprendé a usar prototipos funcionales y MCP para validar requisitos, optimizar flujos de trabajo y entregar proyectos más rápido con Vantegr
La IA no le va a Responder todo a tu Equipo: Le va a responder bien lo que importa [y eso vale oro]
El text-to-SQL en producción todavía falla más de lo que el marketing admite. Pero el BI conversacional resuelve bien las preguntas frecuentes, y hoy solo el 25% de tus empleados usa los datos. La verdad sobre la analítica con IA.
Lo que la inteligencia artificial le está haciendo a la logística (y casi nadie lo está aprovechando)
Descubrí cómo la inteligencia artificial en la logística reduce costos, optimiza la última milla y predice la demanda con datos reales. Una guía práctica para empezar hoy, sin transformar todo de golpe.
Ahora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.


