Linaje de datos
Término 154 de 314 · Tecnología
En una frase
El linaje de datos es la trazabilidad completa de un dato desde su origen hasta su consumo, incluyendo cada transformación, sistema y proceso por el que pasó. Permite responder de dónde salió un número en un reporte, cómo se calculó y qué fuentes lo alimentan.
El linaje de datos (data lineage) es la trazabilidad completa del recorrido de un dato desde su origen hasta su consumo final, registrando cada sistema, transformación y proceso por el que pasó. Responde tres preguntas que toda organización necesita poder contestar sobre su información: de dónde salió un número, cómo se calculó y qué fuentes lo alimentan.
En términos prácticos, el linaje mapea el flujo del dato a lo largo de toda su vida: la tabla de origen en un sistema transaccional, los pasos de un pipeline de ETL o ELT que lo limpian y combinan, la vista o el modelo intermedio donde se agrega y, al final, la celda de un tablero o la fila de un reporte que ve el usuario. Ese mapa puede describirse a nivel de tabla (qué tablas alimentan a qué tablas) o al detalle más fino de nivel de columna (qué campo específico deriva de qué otro).
El valor concreto es que convierte un reporte opaco en algo auditable y explicable. Cuando un número no cuadra, en lugar de revisar a mano decenas de consultas, se sigue el rastro hacia atrás hasta encontrar la transformación o la fuente que lo rompió. Mantener ese mapa vivo y consultable, en vez de reconstruirlo a mano cada vez, es parte de lo que resuelve una capa de analítica como Metrix.
El linaje de datos responde una pregunta que parece simple pero que en la mayoría de las empresas nadie puede contestar con certeza: ese número del tablero, ¿de dónde salió exactamente? A medida que el dato viaja por sistemas, pipelines y transformaciones, el rastro se pierde, y con él la confianza. Documentar ese recorrido de punta a punta es lo que hace el linaje.
Qué registra exactamente
Un buen linaje no dice solamente que dos tablas están conectadas: documenta el recorrido completo y el detalle de cada salto. En su forma más rica incluye:
- Origen (source): el sistema o la tabla donde nació el dato, por ejemplo el CRM, el ERP o un formulario web.
- Transformaciones: cada paso que modificó el dato en el camino, un join, un filtro, una agregación, una conversión de moneda o una regla de negocio aplicada en un pipeline.
- Destino (target): dónde se consume al final, un tablero, un reporte regulatorio, un modelo de machine learning o una exportación a otro sistema.
- Metadatos del salto: quién definió la lógica, cuándo corrió por última vez y con qué reglas, para poder reconstruir el porqué de cada número.
Nivel de tabla y nivel de columna
El linaje se describe con distinta granularidad. El linaje a nivel de tabla muestra qué tablas alimentan a qué tablas: es rápido de generar y sirve para entender el flujo general. El linaje a nivel de columna (column-level lineage) baja al campo individual: muestra que la columna "ingreso neto" de un tablero deriva de "monto bruto" menos "impuestos", tomados de dos tablas distintas. El nivel de columna es el más útil para auditar y para el análisis de impacto, pero también el más caro de mantener.
Cómo se captura
Reconstruir el linaje a mano no escala, así que se combinan varias técnicas automáticas y manuales:
- Parsing de consultas SQL: herramientas que leen el código de los pipelines y deducen qué alimenta a qué.
- Metadatos de las herramientas de integración: los motores de ETL o ELT y de orquestación ya conocen el mapa de dependencias y lo exponen.
- Etiquetado manual: documentación que agregan los equipos de datos, indispensable para capturar las reglas de negocio.
- Análisis de ejecución y logs: observar qué corrió realmente, no solo lo que estaba definido en el diseño.
Linaje técnico y linaje de negocio
Conviven dos vistas del mismo recorrido. El linaje técnico habla el idioma de la infraestructura: tablas, columnas, jobs y consultas, y sirve a los equipos de datos e ingeniería. El linaje de negocio traduce ese recorrido a conceptos que entiende un gerente: de qué sistema fuente proviene la métrica "ventas del mes", qué área es dueña de ese dato y qué definición oficial tiene. Un linaje completo enlaza ambas capas, para que técnicos y usuarios de negocio miren la misma verdad desde su ángulo.
Por qué le importa a una empresa de LATAM
El linaje deja de ser un lujo cuando el dato tiene consecuencias. En servicios financieros, salud, farmacéutica o manufactura, un reporte regulatorio o un tablero de directorio tiene que ser defendible: si un auditor o un ente de control pregunta cómo se calculó una cifra, hay que poder mostrar el recorrido, no improvisarlo. El linaje también habilita el análisis de impacto: antes de cambiar una columna en un sistema fuente, se ve qué reportes y modelos aguas abajo se van a romper. Y a la inversa, permite el análisis de causa raíz: cuando un número aparece mal, se rastrea hacia atrás hasta la fuente que lo ensució. En el fondo, todo esto construye lo más valioso y lo más frágil de un área de datos, la confianza en los reportes.
Diferencias con términos vecinos
El linaje suele confundirse con conceptos cercanos de la gestión de datos, pero cada uno responde a una pregunta distinta:
| Concepto | Pregunta que responde |
|---|---|
| Linaje de datos | ¿Por dónde pasó este dato, de la fuente al reporte? |
| Catálogo de datos | ¿Qué datos existen y dónde están? |
| Gobernanza de datos | ¿Quién puede hacer qué con los datos y bajo qué reglas? |
| Calidad de datos | ¿Son los datos correctos, completos y consistentes? |
Son piezas complementarias: el catálogo inventaria, la gobernanza pone las reglas, la calidad mide la salud del dato y el linaje muestra el recorrido que conecta todo. En la práctica, un buen linaje es además una herramienta de calidad, porque el rastro es justo lo que permite encontrar dónde se degradó un dato.
En la práctica
El linaje se vuelve tangible el día que un número no cierra. Un tablero de ingresos marca una caída del 12% que nadie explica; con el linaje a nivel de columna, el equipo sigue el rastro hasta un cambio de esquema en el sistema de facturación que dejó de mapear una categoría de productos. Sin linaje, eso son días de revisar consultas a ciegas; con linaje, son minutos. Ese rastreo hacia atrás, y su inverso para anticipar qué se rompe antes de tocar algo, es lo que sostiene una analítica en la que el negocio realmente confía.
Rastrear un número que no cuadra
Un analista de una empresa de servicios financieros ve que el tablero de ingresos del mes cayó 12% sin explicación. Con el linaje a nivel de columna sigue el rastro hacia atrás y descubre que un cambio de esquema en el sistema de facturación dejó de mapear una categoría de productos. Lo que sin linaje serían días de revisar consultas a ciegas, se resuelve en minutos y con evidencia.
Análisis de impacto antes de un cambio
El equipo de ingeniería de datos necesita renombrar una columna en el ERP. Antes de tocarla, consulta el linaje aguas abajo y ve que ese campo alimenta cuatro tableros de directorio y un modelo de forecasting. Avisa a los dueños de esos reportes y ajusta los pipelines en el mismo cambio, evitando que un dato crítico aparezca en blanco el lunes.
Preguntas frecuentes sobre Linaje de datos
¿Qué es el linaje de datos?
¿Qué es el linaje de datos?
El linaje de datos es la trazabilidad completa del recorrido de un dato, desde el sistema donde nació hasta el reporte o modelo donde se consume, registrando cada transformación intermedia. Sirve para responder de dónde salió un número, cómo se calculó y qué fuentes lo alimentan, lo que vuelve la información auditable y confiable para todo el negocio.
¿Para qué sirve el linaje de datos?
¿Para qué sirve el linaje de datos?
Sirve para tres cosas principales: auditar y demostrar cómo se calculó una cifra ante un control o un directorio, hacer análisis de impacto para saber qué reportes se rompen si se cambia una fuente, y rastrear la causa raíz cuando un número aparece mal. En conjunto, construye confianza en los tableros y reportes de la organización.
¿Cuál es la diferencia entre linaje de datos y gobernanza de datos?
¿Cuál es la diferencia entre linaje de datos y gobernanza de datos?
El linaje describe el recorrido técnico del dato, por dónde pasó y cómo se transformó de la fuente al reporte. La gobernanza de datos define las reglas, quién es dueño de cada dato, quién puede usarlo y bajo qué políticas. Son complementarios: el linaje suele ser una de las evidencias que la gobernanza necesita para funcionar.
¿Qué diferencia hay entre linaje a nivel de tabla y a nivel de columna?
¿Qué diferencia hay entre linaje a nivel de tabla y a nivel de columna?
El linaje a nivel de tabla muestra qué tablas alimentan a qué tablas, una vista general y rápida de generar. El linaje a nivel de columna baja al campo individual y muestra de qué columnas concretas deriva cada valor. El nivel de columna es más preciso para auditar y para el análisis de impacto, pero más costoso de mantener.
Calculadora del Cuello de Botella de BI
Cuánto cuesta cada 'te lo paso mañana'.
Abrir la herramientaEste número, actualizado solo
Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- Gobernanza de datosLa gobernanza de datos es el marco de políticas, roles y responsabilidades que define quién puede acceder a los datos de una empresa, quién los mantiene y bajo qué reglas se usan. Trata los datos como un activo, con un dueño claro para cada dominio.
- Catálogo de datosEl catálogo de datos es el inventario documentado de todos los activos de datos de una organización (tablas, bases, archivos y reportes), descritos con metadatos que permiten encontrarlos, entenderlos y usarlos con confianza. Funciona como el índice de una biblioteca: no guarda el contenido.
- ETLETL (Extract, Transform, Load) es el proceso que extrae datos de varias fuentes, los transforma a un formato limpio y consistente, y los carga en un destino central como un data warehouse para analizarlos de forma confiable.
- Mantenimiento predictivoEl mantenimiento predictivo es una estrategia que usa datos de sensores y modelos analíticos para anticipar cuándo va a fallar un equipo y repararlo justo antes, evitando paradas no planificadas y reemplazos prematuros de piezas todavía útiles.
- Métrica vs dimensiónLa diferencia entre métrica y dimensión distingue qué se mide de cómo se segmenta: la métrica es el valor cuantitativo que se agrega (cuánto: ventas, sesiones) y la dimensión, el atributo por el que se agrupa ese valor (canal, región, fecha).
- NPSEl NPS (Net Promoter Score) es una métrica que mide la lealtad del cliente con una sola pregunta: qué tan probable es que recomiende tu empresa, de 0 a 10. Se calcula restando el porcentaje de detractores al de promotores.
Preguntas relacionadas
- ¿Qué es el NRR (retención neta de ingresos)?en NRR (retención neta de ingresos)
- ¿Qué es una ontología de datos?en Ontología de datos
- ¿Qué es el pipeline coverage?en Pipeline coverage
- ¿Qué es pipeline velocity?en Pipeline velocity
- ¿Qué es el quota attainment?en Quota attainment
- ¿Qué es el ROAS?en ROAS (retorno de la inversión publicitaria)
Metrix
Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.
Así lo resuelve MetrixSeguí leyendo en Pulse
Masterclass » Desarrollar con IA en Salesforce: Casos reales y los Trucos [que nadie te cuenta]
Descubrí cómo la IA transforma el desarrollo en Salesforce. Aprendé a usar prototipos funcionales y MCP para validar requisitos, optimizar flujos de trabajo y entregar proyectos más rápido con Vantegr
La IA no le va a Responder todo a tu Equipo: Le va a responder bien lo que importa [y eso vale oro]
El text-to-SQL en producción todavía falla más de lo que el marketing admite. Pero el BI conversacional resuelve bien las preguntas frecuentes, y hoy solo el 25% de tus empleados usa los datos. La verdad sobre la analítica con IA.
Lo que la inteligencia artificial le está haciendo a la logística (y casi nadie lo está aprovechando)
Descubrí cómo la inteligencia artificial en la logística reduce costos, optimiza la última milla y predice la demanda con datos reales. Una guía práctica para empezar hoy, sin transformar todo de golpe.
Ahora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.


