Data quality
Término 82 de 314 · Tema
En una frase
Data quality (calidad de datos) es el grado en que los datos de una organización son exactos, completos, consistentes, vigentes y únicos para el uso que se les quiere dar. Cuando es alta, las decisiones, reportes y modelos de IA son confiables.
Data quality (calidad de datos) es la medida de qué tan aptos son los datos de una empresa para el propósito que se les quiere dar: tomar decisiones, alimentar reportes, disparar automatizaciones o entrenar modelos de IA. No es un valor absoluto, sino relativo al uso: un padrón de clientes puede ser "suficientemente bueno" para enviar un mailing pero inservible para una conciliación contable.
En la práctica se evalúa con un conjunto de dimensiones medibles (exactitud, completitud, consistencia, vigencia, unicidad y validez) que permiten cuantificar el estado de un dataset y monitorear su evolución en el tiempo. La calidad de datos es la base sobre la que se apoya cualquier iniciativa analítica seria: es lo que vuelve confiable un dashboard o un KPI, y es parte de lo que mide y mejora Metrix al consolidar fuentes dispersas en una capa de información gobernada.
A diferencia del gobierno de datos, que define las políticas y responsabilidades sobre el dato, la calidad de datos es el resultado operativo que esas políticas buscan asegurar.
Por qué importa
La regla de oro de la analítica sigue vigente: "basura entra, basura sale". Un modelo de forecast de ventas entrenado sobre oportunidades mal cargadas predice mal; un reporte de cobranza con clientes duplicados infla la cartera; un agente de IA que responde sobre datos desactualizados alucina con tono de seguridad. La calidad de datos no es un problema de limpieza puntual, sino una propiedad continua que se degrada sola: la gente cambia de mail, las empresas cambian de CUIT, los sistemas se integran a medias. Por eso se mide y se monitorea, no se "arregla una vez".
Las dimensiones de la calidad de datos
La forma estándar de operacionalizar el concepto es medir cada dimensión por separado, idealmente como porcentaje sobre el total de registros:
| Dimensión | Qué mide | Ejemplo de falla |
|---|---|---|
| Exactitud | Si el dato refleja la realidad | Un domicilio cargado mal en el CRM |
| Completitud | Si no faltan campos requeridos | Contactos sin teléfono ni mail |
| Consistencia | Si el dato coincide entre sistemas | Un cliente "activo" en el ERP y "baja" en el CRM |
| Vigencia | Si el dato está actualizado | Un precio de lista del año pasado |
| Unicidad | Si no hay duplicados | La misma empresa cargada tres veces |
| Validez | Si respeta el formato o las reglas | Un CUIT con menos de 11 dígitos |
Cómo se trabaja en la práctica
Llevar la calidad de datos a un nivel confiable suele combinar varios frentes:
- Perfilado (data profiling): analizar un dataset para detectar nulos, duplicados, valores fuera de rango y formatos rotos antes de confiar en él.
- Reglas de validación en el punto de entrada, para que el dato malo no entre (por ejemplo, una regla de validación de Salesforce que exige un CUIT bien formado).
- Deduplicación y matching para resolver el mismo cliente cargado varias veces y avanzar hacia una única fuente de verdad.
- Enriquecimiento con fuentes externas confiables (padrones, geolocalización) para completar lo que falta.
- Monitoreo continuo con métricas de calidad sobre un dashboard, de modo que el deterioro se detecte temprano y no recién cuando un reporte da números absurdos.
Ejemplo concreto (Argentina, LATAM)
Una distribuidora mayorista en Argentina arma su forecast trimestral combinando datos del ERP, del CRM y de planillas de los vendedores. Al consolidar descubre que buena parte de sus clientes está duplicada (Sociedad A figura como "Soc. A", "Sociedad A SRL" y "SOCIEDAD A"), que faltan condiciones de pago en buena parte de la cartera y que varios CUIT están mal tipeados. Sin resolver eso, cualquier análisis de ventas por cliente o de rotación de inventario parte de una base falsa. El trabajo de calidad de datos (deduplicar, validar CUIT contra el padrón, completar condiciones de pago) es lo que vuelve utilizable todo lo que viene después.
Errores comunes
- Tratarla como un proyecto único de limpieza, en vez de un proceso continuo con métricas.
- Limpiar el dato en el reporte (en una planilla aguas abajo) en lugar de corregirlo en el sistema origen, lo que perpetúa el problema.
- Apuntar a "datos perfectos" en vez de "datos aptos para el uso": el nivel de calidad necesario depende de para qué se usa el dato.
- Asumir que migrar a una herramienta nueva mejora la calidad: si se migra dato sucio, se obtiene dato sucio en una interfaz más linda.
En qué se diferencia del gobierno de datos
| Aspecto | Data quality | Gobierno de datos |
|---|---|---|
| Qué es | El estado del dato (apto o no) | Las políticas y roles sobre el dato |
| Pregunta que responde | ¿Puedo confiar en este dato? | ¿Quién es dueño y qué reglas rigen? |
| Naturaleza | Métrica medible y monitoreable | Marco organizativo y normativo |
| Relación | Es el resultado que el gobierno busca asegurar | Es el sistema que sostiene la calidad |
En resumen, la calidad de datos es la condición que separa un tablero confiable de uno engañoso. En contextos de IA y analítica avanzada su peso solo crece: los modelos amplifican tanto las buenas como las malas decisiones que arrastran los datos con los que se los alimenta.
Preguntas frecuentes sobre Data quality
¿Qué es data quality o calidad de datos?
¿Qué es data quality o calidad de datos?
La calidad de datos (data quality) es el grado en que los datos de una organización son aptos para el uso que se les quiere dar: tomar decisiones, generar reportes, automatizar procesos o entrenar modelos de IA. Se evalúa con dimensiones medibles como exactitud, completitud, consistencia, vigencia, unicidad y validez. Es una propiedad relativa al propósito: un dato puede ser suficientemente bueno para una tarea e inservible para otra.
¿Cuáles son las dimensiones de la calidad de datos?
¿Cuáles son las dimensiones de la calidad de datos?
Las seis dimensiones más usadas son: exactitud (si el dato refleja la realidad), completitud (si no faltan campos requeridos), consistencia (si coincide entre sistemas), vigencia (si está actualizado), unicidad (si no hay duplicados) y validez (si respeta el formato o las reglas de negocio). Medir cada una por separado, como porcentaje sobre el total de registros, permite cuantificar el estado de un conjunto de datos y monitorear su evolución.
¿Por qué la calidad de datos es importante para la IA y la analítica?
¿Por qué la calidad de datos es importante para la IA y la analítica?
Porque los reportes, los modelos y los agentes de IA solo son tan confiables como los datos que los alimentan. Un forecast entrenado sobre datos sucios predice mal, un dashboard con duplicados muestra números falsos y un agente de IA con datos desactualizados puede responder con errores presentados con tono de certeza. La IA amplifica tanto los datos buenos como los malos, por eso la calidad es un requisito previo, no un detalle posterior.
¿Qué diferencia hay entre calidad de datos y gobierno de datos?
¿Qué diferencia hay entre calidad de datos y gobierno de datos?
El gobierno de datos define las políticas, los responsables y las reglas sobre cómo se gestiona el dato en la organización. La calidad de datos es el resultado operativo que esas políticas buscan asegurar: el estado concreto del dato, medible y monitoreable. Dicho simple, el gobierno responde quién es dueño y qué reglas rigen, mientras que la calidad responde si se puede confiar en el dato.
¿Cómo se mejora la calidad de los datos en una empresa?
¿Cómo se mejora la calidad de los datos en una empresa?
Se combina perfilado de datos para detectar problemas, reglas de validación en el punto de entrada para que el dato malo no ingrese, deduplicación y matching para resolver registros repetidos, enriquecimiento con fuentes externas confiables y monitoreo continuo con métricas de calidad. La clave es corregir el dato en el sistema origen, no en la planilla del reporte, y tratarla como un proceso continuo y no como una limpieza puntual.
Calculadora del Cuello de Botella de BI
Cuánto cuesta cada 'te lo paso mañana'.
Abrir la herramientaEste número, actualizado solo
Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- Gobierno de datosEl gobierno de datos es el conjunto de políticas, roles y procesos que define quién puede usar qué datos, cómo y para qué, garantizando que la información sea confiable, segura y consistente en toda la organización.
- Única fuente de verdadLa única fuente de verdad (SSOT) es la práctica de centralizar cada dato del negocio en un único repositorio autoritativo, para que todos los sistemas y equipos lean el mismo valor confiable en vez de copias dispersas que se contradicen.
- Data warehouseUn data warehouse es un repositorio central que integra datos de múltiples sistemas, ya limpios y estructurados, optimizado para consultas analíticas y reportes. A diferencia de una base operativa, está pensado para responder preguntas de negocio sobre datos históricos.
- ETLETL (Extract, Transform, Load) es el proceso que extrae datos de varias fuentes, los transforma a un formato limpio y consistente, y los carga en un destino central como un data warehouse para analizarlos de forma confiable.
- ELTEl ELT es un enfoque de integración de datos que extrae la información de las fuentes, la carga cruda en el destino, habitualmente un data warehouse en la nube, y recién ahí la transforma, aprovechando el cómputo del propio almacén.
- EmbeddingsLos embeddings son representaciones numéricas (vectores) que codifican el significado de un texto, imagen o dato, de modo que conceptos parecidos quedan cerca en el espacio. Permiten que la IA mida similitud semántica y busque por sentido, no por palabras exactas.
Preguntas relacionadas
Metrix
Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.
Así lo resuelve MetrixSeguí leyendo en Pulse
Masterclass » Desarrollar con IA en Salesforce: Casos reales y los Trucos [que nadie te cuenta]
Descubrí cómo la IA transforma el desarrollo en Salesforce. Aprendé a usar prototipos funcionales y MCP para validar requisitos, optimizar flujos de trabajo y entregar proyectos más rápido con Vantegr
La IA no le va a Responder todo a tu Equipo: Le va a responder bien lo que importa [y eso vale oro]
El text-to-SQL en producción todavía falla más de lo que el marketing admite. Pero el BI conversacional resuelve bien las preguntas frecuentes, y hoy solo el 25% de tus empleados usa los datos. La verdad sobre la analítica con IA.
Lo que la inteligencia artificial le está haciendo a la logística (y casi nadie lo está aprovechando)
Descubrí cómo la inteligencia artificial en la logística reduce costos, optimiza la última milla y predice la demanda con datos reales. Una guía práctica para empezar hoy, sin transformar todo de golpe.
Ahora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.


