GlosarioTecnología

Base de datos vectorial

Término 32 de 314 · Tecnología

En una frase

Una base de datos vectorial es un motor que almacena datos como vectores numéricos (embeddings) y los busca por similitud semántica, no por coincidencia exacta. Es la pieza que permite a un sistema de IA encontrar información relevante por significado.

Definición

Una base de datos vectorial es un tipo de motor de almacenamiento diseñado para guardar y consultar datos representados como vectores numéricos, llamados embeddings. En lugar de buscar por coincidencia exacta de texto (como hace una base SQL tradicional al pedir el registro cuyo nombre es exactamente "Juan"), busca por similitud semántica: encuentra los elementos cuyo significado está más cerca del de tu consulta, aunque no compartan ni una sola palabra.

La idea central es que cada texto, imagen o documento se convierte en una lista de cientos o miles de números que captura su significado. Documentos parecidos quedan cerca en ese espacio matemático; los distintos quedan lejos. La base de datos vectorial es lo que hace que esa búsqueda por cercanía sea rápida y escalable sobre millones de registros, usando índices especializados.

Es la pieza de infraestructura que sostiene a los patrones de IA modernos como RAG y a muchos agentes de IA: primero se recupera el contexto relevante desde el índice vectorial y luego se le pasa al modelo. En el ecosistema de datos y analítica que ordena Metrix, entender este componente ayuda a ver de dónde sale el conocimiento que alimenta a un asistente o copiloto.

Cómo funciona, paso a paso

El flujo de una base de datos vectorial tiene tres momentos claros. Primero, el contenido (un párrafo de un manual, una pregunta frecuente, la descripción de un producto) pasa por un modelo de IA que lo convierte en un embedding, es decir, un vector de cientos o miles de dimensiones. Segundo, ese vector se guarda junto a su metadato (el texto original, la fecha, la categoría) dentro de un índice optimizado para buscar por cercanía. Tercero, cuando llega una consulta, se la convierte al mismo espacio vectorial y la base devuelve los k vecinos más cercanos, los registros semánticamente más parecidos.

La magia de escala está en ese índice. Comparar una consulta contra millones de vectores uno por uno sería lentísimo, así que estas bases usan algoritmos de búsqueda aproximada de vecinos cercanos (ANN, como HNSW o IVF) que sacrifican una pizca de precisión a cambio de respuestas en milisegundos. Para medir cercanía suelen usar similitud de coseno o distancia euclidiana.

Por qué importa para un negocio

La razón práctica es simple: cambia la búsqueda exacta por la búsqueda por significado. Un cliente que escribe "no me anda el pago con tarjeta" debería encontrar el artículo titulado "Errores frecuentes en el checkout", aunque no comparta ninguna palabra clave. Eso es lo que habilita asistentes que responden sobre tu propia documentación, chatbots que citan tus políticas reales y motores de recomendación que entienden parecidos sutiles.

Un ejemplo concreto (LATAM)

Una distribuidora mayorista en Argentina tiene 12.000 fichas técnicas de productos y un equipo de atención que pierde tiempo buscándolas. Cargan todas las fichas en una base de datos vectorial y montan un asistente con RAG. Cuando un vendedor pregunta "¿qué bomba sirve para agua con arena?", el sistema no busca la palabra "arena": recupera por significado las fichas de bombas para líquidos abrasivos y se las pasa al modelo, que arma una respuesta citando el código de cada producto. Sin la base vectorial, ese asistente alucinaría o no encontraría nada.

Errores comunes a evitar

  • Pensar que reemplaza a la base de datos transaccional: convive con ella, no la sustituye. La vectorial guarda significado; la relacional sigue siendo la verdad de stock, precios y clientes.
  • Olvidar los metadatos y los filtros: si no podés filtrar por cliente, idioma o fecha, la búsqueda semántica trae resultados irrelevantes o mezcla datos de quien no corresponde.
  • Subestimar el costo de re-generar embeddings: si cambiás el modelo que genera los vectores, normalmente tenés que re-indexar todo el contenido.
  • Confundir similitud con verdad: que un texto sea semánticamente parecido no garantiza que sea correcto; por eso el patrón completo (recuperar y luego razonar) sigue necesitando buenos datos de origen.

En qué se diferencia de una base de datos tradicional

AspectoBase de datos relacionalBase de datos vectorial
Unidad que guardaFilas y columnasVectores (embeddings) + metadato
Tipo de búsquedaExacta y por rangos (SQL)Por similitud semántica
Pregunta típica"Clientes con saldo mayor a X""Documentos parecidos a este"
Dato idealEstructuradoNo estructurado (texto, imágenes)
Caso de uso estrellaTransacciones, reportesRAG, asistentes, recomendación

En la práctica las dos trabajan juntas: la relacional ordena lo estructurado (un data warehouse clásico) y la vectorial abre la puerta a los datos no estructurados. Por eso una base vectorial no es un reemplazo del stack de datos, sino una capa nueva que lo extiende hacia la IA generativa.

Compartir
Preguntas frecuentes

Preguntas frecuentes sobre Base de datos vectorial

¿Qué es una base de datos vectorial?

Es un motor de almacenamiento que guarda datos como vectores numéricos (embeddings) y los consulta por similitud semántica en vez de por coincidencia exacta. Convierte textos, imágenes o documentos en listas de números que capturan su significado, y al recibir una consulta devuelve los elementos más parecidos. Es la pieza de infraestructura que permite a sistemas de IA encontrar información relevante por significado, base de patrones como RAG y de muchos asistentes y agentes.

¿Para qué sirve una base de datos vectorial?

Sirve para buscar por significado en lugar de por palabra exacta. Habilita asistentes que responden sobre la documentación propia de una empresa, chatbots que citan políticas reales, motores de recomendación que entienden parecidos sutiles y la recuperación de contexto en sistemas RAG. En la práctica, es lo que permite que un usuario encuentre el artículo correcto aunque no use ninguna de las palabras clave originales del documento.

¿En qué se diferencia de una base de datos tradicional?

Una base relacional guarda filas y columnas y busca de forma exacta o por rangos con SQL, ideal para transacciones, stock y reportes. Una base vectorial guarda embeddings (vectores numéricos) y busca por similitud semántica, ideal para texto e imágenes no estructurados. No se reemplazan: conviven. La relacional sigue siendo la verdad de los datos estructurados y la vectorial agrega una capa nueva orientada a la IA generativa.

¿Qué relación tiene con RAG y los embeddings?

Son tres piezas del mismo flujo. Los embeddings son los vectores que representan el significado de cada contenido. La base de datos vectorial los almacena e indexa para buscarlos rápido por cercanía. RAG (Retrieval Augmented Generation) es el patrón que primero recupera desde esa base los fragmentos relevantes y luego se los pasa a un modelo de lenguaje para que genere una respuesta fundamentada. Sin la base vectorial, RAG no tendría de dónde recuperar el contexto.

¿Necesito una base de datos vectorial para usar IA en mi empresa?

Depende del caso. Si solo usás un modelo para tareas generales (redactar, traducir, resumir un texto que pegás a mano) no hace falta. La necesitás cuando querés que la IA responda sobre tu conocimiento propio: manuales, fichas de producto, historial de tickets o políticas internas. Ahí la base vectorial es la que permite recuperar el fragmento correcto entre miles de documentos para que el modelo responda con datos tuyos y no invente.

Herramienta gratuita
Dirección / Datos

Calculadora del Cuello de Botella de BI

Cuánto cuesta cada 'te lo paso mañana'.

Abrir la herramienta

Este número, actualizado solo

Metrix conecta tus sistemas y te deja preguntarle a tus datos en lenguaje natural: el indicador que acabás de leer, al día, sin esperar la cola del equipo de BI ni rearmar el Excel a fin de mes.

El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.

Seguí explorando

Términos relacionados

Del glosario

Preguntas relacionadas

Lo resolvemos con

Metrix

Preguntale a tus datos en lenguaje natural y recibí el reporte al instante, sin esperar la cola del equipo de BI.

Así lo resuelve Metrix
En Pulse

Seguí leyendo en Pulse

La suite completa

Ahora que sabés qué es, mirá cómo se resuelve

Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.