GlosarioTecnología

RAG (Retrieval Augmented Generation)

Término 235 de 314 · Tecnología

En una frase

RAG (generación aumentada por recuperación) es una técnica que conecta un modelo de lenguaje a una fuente de datos externa: recupera los fragmentos relevantes y los inyecta en el prompt para que la IA responda con información actualizada y verificable, en vez de inventarla.

Definición

RAG (en inglés *Retrieval Augmented Generation*, o generación aumentada por recuperación) es una técnica de IA que le da a un modelo de lenguaje acceso a una fuente de conocimiento externa en el momento de responder. En lugar de depender solo de lo que el modelo memorizó durante su entrenamiento, RAG busca primero los documentos o datos relevantes a la pregunta y luego genera la respuesta apoyándose en ese material recuperado.

El flujo tiene dos etapas que le dan el nombre. Primero la recuperación (*retrieval*): el sistema convierte la pregunta del usuario en una búsqueda, normalmente sobre una base de datos vectorial, y trae los fragmentos más parecidos. Después la generación: esos fragmentos se insertan en el prompt junto con la pregunta, y el LLM redacta una respuesta fundamentada en ese contexto. Por eso se dice que RAG aumenta al modelo: le suma información que no estaba en sus parámetros.

Es la arquitectura que permite que un agente de IA responda sobre los documentos, políticas o catálogo de tu empresa en vez de hablar en general. Es parte de la base técnica de los agentes de IA conectados a Salesforce: el agente consulta el conocimiento de la organización antes de contestarle a un cliente.

Por qué existe RAG

Un modelo de lenguaje tiene dos limitaciones estructurales. La primera es la fecha de corte: solo sabe lo que existía hasta el momento de su entrenamiento, así que ignora una política que cambiaste la semana pasada o el stock de hoy. La segunda es que no conoce tus datos privados: nunca vio tu manual de procedimientos, tu base de clientes ni tus contratos. Encima, cuando no sabe algo, el modelo tiende a inventar una respuesta con tono seguro, lo que se conoce como alucinación. RAG ataca los tres problemas a la vez: en lugar de pedirle al modelo que recuerde, le entrega la información correcta en cada consulta.

Cómo funciona, paso a paso

El proceso se arma en dos fases. La fase de preparación ocurre una sola vez (y se repite cuando agregás contenido): se toman los documentos, se parten en fragmentos manejables (*chunks*), se transforman en embeddings (vectores numéricos que capturan el significado) y se guardan en una base de datos vectorial. La fase de consulta ocurre en cada pregunta:

  • El usuario hace una pregunta y el sistema la convierte también en un embedding.
  • Se busca por similitud semántica qué fragmentos guardados se parecen más a la pregunta (no por palabras exactas, sino por significado).
  • Los fragmentos más relevantes se inyectan en el prompt como contexto, una práctica llamada grounding (anclar la respuesta en evidencia).
  • El LLM genera la respuesta usando ese contexto y, idealmente, cita la fuente de donde sacó cada dato.

La clave es que el modelo no aprende nada nuevo de forma permanente: cada respuesta se construye con la información fresca que se le pasó en ese momento, dentro de su ventana de contexto.

Por qué importa para un negocio

RAG es lo que vuelve confiable y auditable a un asistente de IA en un entorno empresarial. Sin RAG, un chatbot de atención podría inventar una condición de garantía; con RAG, responde con el texto exacto de tu política y muestra de qué documento lo sacó. Hay tres beneficios concretos: la respuesta queda siempre actualizada (basta actualizar el documento fuente, sin reentrenar nada), se reduce drásticamente la invención de datos, y el equipo de cumplimiento puede rastrear el origen de cada afirmación.

Ejemplo concreto (LATAM)

Una distribuidora mayorista en Argentina monta un agente de IA sobre WhatsApp para que sus vendedores consulten precios, condiciones de pago y disponibilidad. La lista de precios cambia cada 15 días por inflación. Con un modelo pelado sería imposible: respondería con precios viejos o inventados. Con RAG, cada vez que un vendedor pregunta cuál es el precio de un SKU para un cliente puntual, el agente recupera la lista vigente y la grilla de descuentos de ese cliente desde el sistema, y genera una respuesta exacta citando la lista del día. Cuando el área comercial sube la lista nueva, el agente queda actualizado al instante, sin tocar el modelo.

RAG frente a fine-tuning

Es la comparación más útil para entender RAG, porque son dos formas distintas de especializar una IA y suelen confundirse. El fine-tuning reentrena el modelo para que cambie su comportamiento o estilo; RAG le da datos frescos sin tocar el modelo. No compiten: muchas soluciones serias usan las dos.

AspectoRAGFine-tuning
Qué cambiaEl contexto que recibe el modeloLos parámetros del propio modelo
Bueno paraConocimiento que cambia (precios, políticas, catálogo)Estilo, tono, formato y tareas específicas
Actualizar informaciónEditar el documento fuente (inmediato)Reentrenar (lento y costoso)
Riesgo de alucinarBajo (responde con evidencia citada)Sigue siendo alto si el dato no está
Costo de arranqueMás bajoMás alto
TrazabilidadAlta (cita la fuente)Baja (el dato queda diluido)

Errores comunes al implementar RAG

  • Fragmentar mal los documentos: chunks demasiado grandes o cortados a la mitad de una idea hacen que la búsqueda traiga contexto pobre y la respuesta falle.
  • Confundir RAG con búsqueda por palabras clave: RAG busca por significado (semántica), no por coincidencia de texto; encontrar un número de factura exacto a veces requiere combinar ambos métodos (búsqueda híbrida).
  • No mostrar las fuentes: si el agente no cita de dónde sacó cada dato, se pierde la principal ventaja de auditabilidad.
  • Creer que RAG elimina toda alucinación: la reduce mucho, pero si el documento correcto no se recupera, el modelo puede igual inventar. Por eso conviene sumar guardrails y, en casos sensibles, un human-in-the-loop.

En definitiva, RAG es hoy la arquitectura por defecto para llevar la IA generativa a casos de negocio reales: combina la fluidez del lenguaje del modelo con la precisión y actualidad de tus propios datos, sin el costo ni la opacidad de reentrenar.

Compartir
Preguntas frecuentes

Preguntas frecuentes sobre RAG (Retrieval Augmented Generation)

¿Qué es RAG (Retrieval Augmented Generation)?

RAG, o generación aumentada por recuperación, es una técnica de IA que conecta un modelo de lenguaje a una fuente de datos externa. Antes de responder, el sistema recupera los fragmentos de información más relevantes para la pregunta y los inyecta en el prompt, de modo que la IA genera la respuesta apoyándose en ese material en lugar de depender solo de lo que memorizó durante su entrenamiento. Esto permite respuestas actualizadas, basadas en tus propios documentos y con la fuente verificable.

¿Cuál es la diferencia entre RAG y fine-tuning?

Son dos formas distintas de especializar una IA. El fine-tuning reentrena el modelo para cambiar su estilo, tono o comportamiento, modificando sus parámetros internos; es costoso y lento de actualizar. RAG, en cambio, no toca el modelo: le entrega datos frescos en cada consulta recuperándolos de una fuente externa. RAG es ideal para conocimiento que cambia seguido, como precios o políticas, mientras que el fine-tuning sirve para ajustar la forma de responder. No son excluyentes: muchas soluciones combinan ambas.

¿RAG elimina las alucinaciones de la IA?

Las reduce mucho, pero no las elimina por completo. Al obligar al modelo a responder con base en documentos recuperados y a citar la fuente, RAG disminuye drásticamente la probabilidad de que invente datos. Sin embargo, si el sistema no logra recuperar el fragmento correcto, o si los documentos están mal fragmentados, el modelo todavía puede equivocarse. Por eso, en casos sensibles, conviene complementar RAG con guardrails y con revisión humana en los pasos críticos.

¿Qué se necesita para implementar RAG en una empresa?

Se necesitan tres componentes principales. Primero, una base de conocimiento: tus documentos, políticas, catálogos o datos, fragmentados y convertidos en embeddings. Segundo, una base de datos vectorial donde almacenar esos embeddings y buscar por similitud semántica. Tercero, un modelo de lenguaje que reciba los fragmentos recuperados y genere la respuesta. Todo esto se orquesta para que, ante cada pregunta, el sistema busque, recupere y genere de forma automática, idealmente citando las fuentes.

¿Para qué sirve RAG en un agente de IA?

RAG es lo que permite que un agente de IA responda sobre la información específica de tu empresa en vez de hablar en general. Conectado a tus documentos, un agente con RAG puede contestar consultas de clientes con tus políticas exactas, darle a un vendedor precios y condiciones vigentes, o ayudar al equipo de soporte con tu base de conocimiento. La gran ventaja es que, cuando actualizás el documento fuente, el agente queda al día al instante, sin necesidad de reentrenar nada.

Herramienta gratuita
C-suite

Test de Madurez en IA Comercial

15 preguntas, un radar con tus brechas y un plan de 90 días.

Abrir la herramienta

Un agente de IA que ya sabe hacer esto

Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.

El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.

Seguí explorando

Términos relacionados

Del glosario

Preguntas relacionadas

Lo resolvemos con

Agentes de IA

Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.

Así lo resuelven los Agentes de IA
En Pulse

Seguí leyendo en Pulse

La suite completa

Ahora que sabés qué es, mirá cómo se resuelve

Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.