Ventana de contexto
Término 301 de 314 · Tecnología
En una frase
La ventana de contexto es la cantidad máxima de información (medida en tokens) que un modelo de lenguaje puede procesar de una sola vez, sumando la pregunta del usuario, las instrucciones, los datos adjuntos y la respuesta que genera.
La ventana de contexto es el límite de información que un modelo de lenguaje grande (un LLM) puede "tener a la vista" mientras genera una respuesta. Se mide en tokens (fragmentos de palabras), y abarca todo lo que entra y sale en una misma interacción: las instrucciones del sistema, la pregunta del usuario, los documentos o datos que le adjuntes, el historial de la conversación y la propia respuesta del modelo.
Pensala como la memoria de trabajo a corto plazo del modelo: si algo no entra en esa ventana, el modelo no lo "ve" y no puede usarlo para razonar. Cuando una conversación o un documento superan ese límite, el contenido más viejo se recorta y empieza a perderse, lo que explica por qué a veces un asistente parece "olvidar" lo que se dijo al principio de un chat largo.
En el contexto de los agentes de IA, la ventana de contexto es un recurso crítico: define cuánta información de tu negocio (un manual, un historial de cliente, un catálogo) puede considerar el agente antes de actuar. Por eso convive con técnicas como el RAG, que recupera solo los fragmentos relevantes para no saturarla.
La ventana de contexto es uno de los conceptos más malentendidos de la IA generativa, y entenderlo bien evita expectativas equivocadas al implementar asistentes o agentes. No es la "memoria permanente" del modelo ni su conocimiento general (eso viene del entrenamiento): es el espacio temporal donde cabe la información de una consulta puntual.
Cómo se mide y por qué en tokens
La ventana no se mide en palabras ni en caracteres, sino en tokens. Un token es un fragmento de texto: en español, una palabra común suele equivaler a entre uno y tres tokens, y como regla práctica 1000 tokens rondan las 750 palabras. Una ventana de 128.000 tokens, por ejemplo, alcanza para unas 90.000 a 100.000 palabras, el equivalente a un libro corto. El punto clave es que ese presupuesto es compartido: cada token que ocupan tus instrucciones y tus datos adjuntos es un token menos disponible para la respuesta.
Entrada y salida comparten el mismo presupuesto
Esta es la parte que más sorprende a quien diseña su primer asistente. La ventana se reparte entre tres bloques:
- Prompt del sistema: las instrucciones fijas que definen cómo se comporta el modelo (tono, reglas, formato).
- Contexto del usuario: la pregunta actual, el historial de la conversación y todo documento o dato que se inyecte (por ejemplo, vía RAG o tool calling).
- Respuesta generada: lo que el modelo produce también consume tokens de la misma ventana.
Si llenás casi toda la ventana con datos de entrada, le queda poco espacio para responder, y la respuesta puede salir cortada. Por eso administrar la ventana es un trabajo de diseño, no algo que se resuelva solo con un modelo "más grande".
Por qué importa en un proyecto real
En un despliegue B2B, la ventana de contexto define qué tan "informado" puede estar un agente sin recurrir a sistemas externos. Un caso concreto en Argentina: una empresa de Consumo Masivo arma un asistente de IA para que su fuerza de ventas consulte políticas comerciales, precios y condiciones por cliente. Si intentan meter el catálogo completo, la lista de precios y el historial de cada cuenta dentro de la ventana en cada consulta, el costo se dispara (se paga por token) y la latencia sube. La solución no es agrandar la ventana indefinidamente, sino usar RAG para recuperar solo los fragmentos relevantes de una base de datos vectorial e inyectarlos justo cuando hacen falta.
Errores comunes
- Creer que ventana más grande siempre es mejor. Más tokens significan más costo y más lentitud por consulta. La ventana grande es una herramienta, no un fin.
- Asumir que el modelo "recuerda" todo lo que cabe. Existe el fenómeno de "perdido en el medio" (lost in the middle): los modelos prestan más atención al principio y al final de la ventana que a la información ubicada en el centro de un texto muy largo.
- Confundir ventana de contexto con memoria persistente. Cuando se cierra la sesión, ese contexto desaparece. Para que un agente "recuerde" entre conversaciones hace falta guardar y recuperar esa información de forma explícita (por ejemplo, desde un CRM o una base de datos).
- Llenarla con ruido. Más contexto no es mejor contexto. Inyectar documentos irrelevantes degrada la calidad de la respuesta y aumenta el riesgo de alucinación.
Ventana de contexto vs RAG: no compiten, se complementan
Una confusión frecuente es elegir "entre" agrandar la ventana o usar RAG. En la práctica trabajan juntos: la ventana es el contenedor, RAG decide qué poner dentro.
| Aspecto | Ventana de contexto | RAG (recuperación aumentada) |
|---|---|---|
| Qué resuelve | Cuánta información cabe por consulta | Qué información traer a esa ventana |
| Naturaleza | Límite fijo del modelo | Técnica de recuperación dinámica |
| Costo al escalar | Crece con cada token incluido | Mantiene la ventana acotada |
| Conocimiento que aporta | Solo lo que inyectás en el momento | Acceso a corpus grandes externos |
| Riesgo principal | Saturarla o cortar la respuesta | Recuperar fragmentos poco relevantes |
La regla práctica: usá la ventana para el contexto inmediato de la tarea y RAG para darle al modelo acceso a un cuerpo de conocimiento que jamás entraría completo en ningún límite de tokens.
Preguntas frecuentes sobre Ventana de contexto
¿Qué es la ventana de contexto en IA?
¿Qué es la ventana de contexto en IA?
La ventana de contexto es la cantidad máxima de información, medida en tokens, que un modelo de lenguaje puede procesar de una sola vez. Incluye las instrucciones, la pregunta del usuario, los documentos adjuntos, el historial de la conversación y la respuesta que el modelo genera. Si algo no entra en esa ventana, el modelo no lo considera para razonar. Funciona como una memoria de trabajo temporal: cuando una conversación o un texto la superan, el contenido más viejo se recorta y se pierde.
¿En qué se mide la ventana de contexto?
¿En qué se mide la ventana de contexto?
Se mide en tokens, que son fragmentos de texto más pequeños que una palabra completa. En español, una palabra común suele equivaler a entre uno y tres tokens, y como referencia práctica 1000 tokens equivalen aproximadamente a 750 palabras. Una ventana de 128.000 tokens, por ejemplo, alcanza para unas 90.000 a 100.000 palabras, parecido a un libro corto. Ese presupuesto de tokens se reparte entre la información de entrada y la respuesta que genera el modelo.
¿Una ventana de contexto más grande siempre es mejor?
¿Una ventana de contexto más grande siempre es mejor?
No necesariamente. Una ventana más grande permite procesar más información de una vez, pero también aumenta el costo (se suele pagar por token) y la latencia de cada respuesta. Además, los modelos tienden a prestar menos atención a la información ubicada en el centro de textos muy largos, un fenómeno conocido como perdido en el medio. En muchos casos conviene mantener la ventana acotada y usar técnicas como RAG para inyectar solo los fragmentos relevantes, en lugar de cargar todo el contenido.
¿Cuál es la diferencia entre ventana de contexto y memoria del modelo?
¿Cuál es la diferencia entre ventana de contexto y memoria del modelo?
La ventana de contexto es la memoria de trabajo a corto plazo: existe solo durante una interacción y desaparece cuando termina la sesión. El conocimiento general del modelo, en cambio, proviene de su entrenamiento y es fijo. Para que un agente recuerde información entre conversaciones distintas no alcanza con la ventana de contexto: hay que guardar esos datos de forma explícita en un sistema externo, como un CRM o una base de datos, y volver a inyectarlos cuando hagan falta.
¿Cómo se relaciona la ventana de contexto con RAG?
¿Cómo se relaciona la ventana de contexto con RAG?
La ventana de contexto y RAG se complementan en lugar de competir. La ventana es el contenedor que define cuánta información cabe por consulta, mientras que RAG es la técnica que decide qué información traer a esa ventana. En lugar de intentar meter un corpus enorme dentro del límite de tokens, RAG recupera solo los fragmentos más relevantes desde una base de datos vectorial y los inyecta en el momento justo. Así se mantiene la ventana acotada, se controla el costo y se le da al modelo acceso a conocimiento que jamás entraría completo.
Test de Madurez en IA Comercial
15 preguntas, un radar con tus brechas y un plan de 90 días.
Abrir la herramientaUn agente de IA que ya sabe hacer esto
Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- TokenUn token es la unidad mínima de texto que procesa un modelo de lenguaje: un fragmento de palabra, una palabra o un signo. Los LLM leen, generan y cobran por tokens, no por palabras ni caracteres.
- LLM (modelo de lenguaje grande)Un LLM (modelo de lenguaje grande) es un sistema de inteligencia artificial entrenado con enormes volúmenes de texto que predice y genera lenguaje natural. Es el motor de chatbots, redacción automática y agentes de IA capaces de entender y responder en lenguaje humano.
- RAG (Retrieval Augmented Generation)RAG (generación aumentada por recuperación) es una técnica que conecta un modelo de lenguaje a una fuente de datos externa: recupera los fragmentos relevantes y los inyecta en el prompt para que la IA responda con información actualizada y verificable, en vez de inventarla.
- Base de datos vectorialUna base de datos vectorial es un motor que almacena datos como vectores numéricos (embeddings) y los busca por similitud semántica, no por coincidencia exacta. Es la pieza que permite a un sistema de IA encontrar información relevante por significado.
- Vibe codingEl vibe coding es una forma de programar describiendo en lenguaje natural lo que querés y dejando que una IA genere el código, en vez de escribirlo línea por línea. El humano guía, prueba y corrige; la IA produce.
- WorkflowUn workflow es la secuencia ordenada de pasos, reglas y aprobaciones que define cómo avanza un proceso de negocio de principio a fin, automatizando tareas repetitivas para que se ejecuten solas según condiciones predefinidas.
Preguntas relacionadas
Agentes de IA
Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.
Así lo resuelven los Agentes de IAAhora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.