GlosarioTecnología

Ventana de contexto

Término 301 de 314 · Tecnología

En una frase

La ventana de contexto es la cantidad máxima de información (medida en tokens) que un modelo de lenguaje puede procesar de una sola vez, sumando la pregunta del usuario, las instrucciones, los datos adjuntos y la respuesta que genera.

Definición

La ventana de contexto es el límite de información que un modelo de lenguaje grande (un LLM) puede "tener a la vista" mientras genera una respuesta. Se mide en tokens (fragmentos de palabras), y abarca todo lo que entra y sale en una misma interacción: las instrucciones del sistema, la pregunta del usuario, los documentos o datos que le adjuntes, el historial de la conversación y la propia respuesta del modelo.

Pensala como la memoria de trabajo a corto plazo del modelo: si algo no entra en esa ventana, el modelo no lo "ve" y no puede usarlo para razonar. Cuando una conversación o un documento superan ese límite, el contenido más viejo se recorta y empieza a perderse, lo que explica por qué a veces un asistente parece "olvidar" lo que se dijo al principio de un chat largo.

En el contexto de los agentes de IA, la ventana de contexto es un recurso crítico: define cuánta información de tu negocio (un manual, un historial de cliente, un catálogo) puede considerar el agente antes de actuar. Por eso convive con técnicas como el RAG, que recupera solo los fragmentos relevantes para no saturarla.

La ventana de contexto es uno de los conceptos más malentendidos de la IA generativa, y entenderlo bien evita expectativas equivocadas al implementar asistentes o agentes. No es la "memoria permanente" del modelo ni su conocimiento general (eso viene del entrenamiento): es el espacio temporal donde cabe la información de una consulta puntual.

Cómo se mide y por qué en tokens

La ventana no se mide en palabras ni en caracteres, sino en tokens. Un token es un fragmento de texto: en español, una palabra común suele equivaler a entre uno y tres tokens, y como regla práctica 1000 tokens rondan las 750 palabras. Una ventana de 128.000 tokens, por ejemplo, alcanza para unas 90.000 a 100.000 palabras, el equivalente a un libro corto. El punto clave es que ese presupuesto es compartido: cada token que ocupan tus instrucciones y tus datos adjuntos es un token menos disponible para la respuesta.

Entrada y salida comparten el mismo presupuesto

Esta es la parte que más sorprende a quien diseña su primer asistente. La ventana se reparte entre tres bloques:

  • Prompt del sistema: las instrucciones fijas que definen cómo se comporta el modelo (tono, reglas, formato).
  • Contexto del usuario: la pregunta actual, el historial de la conversación y todo documento o dato que se inyecte (por ejemplo, vía RAG o tool calling).
  • Respuesta generada: lo que el modelo produce también consume tokens de la misma ventana.

Si llenás casi toda la ventana con datos de entrada, le queda poco espacio para responder, y la respuesta puede salir cortada. Por eso administrar la ventana es un trabajo de diseño, no algo que se resuelva solo con un modelo "más grande".

Por qué importa en un proyecto real

En un despliegue B2B, la ventana de contexto define qué tan "informado" puede estar un agente sin recurrir a sistemas externos. Un caso concreto en Argentina: una empresa de Consumo Masivo arma un asistente de IA para que su fuerza de ventas consulte políticas comerciales, precios y condiciones por cliente. Si intentan meter el catálogo completo, la lista de precios y el historial de cada cuenta dentro de la ventana en cada consulta, el costo se dispara (se paga por token) y la latencia sube. La solución no es agrandar la ventana indefinidamente, sino usar RAG para recuperar solo los fragmentos relevantes de una base de datos vectorial e inyectarlos justo cuando hacen falta.

Errores comunes

  • Creer que ventana más grande siempre es mejor. Más tokens significan más costo y más lentitud por consulta. La ventana grande es una herramienta, no un fin.
  • Asumir que el modelo "recuerda" todo lo que cabe. Existe el fenómeno de "perdido en el medio" (lost in the middle): los modelos prestan más atención al principio y al final de la ventana que a la información ubicada en el centro de un texto muy largo.
  • Confundir ventana de contexto con memoria persistente. Cuando se cierra la sesión, ese contexto desaparece. Para que un agente "recuerde" entre conversaciones hace falta guardar y recuperar esa información de forma explícita (por ejemplo, desde un CRM o una base de datos).
  • Llenarla con ruido. Más contexto no es mejor contexto. Inyectar documentos irrelevantes degrada la calidad de la respuesta y aumenta el riesgo de alucinación.

Ventana de contexto vs RAG: no compiten, se complementan

Una confusión frecuente es elegir "entre" agrandar la ventana o usar RAG. En la práctica trabajan juntos: la ventana es el contenedor, RAG decide qué poner dentro.

AspectoVentana de contextoRAG (recuperación aumentada)
Qué resuelveCuánta información cabe por consultaQué información traer a esa ventana
NaturalezaLímite fijo del modeloTécnica de recuperación dinámica
Costo al escalarCrece con cada token incluidoMantiene la ventana acotada
Conocimiento que aportaSolo lo que inyectás en el momentoAcceso a corpus grandes externos
Riesgo principalSaturarla o cortar la respuestaRecuperar fragmentos poco relevantes

La regla práctica: usá la ventana para el contexto inmediato de la tarea y RAG para darle al modelo acceso a un cuerpo de conocimiento que jamás entraría completo en ningún límite de tokens.

Compartir
Preguntas frecuentes

Preguntas frecuentes sobre Ventana de contexto

¿Qué es la ventana de contexto en IA?

La ventana de contexto es la cantidad máxima de información, medida en tokens, que un modelo de lenguaje puede procesar de una sola vez. Incluye las instrucciones, la pregunta del usuario, los documentos adjuntos, el historial de la conversación y la respuesta que el modelo genera. Si algo no entra en esa ventana, el modelo no lo considera para razonar. Funciona como una memoria de trabajo temporal: cuando una conversación o un texto la superan, el contenido más viejo se recorta y se pierde.

¿En qué se mide la ventana de contexto?

Se mide en tokens, que son fragmentos de texto más pequeños que una palabra completa. En español, una palabra común suele equivaler a entre uno y tres tokens, y como referencia práctica 1000 tokens equivalen aproximadamente a 750 palabras. Una ventana de 128.000 tokens, por ejemplo, alcanza para unas 90.000 a 100.000 palabras, parecido a un libro corto. Ese presupuesto de tokens se reparte entre la información de entrada y la respuesta que genera el modelo.

¿Una ventana de contexto más grande siempre es mejor?

No necesariamente. Una ventana más grande permite procesar más información de una vez, pero también aumenta el costo (se suele pagar por token) y la latencia de cada respuesta. Además, los modelos tienden a prestar menos atención a la información ubicada en el centro de textos muy largos, un fenómeno conocido como perdido en el medio. En muchos casos conviene mantener la ventana acotada y usar técnicas como RAG para inyectar solo los fragmentos relevantes, en lugar de cargar todo el contenido.

¿Cuál es la diferencia entre ventana de contexto y memoria del modelo?

La ventana de contexto es la memoria de trabajo a corto plazo: existe solo durante una interacción y desaparece cuando termina la sesión. El conocimiento general del modelo, en cambio, proviene de su entrenamiento y es fijo. Para que un agente recuerde información entre conversaciones distintas no alcanza con la ventana de contexto: hay que guardar esos datos de forma explícita en un sistema externo, como un CRM o una base de datos, y volver a inyectarlos cuando hagan falta.

¿Cómo se relaciona la ventana de contexto con RAG?

La ventana de contexto y RAG se complementan en lugar de competir. La ventana es el contenedor que define cuánta información cabe por consulta, mientras que RAG es la técnica que decide qué información traer a esa ventana. En lugar de intentar meter un corpus enorme dentro del límite de tokens, RAG recupera solo los fragmentos más relevantes desde una base de datos vectorial y los inyecta en el momento justo. Así se mantiene la ventana acotada, se controla el costo y se le da al modelo acceso a conocimiento que jamás entraría completo.

Herramienta gratuita
C-suite

Test de Madurez en IA Comercial

15 preguntas, un radar con tus brechas y un plan de 90 días.

Abrir la herramienta

Un agente de IA que ya sabe hacer esto

Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.

El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.

Seguí explorando

Términos relacionados

Del glosario

Preguntas relacionadas

Lo resolvemos con

Agentes de IA

Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.

Así lo resuelven los Agentes de IA
La suite completa

Ahora que sabés qué es, mirá cómo se resuelve

Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.