Token
Término 292 de 314 · Tecnología
En una frase
Un token es la unidad mínima de texto que procesa un modelo de lenguaje: un fragmento de palabra, una palabra o un signo. Los LLM leen, generan y cobran por tokens, no por palabras ni caracteres.
Un token es la unidad básica con la que un modelo de lenguaje (LLM) lee y produce texto. No es exactamente una palabra ni una letra: es un fragmento, que puede ser una palabra corta entera ("casa"), parte de una palabra larga ("inter" + "nacional"), un espacio, un número o un signo de puntuación. Antes de procesar cualquier instrucción, el modelo descompone el texto en tokens mediante un proceso llamado tokenización, y trabaja siempre sobre esa lista de unidades.
La importancia práctica del token es doble. Primero, define los límites técnicos: cada modelo tiene una ventana de contexto medida en tokens, que es el máximo de texto (entrada más salida) que puede manejar en una sola interacción. Segundo, define los costos: los proveedores de IA cobran por cantidad de tokens de entrada y de salida, no por palabras. Entender esta unidad es clave para diseñar agentes de IA y automatizaciones que sean a la vez precisos y rentables.
Una regla práctica útil para el español: 1 token equivale aproximadamente a 0,75 palabras, o dicho al revés, unas 100 palabras suelen ocupar entre 130 y 150 tokens. El español tiende a usar algo más de tokens que el inglés por sus tildes y palabras más largas.
Cómo se forma un token
El token nace de un proceso llamado tokenización, donde un algoritmo (típicamente BPE, por las siglas en inglés de Byte Pair Encoding) divide el texto en las unidades más frecuentes de un vocabulario fijo aprendido durante el entrenamiento. Las palabras comunes suelen ser un solo token; las raras, los nombres propios o los términos técnicos se parten en varias piezas. Por ejemplo, "WhatsApp" puede convertirse en dos o tres tokens, mientras que "el" es uno solo. Cada token se traduce luego a un número (un ID del vocabulario), que es lo que el modelo realmente procesa al calcular embeddings y predecir el siguiente token.
Esto explica una característica central de los LLM: generan texto token por token. El modelo no escribe una respuesta completa de golpe, sino que predice el token más probable, lo agrega y vuelve a predecir el siguiente, repitiendo el ciclo hasta terminar. Por eso las respuestas aparecen "escribiéndose" en pantalla y por eso una respuesta larga tarda y cuesta más que una corta.
Por qué el token importa para tu negocio
Para cualquier proyecto de IA aplicada, el token es la unidad económica y operativa. Hay tres motivos concretos:
- Costo: la factura de un modelo se calcula multiplicando los tokens consumidos por su precio unitario, con tarifas distintas para entrada y salida (la salida suele ser más cara). Un prompt verboso o un historial de conversación largo inflan el gasto sin que el usuario lo perciba.
- Límite de contexto: si la suma de tokens de entrada y salida supera la ventana de contexto del modelo, el texto se trunca o la llamada falla. Esto obliga a resumir, recortar o usar técnicas como RAG para no exceder el límite.
- Latencia: más tokens de salida significan más tiempo de generación. Un agente que responde por WhatsApp con párrafos enormes se siente lento; uno conciso responde rápido.
Un ejemplo concreto
Pensemos en una empresa de Consumo Masivo en Argentina que despliega un agente de atención en WhatsApp. Cada conversación incluye: las instrucciones del sistema (unos 800 tokens fijos), el historial de los últimos mensajes (otros 1.200), la consulta del cliente (50) y la respuesta generada (200). Eso da unos 2.250 tokens por interacción. Si el agente atiende 10.000 conversaciones por mes, son 22,5 millones de tokens mensuales. Reducir el prompt del sistema de 800 a 400 tokens y acortar el historial puede bajar el costo a la mitad sin perder calidad de respuesta, simplemente diseñando con conciencia del token.
Errores comunes
El primero es confundir tokens con palabras o caracteres: estimar costos suponiendo "1 palabra = 1 token" subestima el gasto en español hasta en un 30%. El segundo es ignorar el historial acumulado: en una conversación larga, cada turno reenvía todo lo anterior, así que el consumo de tokens crece de forma no lineal. El tercero es abusar del few-shot: agregar muchos ejemplos al prompt mejora la precisión pero multiplica los tokens de entrada en cada llamada. La ingeniería de prompts bien hecha equilibra precisión y economía de tokens.
Token frente a otras unidades
Es habitual mezclar el token con conceptos vecinos. Esta tabla los separa:
| Unidad | Qué mide | Quién la usa |
|---|---|---|
| Token | Fragmento de texto del modelo | El LLM, internamente y para facturar |
| Palabra | Unidad del lenguaje humano | Las personas al escribir |
| Carácter | Letra o símbolo individual | Editores de texto, límites de campos |
| Parámetro | Peso interno del modelo entrenado | Describe el tamaño del modelo |
La conclusión práctica: cuando planifiques una automatización con IA, estimá siempre en tokens, no en palabras. Calcular el promedio de tokens por interacción y proyectarlo al volumen mensual te da un costo realista y te permite optimizar el diseño antes de poner el agente en producción.
Preguntas frecuentes sobre Token
¿Qué es un token en inteligencia artificial?
¿Qué es un token en inteligencia artificial?
Un token es la unidad mínima de texto que procesa un modelo de lenguaje. No es exactamente una palabra ni una letra, sino un fragmento: puede ser una palabra corta entera, parte de una palabra larga, un espacio, un número o un signo de puntuación. Los modelos primero descomponen todo el texto en tokens y luego trabajan sobre esa lista de unidades para leer y generar respuestas.
¿Cuántas palabras tiene un token?
¿Cuántas palabras tiene un token?
Como regla práctica, un token equivale aproximadamente a 0,75 palabras en promedio. Visto al revés, unas 100 palabras suelen ocupar entre 130 y 150 tokens. El español tiende a consumir algo más de tokens que el inglés porque tiene palabras más largas y usa tildes, que a veces se separan en piezas adicionales. Las palabras comunes suelen ser un solo token, mientras que las raras o técnicas se parten en varios.
¿Por qué los modelos de IA cobran por tokens?
¿Por qué los modelos de IA cobran por tokens?
Los proveedores cobran por tokens porque es la unidad real que el modelo procesa, no las palabras humanas. El costo se calcula multiplicando la cantidad de tokens de entrada y de salida por su precio unitario, y la salida suele ser más cara que la entrada. Cobrar por token refleja con precisión el trabajo computacional, ya que generar texto largo consume más recursos que generar texto corto.
¿Qué diferencia hay entre token y ventana de contexto?
¿Qué diferencia hay entre token y ventana de contexto?
El token es la unidad de medida y la ventana de contexto es el contenedor medido en esa unidad. La ventana de contexto define cuántos tokens, sumando entrada y salida, puede manejar el modelo en una sola interacción. Si el texto supera ese límite, se trunca o la llamada falla. En otras palabras, el token es el ladrillo y la ventana de contexto es el tamaño máximo de la construcción.
¿Cómo puedo reducir el consumo de tokens en un agente de IA?
¿Cómo puedo reducir el consumo de tokens en un agente de IA?
Se logra con varias técnicas: acortar las instrucciones del sistema sin perder claridad, limitar el historial de conversación a los mensajes recientes, pedir respuestas concisas, evitar agregar demasiados ejemplos al prompt y usar recuperación de información (RAG) en lugar de cargar documentos enteros en el contexto. Medir el promedio de tokens por interacción y proyectarlo al volumen mensual permite detectar dónde se está gastando de más.
¿Cuándo el token es la métrica equivocada para tomar una decisión?
¿Cuándo el token es la métrica equivocada para tomar una decisión?
Cuando lo que estás evaluando es si el caso de uso conviene, no cómo optimizarlo. El gasto en tokens suele ser marginal frente al costo de una respuesta mala: recortar contexto para ahorrar tokens genera reintentos, escalamientos a una persona del equipo y errores que salen bastante más caros. El token tampoco mide calidad ni esfuerzo, porque dos respuestas del mismo largo pueden valer cosas muy distintas. Medí primero resolución y satisfacción, y recién después el consumo.
Test de Madurez en IA Comercial
15 preguntas, un radar con tus brechas y un plan de 90 días.
Abrir la herramientaUn agente de IA que ya sabe hacer esto
Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- Ventana de contextoLa ventana de contexto es la cantidad máxima de información (medida en tokens) que un modelo de lenguaje puede procesar de una sola vez, sumando la pregunta del usuario, las instrucciones, los datos adjuntos y la respuesta que genera.
- LLM (modelo de lenguaje grande)Un LLM (modelo de lenguaje grande) es un sistema de inteligencia artificial entrenado con enormes volúmenes de texto que predice y genera lenguaje natural. Es el motor de chatbots, redacción automática y agentes de IA capaces de entender y responder en lenguaje humano.
- EmbeddingsLos embeddings son representaciones numéricas (vectores) que codifican el significado de un texto, imagen o dato, de modo que conceptos parecidos quedan cerca en el espacio. Permiten que la IA mida similitud semántica y busque por sentido, no por palabras exactas.
- Ingeniería de promptsLa ingeniería de prompts es la práctica de diseñar, estructurar y refinar las instrucciones que se le dan a un modelo de IA generativa para obtener respuestas precisas, útiles y confiables, ajustando contexto, formato, ejemplos y restricciones.
- Tool callingTool calling, o llamada a herramientas, es la capacidad de un modelo de lenguaje de invocar funciones externas (consultar una base, llamar a una API o ejecutar una acción) para operar sobre sistemas reales, no solo generar texto. Convierte un modelo que conversa en un agente que actúa.
- Vibe codingEl vibe coding es una forma de programar describiendo en lenguaje natural lo que querés y dejando que una IA genere el código, en vez de escribirlo línea por línea. El humano guía, prueba y corrige; la IA produce.
Preguntas relacionadas
Agentes de IA
Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.
Así lo resuelven los Agentes de IAAhora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.