Temperatura (LLM)
Término 288 de 314 · Tecnología
En una frase
La temperatura es un parámetro que regula cuán aleatoria o predecible es la respuesta de un LLM. Valores bajos (cerca de 0) dan salidas más deterministas y consistentes; valores altos (cerca de 1 o más) las hacen más creativas y variadas.
La temperatura es un parámetro de configuración que controla el grado de aleatoriedad con el que un modelo de lenguaje grande (LLM) elige cada palabra al generar una respuesta. Cuando un modelo predice el siguiente token, no tiene una única opción: maneja una distribución de probabilidades sobre muchos candidatos. La temperatura ajusta esa distribución antes de elegir.
Con una temperatura baja (cercana a 0), el modelo se vuelve casi determinista: elige siempre las opciones más probables, así que repite la misma respuesta ante el mismo prompt. Con una temperatura alta (por encima de 0,8 o 1), achata la distribución y permite que palabras menos probables aparezcan, lo que produce respuestas más variadas, creativas y, a veces, sorprendentes.
Configurar bien la temperatura es parte de afinar el comportamiento de un asistente automatizado: es una de las palancas que se calibran al diseñar los agentes de IA según la tarea, ya sea extraer datos con precisión o redactar contenido con estilo.
Cómo funciona por dentro
Cada vez que un LLM genera texto, calcula una probabilidad para todos los tokens posibles que podrían venir a continuación. La temperatura divide esas puntuaciones antes de convertirlas en probabilidades finales (en la práctica, escala los valores de la función softmax). Una temperatura de 0 colapsa todo hacia el token más probable: el modelo se vuelve predecible y reproducible. A medida que el valor sube, la diferencia entre las opciones se reduce, los tokens menos esperados ganan chance y el texto se vuelve más diverso.
Conviene no confundir la temperatura con otros parámetros de muestreo que suelen aparecer juntos. El top-p (muestreo por núcleo) limita la elección al conjunto de tokens que acumulan cierta probabilidad; el top-k restringe a los k candidatos más probables. La temperatura actúa sobre la forma de la distribución; top-p y top-k recortan qué candidatos entran al sorteo. En general se ajusta uno a la vez para no perder control sobre el resultado.
Por qué importa en un proyecto real
Elegir la temperatura no es un detalle técnico menor: define si tu asistente es confiable o creativo. Pensemos en una empresa argentina que automatiza dos tareas distintas. Para un agente que clasifica facturas y extrae el CUIT, el monto y la fecha, querés temperatura baja: necesitás que la misma factura devuelva siempre el mismo dato, sin inventar. Para un asistente que redacta borradores de respuestas a clientes por WhatsApp, una temperatura media (alrededor de 0,7) ayuda a que los mensajes no suenen calcados entre sí y tengan un tono más natural.
Una regla práctica útil según el tipo de tarea:
- Extracción de datos, clasificación, respuestas de soporte basadas en una base de conocimiento: temperatura baja (0 a 0,3) para máxima consistencia.
- Resúmenes y reformulaciones: temperatura media-baja (0,3 a 0,6), equilibrio entre fidelidad y fluidez.
- Generación de ideas, copy de marketing, variantes creativas: temperatura más alta (0,7 a 1), priorizando diversidad.
Errores comunes
El error más frecuente es subir la temperatura buscando respuestas "más inteligentes". La temperatura no agrega conocimiento ni mejora el razonamiento: solo cambia cuánta variedad permite. Subirla demasiado aumenta el riesgo de alucinaciones y de salidas incoherentes. Otro error es esperar reproducibilidad perfecta con temperatura 0: aun ahí pueden aparecer pequeñas diferencias por la infraestructura de inferencia. Y un tercero es tocar temperatura y top-p a la vez sin medir, lo que vuelve imposible saber qué cambió el resultado.
Temperatura baja frente a temperatura alta
| Aspecto | Temperatura baja (0 a 0,3) | Temperatura alta (0,7 a 1+) |
|---|---|---|
| Comportamiento | Determinista, predecible | Aleatorio, variado |
| Mismo prompt | Respuesta casi idéntica | Respuestas distintas |
| Riesgo de alucinación | Menor | Mayor |
| Mejor para | Extraer datos, clasificar, soporte | Crear, idear, redactar |
| Tono del texto | Conservador, repetible | Original, sorprendente |
En síntesis, la temperatura es la perilla más directa para mover el comportamiento de un modelo entre la precisión y la creatividad. No tiene un valor "correcto" universal: el valor adecuado depende de la tarea, y la mejor forma de fijarlo es probar con casos reales de tu negocio y medir el resultado, no copiar un número de un tutorial.
Preguntas frecuentes sobre Temperatura (LLM)
¿Qué es la temperatura en un LLM?
¿Qué es la temperatura en un LLM?
La temperatura es un parámetro que controla cuán aleatoria o predecible es la salida de un modelo de lenguaje grande. Ajusta la distribución de probabilidades que el modelo usa para elegir cada palabra. Con valores bajos (cerca de 0), las respuestas son consistentes y deterministas; con valores altos (cerca de 1 o más), son más variadas y creativas, pero con mayor riesgo de incoherencias.
¿Qué valor de temperatura conviene usar?
¿Qué valor de temperatura conviene usar?
Depende de la tarea. Para extraer datos, clasificar o dar respuestas de soporte que deben ser consistentes, conviene una temperatura baja (entre 0 y 0,3). Para resúmenes y reformulaciones, un valor medio-bajo (0,3 a 0,6). Para generar ideas, copy de marketing o variantes creativas, una temperatura más alta (0,7 a 1). Lo ideal es probar con casos reales y medir, no copiar un número fijo.
¿Cuál es la diferencia entre temperatura y top-p?
¿Cuál es la diferencia entre temperatura y top-p?
La temperatura ajusta la forma de la distribución de probabilidades del modelo: cuánta chance tienen las palabras menos probables de ser elegidas. El top-p (muestreo por núcleo) hace algo distinto: limita la elección al conjunto de tokens que acumulan un cierto porcentaje de probabilidad. La temperatura controla la aleatoriedad general; el top-p recorta qué candidatos entran en juego. Se recomienda ajustar uno a la vez para no perder control sobre el resultado.
¿Una temperatura más alta hace al modelo más inteligente?
¿Una temperatura más alta hace al modelo más inteligente?
No. La temperatura no agrega conocimiento ni mejora el razonamiento del modelo, solo cambia cuánta variedad permite en las respuestas. Subirla buscando salidas más inteligentes es un error común: lo que en realidad aumenta es la probabilidad de respuestas variadas y, si se exagera, de incoherencias y alucinaciones. Para mejorar la calidad real conviene trabajar el prompt y el contexto, no la temperatura.
¿La temperatura 0 garantiza siempre la misma respuesta?
¿La temperatura 0 garantiza siempre la misma respuesta?
Casi, pero no de forma absoluta. Una temperatura de 0 hace que el modelo elija siempre el token más probable, lo que lo vuelve prácticamente determinista y reproducible. Sin embargo, pueden aparecer pequeñas diferencias debido a la infraestructura de inferencia y a cómo se procesan los cálculos. Para tareas donde la consistencia es crítica, la temperatura baja es la opción correcta, aunque sin asumir reproducibilidad perfecta al cien por ciento.
Test de Madurez en IA Comercial
15 preguntas, un radar con tus brechas y un plan de 90 días.
Abrir la herramientaUn agente de IA que ya sabe hacer esto
Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.
El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.
Términos relacionados
- LLM (modelo de lenguaje grande)Un LLM (modelo de lenguaje grande) es un sistema de inteligencia artificial entrenado con enormes volúmenes de texto que predice y genera lenguaje natural. Es el motor de chatbots, redacción automática y agentes de IA capaces de entender y responder en lenguaje humano.
- TokenUn token es la unidad mínima de texto que procesa un modelo de lenguaje: un fragmento de palabra, una palabra o un signo. Los LLM leen, generan y cobran por tokens, no por palabras ni caracteres.
- InferenciaLa inferencia es la fase en que un modelo de IA ya entrenado recibe una entrada nueva (un prompt, una imagen, un dato) y genera una respuesta o predicción en tiempo real, aplicando lo aprendido sin volver a entrenarse.
- Ingeniería de promptsLa ingeniería de prompts es la práctica de diseñar, estructurar y refinar las instrucciones que se le dan a un modelo de IA generativa para obtener respuestas precisas, útiles y confiables, ajustando contexto, formato, ejemplos y restricciones.
- Tool callingTool calling, o llamada a herramientas, es la capacidad de un modelo de lenguaje de invocar funciones externas (consultar una base, llamar a una API o ejecutar una acción) para operar sobre sistemas reales, no solo generar texto. Convierte un modelo que conversa en un agente que actúa.
- Ventana de contextoLa ventana de contexto es la cantidad máxima de información (medida en tokens) que un modelo de lenguaje puede procesar de una sola vez, sumando la pregunta del usuario, las instrucciones, los datos adjuntos y la respuesta que genera.
Preguntas relacionadas
Agentes de IA
Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.
Así lo resuelven los Agentes de IAAhora que sabés qué es, mirá cómo se resuelve
Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.