GlosarioTecnología

Inferencia

Término 139 de 314 · Tecnología

En una frase

La inferencia es la fase en que un modelo de IA ya entrenado recibe una entrada nueva (un prompt, una imagen, un dato) y genera una respuesta o predicción en tiempo real, aplicando lo aprendido sin volver a entrenarse.

Definición

La inferencia es el momento en que un modelo de IA ya entrenado se pone a trabajar: recibe una entrada nueva (un texto, una pregunta, una imagen, una fila de datos) y produce una salida (una respuesta, una clasificación, una predicción). Es la fase de uso del modelo, opuesta a la fase de entrenamiento, donde el modelo aprende ajustando sus parámetros a partir de ejemplos.

Dicho simple: entrenar es enseñarle al modelo; inferir es preguntarle. Cuando un agente de IA responde una consulta, redacta un correo o decide qué acción ejecutar, está haciendo inferencia. Cada respuesta de un asistente conversacional, cada documento clasificado y cada lead puntuado por un modelo es un acto de inferencia.

Importa porque la inferencia es lo que el negocio realmente consume y lo que determina el costo y la velocidad en producción. Un modelo se entrena una vez (o cada tanto), pero infiere millones de veces: por eso la latencia, el gasto por consulta y la calidad de cada respuesta dependen de cómo se gestione esta fase.

Cómo funciona la inferencia

Un modelo de IA, sobre todo un LLM, es en esencia una función matemática con millones o miles de millones de parámetros que ya quedaron fijos durante el entrenamiento. En la inferencia esa función no cambia: solo se ejecuta. El sistema toma la entrada, la convierte en tokens, la procesa a través de las capas del modelo y genera la salida token por token, prediciendo cada palabra nueva a partir de la anterior y del contexto disponible dentro de la ventana de contexto.

Dos parámetros gobiernan esta etapa. La temperatura regula cuán determinista o creativa es la salida: baja para tareas exactas, alta para generación más variada. Y el prompt, junto con cualquier dato que se inyecte vía RAG, define el contexto sobre el que el modelo razona. Nada de esto modifica al modelo: son entradas que condicionan una misma función fija.

Por qué importa para el negocio

La inferencia es la parte de la IA que escala con el uso, y por eso concentra el costo operativo. Entrenar un modelo grande es caro pero ocurre pocas veces; inferir ocurre en cada interacción con un cliente, en cada documento que entra y en cada decisión automatizada. Para una empresa argentina que pone un asistente de atención sobre WhatsApp, lo que paga mes a mes es inferencia: cada conversación consume tokens de entrada y de salida. Optimizar esta fase (elegir el modelo del tamaño justo, acotar el contexto, cachear respuestas frecuentes) tiene impacto directo en el margen.

La velocidad también se decide acá. La latencia de inferencia es el tiempo que tarda el modelo en empezar a responder y en completar la respuesta. En una experiencia conversacional, una demora de varios segundos rompe la sensación de fluidez; en un proceso por lotes (clasificar 10.000 facturas de un día), lo que importa es el rendimiento total, no la respuesta instantánea.

Ejemplo concreto en Argentina

Una distribuidora de Consumo Masivo contrata un modelo ya entrenado para clasificar los pedidos que llegan por mail y WhatsApp. Una vez en producción, cada mail nuevo dispara una inferencia: el modelo lee el texto, identifica producto, cantidad y cliente, y arma el pedido en el sistema. El equipo nunca vuelve a entrenar el modelo en el día a día; solo lo usa, miles de veces por semana. El costo mensual y la rapidez de cada pedido son, en la práctica, métricas de inferencia.

Inferencia vs entrenamiento

AspectoEntrenamientoInferencia
Qué haceEl modelo aprende ajustando parámetrosEl modelo aplica lo aprendido
FrecuenciaPocas veces (o una sola)Millones de veces, continuo
Cambia el modeloSí, modifica los parámetrosNo, los parámetros quedan fijos
Qué consumeEnormes datasets, mucho cómputo concentradoUna entrada por vez, cómputo distribuido en el tiempo
Costo en producciónAlto pero puntualEl costo recurrente del día a día
Métrica clavePrecisión, pérdida, convergenciaLatencia, costo por consulta, rendimiento

Errores comunes

  • Confundir inferencia con entrenamiento. Pedirle a un modelo en inferencia que "aprenda" de lo que le decís en el chat es un malentendido frecuente: no retiene nada entre sesiones salvo lo que entre por su contexto. Para que aprenda de verdad hace falta fine-tuning o reentrenamiento.
  • Subestimar el costo acumulado. Una prueba piloto barata puede volverse cara al escalar, porque la inferencia se multiplica por cada interacción.
  • Ignorar la latencia. Un modelo más grande suele dar mejores respuestas pero infiere más lento; en casos conversacionales, a veces conviene uno más chico y rápido.
  • Olvidar la gobernanza del dato. Lo que se manda en cada inferencia (datos de clientes, documentos sensibles) viaja al modelo: por eso importa dónde y cómo se ejecuta.
Compartir
Preguntas frecuentes

Preguntas frecuentes sobre Inferencia

¿Qué es la inferencia en IA?

La inferencia es la fase en que un modelo de inteligencia artificial ya entrenado se usa para resolver una tarea: recibe una entrada nueva (un prompt, una imagen, un dato) y genera una salida (una respuesta, una predicción, una clasificación) aplicando lo que aprendió, sin modificar sus parámetros. Es el momento de uso del modelo, opuesto al entrenamiento, que es cuando aprende. Cada respuesta de un asistente conversacional o cada documento que un sistema de IA clasifica es un acto de inferencia.

¿Cuál es la diferencia entre inferencia y entrenamiento?

El entrenamiento es cuando el modelo aprende: ajusta sus parámetros internos a partir de grandes cantidades de ejemplos, y ocurre pocas veces porque es costoso. La inferencia es cuando el modelo ya entrenado aplica ese conocimiento a una entrada nueva, sin cambiar nada de su interior, y ocurre de forma continua, millones de veces. Entrenar es enseñarle al modelo; inferir es preguntarle. En producción, el entrenamiento es un costo puntual y la inferencia es el costo recurrente del día a día.

¿Por qué la inferencia define el costo de un proyecto de IA?

Porque la inferencia escala con el uso. Un modelo se entrena una vez o cada tanto, pero infiere en cada interacción: cada conversación, cada documento procesado y cada decisión automatizada consume cómputo y, en los modelos de lenguaje, tokens de entrada y de salida que se facturan. Por eso una prueba piloto barata puede volverse cara al escalar a producción. Optimizar la inferencia (elegir un modelo del tamaño justo, acotar el contexto, cachear respuestas frecuentes) impacta directamente en el costo mensual y en el margen del proyecto.

¿Qué es la latencia de inferencia?

La latencia de inferencia es el tiempo que tarda un modelo en empezar a responder y en completar su salida una vez que recibe la entrada. En aplicaciones conversacionales es crítica: una demora de varios segundos rompe la sensación de fluidez. Suele haber un equilibrio entre calidad y velocidad, porque los modelos más grandes dan mejores respuestas pero infieren más lento. En procesos por lotes, en cambio, importa más el rendimiento total (cuántas inferencias por minuto) que la rapidez de cada respuesta individual.

¿La inferencia hace que el modelo aprenda de lo que le digo?

No. Durante la inferencia el modelo no aprende ni retiene nada de forma permanente: sus parámetros quedan fijos. Lo que le decís en una conversación solo influye mientras esté dentro de su ventana de contexto, y se olvida al cerrar la sesión. Para que un modelo realmente incorpore conocimiento nuevo hace falta reentrenarlo o aplicarle fine-tuning, que son procesos separados. Si necesitás que tenga en cuenta datos propios sin reentrenar, lo habitual es inyectarlos en cada consulta con una técnica como RAG.

Herramienta gratuita
C-suite

Test de Madurez en IA Comercial

15 preguntas, un radar con tus brechas y un plan de 90 días.

Abrir la herramienta

Un agente de IA que ya sabe hacer esto

Implementamos agentes de IA sobre el CRM que ya usás, para ventas, cobranzas y soporte. Contanos qué proceso te consume el día y te decimos con franqueza si un agente lo resuelve.

El glosario completo (más de 290 definiciones de IA, Salesforce y datos) en un PDF con hipervínculos.

Seguí explorando

Términos relacionados

Del glosario

Preguntas relacionadas

Lo resolvemos con

Agentes de IA

Qué son los agentes de IA aplicados a ventas, cobranzas y soporte, y cómo se implementan sobre el CRM que ya usás.

Así lo resuelven los Agentes de IA
La suite completa

Ahora que sabés qué es, mirá cómo se resuelve

Cinco productos de IA que trabajan sobre el CRM que ya usás. No reemplazan tu sistema: le agregan la capa que hoy hacés a mano.