¿Qué es un servicio de inferencia?
Tu modelo entrenado puede ser brillante, pero si es solo un archivo en el disco, nadie puede usarlo. Un servicio de inferencia toma ese modelo, lo despliega y lo envuelve en una API que puedes llamar: la app envía una petición y el servicio devuelve una predicción en milisegundos. Ese es el momento en que un modelo empieza a «trabajar» de verdad.¿En qué se diferencia del entrenamiento?
Entrenar es un trabajo pesado y puntualEl entrenamiento quema GPUs y horas, y al final te queda un archivo de modelo.
La inferencia es un sprint sin descanso
Quiere baja latencia y alto rendimiento: miles de peticiones por segundo, cada una rápida y correcta.
¿Qué problemas de ingeniería resuelve?
LatenciaEl usuario no espera tres segundos. Optimiza el modelo, cuantízalo, añade caché y baja la respuesta a milisegundos.
Rendimiento
Cientos de personas pueden usarlo a la vez. Soporta concurrencia y lotes para que las peticiones no hagan cola.
Eficiencia de recursos
Las GPUs son caras. Asigna para que no estén ni ociosas ni saturadas.
Versiones y rollback
Los modelos nuevos salen poco a poco y vuelven atrás al instante, para que un mal release cueste poco.
Formas comunes de despliegue
Puede ser un servicio independiente en la nube o en tu propio clúster de GPUs, o «inferencia en el edge» con el modelo dentro del móvil, la cámara y otros dispositivos, incluso sin conexión. Cuál eliges depende de latencia, privacidad y coste.En resumen: un servicio de inferencia pone tu modelo entrenado «tras el mostrador» para que cualquiera pueda llamarlo, en cualquier momento.
Comentarios