¿Qué es el streaming?
Seguro que lo has notado: al chatear con una IA, la respuesta aparece línea a línea en lugar de llegar de golpe tras una pausa larga. Eso es streaming. El modelo genera y te empuja los resultados en tiempo real: ves la respuesta mientras se escribe, no un bloque terminado.¿Cómo funciona?
Envía la respuesta pieza a piezaLa generación va token a token. En modo normal el modelo junta un párrafo entero antes de devolverlo; el streaming envía cada token en cuanto se produce y el frontend lo va pintando.
Se apoya en la transferencia por trozos
Por debajo suele usar SSE (server-sent events) o streaming HTTP para trocear los datos e irlos empujando, de modo que el navegador o la app renderiza poco a poco.
¿Qué problema resuelve?
Mata la ansiedad de esperarUna respuesta larga puede tardar decenas de segundos; devolverla de golpe es como mirar un spinner. El streaming muestra palabras moviéndose al instante y recorta la latencia percibida.
Se siente más como una conversación
El texto que aparece carácter a carácter se parece a una persona tecleando: la IA parece estar «pensando», no congelada.
Puedes cortar antes
Si se va por las ramas, puedes interrumpir en cualquier momento en vez de esperar el bloque entero, ahorrando tiempo y tokens.
¿Algo que vigilar?
El streaming no calcula más rápido: solo te muestra antes. No recorta el tiempo total de cómputo, pero aplasta la sensación de espera. Para chat, completado de código y escritura larga, donde quieres verlo desplegarse, es lo habitual.En resumen: el streaming te muestra la respuesta mientras se hace, de modo que la IA responde como una persona tecleando.
Comentarios