¿Qué es el rendimiento de tokens?
Pregunta qué tan rápida es una IA y en realidad preguntas por el rendimiento de tokens (Token Throughput): cuántos tokens puede procesar el sistema por unidad de tiempo, normalmente «tokens por segundo». Cuanto mayor el número, más rápido sale el mismo trabajo.¿Es lo mismo que la latencia?
No, pero están relacionadasLa latencia es cuánto tarda una petición de envío a respuesta; el rendimiento es cuánto procesa el sistema por segundo en total. Piensa en mensajería: la latencia es cuánto tarda tu paquete, el rendimiento cuántos paquetes despacha el almacén al día. Un rendimiento alto es lo que aguanta el servicio cuando se amontona la gente.
¿Qué determina el rendimiento?
Hardware y cómputoMás y mejores GPU, más tokens calculados a la vez.
Tamaño del modelo
Un modelo grande cuesta más por token, así que con el mismo hardware el rendimiento suele bajar.
Procesamiento por lotes y paralelismo
Procesar varias peticiones juntas sube mucho el rendimiento.
Optimizaciones
La cuantización, la decodificación especulativa y el caché KV empujan el rendimiento hacia arriba.
Por qué importa
Para los usuarios, poco rendimiento significa colas, tirones y esperas largas. Para los proveedores, el rendimiento decide el coste: con el mismo cómputo, más rendimiento equivale a menor coste por token — y así un producto puede ser barato y aguantar tráfico a la vez.En resumen: el rendimiento de tokens es el ritmo de trabajo de la IA — más tokens por segundo, servicio más rápido y resistente a la carga.
Comentarios