LuAITools.com
提交工具
🚀AI
Una forma más rápida de servir LLMs

vLLM

vLLM es un motor de inferencia de código abierto y alto rendimiento que pagina la VRAM con PagedAttention, dejando que una GPU atienda muchas más peticiones simultáneas.

¿Qué es vLLM?

vLLM es un motor de inferencia de código abierto para modelos de lenguaje grandes, creado para responder una pregunta: ¿cómo consigues que una sola GPU atienda a más gente y más rápido? Su truco central se llama PagedAttention, que gestiona la VRAM con la misma precisión con la que un sistema operativo gestiona la memoria — y el rendimiento se dispara.

¿Qué duele en la inferencia tradicional?

VRAM fragmentada
Cada petición reserva un bloque de VRAM para su caché KV, pero las peticiones varían de longitud. Reservas de más y desperdicias; de menos y te quedas corto. En cualquier caso, la memoria acaba en fragmentos.
Las peticiones hacen cola
Un mal uso de la memoria implica menos peticiones simultáneas, así que la gente solo espera.

¿Cómo lo arregla PagedAttention?

Trocea la memoria en páginas
Como un SO que usa paginación, corta la caché KV en bloques de tamaño fijo asignados bajo demanda.
Guarda solo lo que de verdad se usa
En lugar de reservar un bloque grande por petición, asigna lo necesario: la fragmentación casi desaparece.
Procesamiento por lotes dinámico
Con la memoria bien aprovechada, atiende más peticiones a la vez y agrupa con criterio unas con otras.

Por qué importa

vLLM ha llevado «cuánta gente puede atender una tarjeta» a otro nivel y está detrás de muchos servicios de modelos en línea. Para quien publica una app de IA, significa menor coste, más concurrencia y esperas más cortas.

En resumen: vLLM trata la inferencia de modelos grandes como un SO trata la memoria — paginando la fragmentación para que una GPU sirva a más gente.

Comentarios