LuAITools.com
提交工具
📦AI
Encoger modelos para que corran en cualquier parte

Cuantización

La cuantización comprime los parámetros de un modelo de flotantes de alta precisión a enteros de pocos bits, adelgazando los modelos, acelerándolos y ahorrando memoria: la clave para ejecutar modelos grandes en local.

¿Qué es la cuantización?

Cada parámetro de un modelo se guarda normalmente como un número de coma flotante de 32 o 16 bits: preciso, pero pesado. La cuantización comprime esos números a enteros de 8, 4 o incluso menos bits. Es como comprimir una foto en alta resolución a un archivo más pequeño: tu ojo apenas lo nota, pero el archivo es varias veces menor.

¿Por qué ayuda?

Ahorra memoria
Un modelo de 7 mil millones de parámetros ocupa unos 28GB a 32 bits. A 4 bits, unos 3,5GB: lo aguanta un ordenador normal.
Acelera
La aritmética entera corre más rápido que la de coma flotante, así que la inferencia se nota más ágil.
Baja la barrera
La cuantización es la razón de que los modelos grandes corran en móviles y portátiles en vez de vivir solo en la nube.

¿Vuelve más tonto al modelo?

Se pierde algo de precisión, pero normalmente poco. Los buenos métodos eligen valores representativos o mantienen sin cuantizar las capas sensibles, para minimizar el daño. En la práctica, 8 bits es casi sin pérdida, y 4 bits es aceptable en la mayoría de tareas.

Enfoques comunes

Cuantización post-entrenamiento (PTQ)
Comprimir tras entrenar: simple y rápido.
Entrenamiento consciente de cuantización (QAT)
Simular el error de cuantización durante el entrenamiento para que el modelo se adapte pronto, con más precisión.

¿Qué desbloquea?

La cuantización hace posible que cualquiera ejecute un modelo grande en local, y es la lógica de formatos como GGUF, AWQ y GPTQ. Es el puente que saca los grandes modelos del laboratorio y los lleva al dispositivo de cada persona.

En resumen: la cuantización adelgaza el modelo, cambiando un poco de precisión por mucho ahorro de memoria y velocidad.

Comentarios