¿Qué es la cuantización?
Cada parámetro de un modelo se guarda normalmente como un número de coma flotante de 32 o 16 bits: preciso, pero pesado. La cuantización comprime esos números a enteros de 8, 4 o incluso menos bits. Es como comprimir una foto en alta resolución a un archivo más pequeño: tu ojo apenas lo nota, pero el archivo es varias veces menor.¿Por qué ayuda?
Ahorra memoriaUn modelo de 7 mil millones de parámetros ocupa unos 28GB a 32 bits. A 4 bits, unos 3,5GB: lo aguanta un ordenador normal.
Acelera
La aritmética entera corre más rápido que la de coma flotante, así que la inferencia se nota más ágil.
Baja la barrera
La cuantización es la razón de que los modelos grandes corran en móviles y portátiles en vez de vivir solo en la nube.
¿Vuelve más tonto al modelo?
Se pierde algo de precisión, pero normalmente poco. Los buenos métodos eligen valores representativos o mantienen sin cuantizar las capas sensibles, para minimizar el daño. En la práctica, 8 bits es casi sin pérdida, y 4 bits es aceptable en la mayoría de tareas.Enfoques comunes
Cuantización post-entrenamiento (PTQ)Comprimir tras entrenar: simple y rápido.
Entrenamiento consciente de cuantización (QAT)
Simular el error de cuantización durante el entrenamiento para que el modelo se adapte pronto, con más precisión.
¿Qué desbloquea?
La cuantización hace posible que cualquiera ejecute un modelo grande en local, y es la lógica de formatos como GGUF, AWQ y GPTQ. Es el puente que saca los grandes modelos del laboratorio y los lleva al dispositivo de cada persona.En resumen: la cuantización adelgaza el modelo, cambiando un poco de precisión por mucho ahorro de memoria y velocidad.
Comentarios