LuAITools.com
提交工具
🧮AI
Ajusta modelos grandes con una sola GPU

QLoRA

QLoRA junta la cuantización y LoRA en un solo truco: mete el ajuste fino de modelos grandes en una sola GPU de consumo, recortando la memoria en un orden de magnitud con una calidad que apenas baja.

¿Qué es QLoRA?

La mayor barrera para ajustar un modelo grande es la memoria: solo los pesos de un modelo de 70B ocupan cientos de gigabytes, fuera del alcance de casi todo el mundo. El truco de QLoRA es combinar cuantización con LoRA. Primero cuantiza los pesos a 4 bits para que el modelo base se vuelva diminuto, y luego le cuelga encima un accesorio LoRA entrenable. Resultado: una sola GPU de consumo, como una 4090 de 24GB, puede ajustar modelos que nunca habrías soñado tocar.

¿Cómo ahorra tanto?

Cuantización: comprimir los pesos a 4 bits
Los pesos normalmente viven en 16 o 32 bits. QLoRA los guarda en 4 bits, recortando la memoria necesaria en un orden de magnitud.
Descomprimir solo cuando hace falta
Los valores de 4 bits se restauran temporalmente a mayor precisión solo para el paso que los necesita; el resto del tiempo siguen comprimidos en memoria.
LoRA entrena solo un accesorio pequeño
La base se congela y el entrenamiento solo actualiza las matrices de bajo rango enchufadas encima, así que la memoria de gradientes también se encoge.

¿Qué más resuelve?

Hace posible el ajuste fino personal
Ajustar un modelo grande antes era cosa de laboratorios y gigantes. Tras QLoRA, investigadores individuales y startups pueden ponerse en marcha con una GPU de gaming.
Calidad cercana al ajuste completo
El paper muestra que QLoRA compite de tú a tú con el ajuste completo en muchas tareas, con una fracción de memoria y tiempo.

¿Qué vigilar con QLoRA?

Sigue siendo un método de «rentabilidad». La cuantización conlleva una pequeña pérdida de precisión, y en tareas muy exigentes el ajuste completo aún puede sacar ventaja. Pero en la gran mayoría de los casos, la comodidad de QLoRA supera con creces ese coste.

En resumen: QLoRA = base cuantizada más un accesorio LoRA, para que puedas ajustar un modelo grande con una sola GPU de consumo.

Comentarios