IA
QLoRA
Aussi : QLoRA
En clair
QLoRA combine deux économies : on compresse le modèle de départ pour qu’il occupe moins de mémoire, et on n’entraîne que de petits modules ajoutés. Adapter un modèle devient possible sur une seule carte graphique, là où il en fallait plusieurs. La compression peut coûter un peu de précision, à vérifier sur vos propres cas.
Concrètement
Adapter un modèle de sept milliards de paramètres sur une seule carte de vingt-quatre gigaoctets, là où la méthode complète ne tenait pas.
Pourquoi ça compte
Beaucoup d’équipes renoncent à adapter un modèle en croyant qu’il faut un parc de machines. À l’inverse, trop compresser dégrade discrètement les cas les plus délicats.
Définition technique
Variante de LoRA qui quantifie le modèle de base (souvent 4-bit) pour fine-tuner avec encore moins de mémoire.
À ne pas confondre avec
- LoRA — LoRA sans quantification lourde du backbone ; QLoRA ajoute l’INT4/équivalent.