404 Mates

Accueil/Lexique/IA

IA

QLoRA

Aussi : QLoRA

En clair

QLoRA combine deux économies : on compresse le modèle de départ pour qu’il occupe moins de mémoire, et on n’entraîne que de petits modules ajoutés. Adapter un modèle devient possible sur une seule carte graphique, là où il en fallait plusieurs. La compression peut coûter un peu de précision, à vérifier sur vos propres cas.

Concrètement

Adapter un modèle de sept milliards de paramètres sur une seule carte de vingt-quatre gigaoctets, là où la méthode complète ne tenait pas.

Pourquoi ça compte

Beaucoup d’équipes renoncent à adapter un modèle en croyant qu’il faut un parc de machines. À l’inverse, trop compresser dégrade discrètement les cas les plus délicats.

Définition technique

Variante de LoRA qui quantifie le modèle de base (souvent 4-bit) pour fine-tuner avec encore moins de mémoire.

À ne pas confondre avec

  • LoRALoRA sans quantification lourde du backbone ; QLoRA ajoute l’INT4/équivalent.

Termes liés

← Tout le lexique