IA
Quantization
Aussi : quantisation · INT4 · INT8 · GGUF
En clair
Les paramètres d’un modèle sont des nombres stockés avec une certaine précision. La quantification réduit cette précision — de seize à quatre bits, par exemple — pour diviser la mémoire nécessaire et accélérer les réponses. On échange un peu de finesse contre beaucoup de coût. L’ampleur de la perte dépend du modèle et de la tâche.
Concrètement
Passer de seize à quatre bits divise la mémoire nécessaire par trois à quatre, pour une perte à valider sur deux cents cas réels.
Pourquoi ça compte
Ignorer cette option revient à surpayer du matériel. L’appliquer sans mesurer revient à déployer un modèle moins cher qui échoue sur les cas critiques.
Définition technique
Réduction de la précision numérique des poids pour diminuer mémoire et coût d’inférence, avec un trade-off qualité.