IA
SFT
Aussi : Supervised Fine-Tuning
En clair
On montre au modèle des milliers de paires « demande / bonne réponse » rédigées par des experts, et on l’entraîne à reproduire ce style et ce format. C’est l’étape qui lui apprend à répondre à des instructions plutôt qu’à continuer un texte. Ce qu’il apprend vaut exactement ce que valent les réponses de référence.
Concrètement
Dix mille échanges validés par des experts métier pour obtenir un assistant qui répond déjà au bon format.
Pourquoi ça compte
Les étapes d’alignement suivantes polissent ce socle sans le corriger. Un socle appris sur des réponses médiocres reste médiocre après polissage.
Définition technique
Supervised Fine-Tuning : fine-tuning sur des paires instruction → réponse de référence.
À ne pas confondre avec
- RLHF — SFT apprend des réponses de référence ; RLHF / DPO alignent via des préférences.