404 Mates

Accueil/Lexique/IA

IA

SFT

Aussi : Supervised Fine-Tuning

En clair

On montre au modèle des milliers de paires « demande / bonne réponse » rédigées par des experts, et on l’entraîne à reproduire ce style et ce format. C’est l’étape qui lui apprend à répondre à des instructions plutôt qu’à continuer un texte. Ce qu’il apprend vaut exactement ce que valent les réponses de référence.

Concrètement

Dix mille échanges validés par des experts métier pour obtenir un assistant qui répond déjà au bon format.

Pourquoi ça compte

Les étapes d’alignement suivantes polissent ce socle sans le corriger. Un socle appris sur des réponses médiocres reste médiocre après polissage.

Définition technique

Supervised Fine-Tuning : fine-tuning sur des paires instruction → réponse de référence.

À ne pas confondre avec

  • RLHFSFT apprend des réponses de référence ; RLHF / DPO alignent via des préférences.

Termes liés

Vu dans ces articles

← Tout le lexique