404 Mates

Accueil/Lexique/IA

IA

DPO

Aussi : Direct Preference Optimization

En clair

Pour rendre un modèle plus utile, on lui montre des paires de réponses en désignant la meilleure. Le DPO ajuste le modèle directement à partir de ces choix, sans passer par l’étape intermédiaire qu’exigent d’autres méthodes d’alignement. Tout repose alors sur la qualité des comparaisons : ce que les annotateurs préfèrent devient ce que le modèle produit.

Concrètement

Deux mille paires « bonne / mauvaise réponse au service client » suffisent souvent à imposer la clarté et le refus d’inventer un prix.

Pourquoi ça compte

Si les préférences récompensent ce qui plaît plutôt que ce qui est exact, on obtient un modèle agréable et faux. Le critère de tri est une décision métier, pas un réglage technique.

Définition technique

Direct Preference Optimization : méthode d’alignement sur préférences sans reward model RL explicite.

Termes liés

← Tout le lexique