IA
DPO
Aussi : Direct Preference Optimization
En clair
Pour rendre un modèle plus utile, on lui montre des paires de réponses en désignant la meilleure. Le DPO ajuste le modèle directement à partir de ces choix, sans passer par l’étape intermédiaire qu’exigent d’autres méthodes d’alignement. Tout repose alors sur la qualité des comparaisons : ce que les annotateurs préfèrent devient ce que le modèle produit.
Concrètement
Deux mille paires « bonne / mauvaise réponse au service client » suffisent souvent à imposer la clarté et le refus d’inventer un prix.
Pourquoi ça compte
Si les préférences récompensent ce qui plaît plutôt que ce qui est exact, on obtient un modèle agréable et faux. Le critère de tri est une décision métier, pas un réglage technique.
Définition technique
Direct Preference Optimization : méthode d’alignement sur préférences sans reward model RL explicite.