IA
RLHF
Aussi : Reinforcement Learning from Human Feedback
En clair
Des personnes comparent des réponses deux à deux et désignent la meilleure. On entraîne d’abord un second modèle à imiter ces jugements, puis on s’en sert pour orienter le modèle principal. C’est cette étape qui transforme un modèle brut en assistant utilisable. Ce qu’il tient pour une bonne réponse reflète donc les consignes données aux annotateurs.
Concrètement
Des milliers de comparaisons deux à deux pour réduire les réponses toxiques sans rendre le modèle inutilement évasif.
Pourquoi ça compte
Un modèle aligné n’est pas neutre : il porte les préférences de ceux qui l’ont noté. Comparer un modèle brut à un modèle aligné, c’est comparer deux objets différents.
Définition technique
Reinforcement Learning from Human Feedback : alignement d’un modèle via des préférences humaines et un reward model.
À ne pas confondre avec
- DPO — DPO aligne sur préférences sans reward model RL explicite.