404 Mates

Accueil/Lexique/IA

IA

RLHF

Aussi : Reinforcement Learning from Human Feedback

En clair

Des personnes comparent des réponses deux à deux et désignent la meilleure. On entraîne d’abord un second modèle à imiter ces jugements, puis on s’en sert pour orienter le modèle principal. C’est cette étape qui transforme un modèle brut en assistant utilisable. Ce qu’il tient pour une bonne réponse reflète donc les consignes données aux annotateurs.

Concrètement

Des milliers de comparaisons deux à deux pour réduire les réponses toxiques sans rendre le modèle inutilement évasif.

Pourquoi ça compte

Un modèle aligné n’est pas neutre : il porte les préférences de ceux qui l’ont noté. Comparer un modèle brut à un modèle aligné, c’est comparer deux objets différents.

Définition technique

Reinforcement Learning from Human Feedback : alignement d’un modèle via des préférences humaines et un reward model.

À ne pas confondre avec

  • DPODPO aligne sur préférences sans reward model RL explicite.

Termes liés

Vu dans ces articles

← Tout le lexique