IA
Harness
Aussi : eval harness · evaluation harness · test harness
En clair
Un harness est le banc d’essai d’un modèle ou d’un agent : il rejoue toujours les mêmes scénarios, mesure les résultats, enregistre ce qui s’est passé et impose des limites pendant l’exécution. On ne juge plus sur une démonstration réussie une fois, mais sur un comportement reproductible et comparable d’une version à l’autre.
Concrètement
Un banc d’essai pour un agent de messagerie mesure le taux de courriers correctement classés et lui coupe l’envoi après trois erreurs consécutives.
Pourquoi ça compte
Sans banc d’essai, on compare des anecdotes. Les dérives lentes, les coûts cachés et les échecs rares n’apparaissent que dans des conditions répétées à l’identique.
Définition technique
Cadre d’évaluation / d’exécution qui mesure, contraint et observe un modèle ou un agent (jeux de tests, métriques, logs).
En IA produit, le harness formalise : jeux d’eval, scoring (ex. exactitude, AUROC), replays, budgets tokens et politiques de sécurité. Sans harness, « ça a l’air bien » ne suffit pas.
Termes liés
Vu dans ces articles
- Cline Desktop veut faire des modèles open-weight de vrais agents de travail14 septembre 2026
- Agents API : OpenAI ouvre le harness Codex aux développeurs — ce qui est livré, ce qui manque12 septembre 2026
- Quand une IA « sort de sa boîte » : ce que racontent vraiment les incidents OpenAI5 septembre 2026
- GPT-6 Astra : le modèle de code qu’OpenAI a dû ralentir3 septembre 2026
- Visual Studio passe au multi-modèle pour ses agents IA25 août 2026