IA
Eval
Aussi : evals · évaluation LLM · LLM eval
En clair
Une eval est un examen que vous construisez vous-même : une liste de cas représentatifs de votre activité, un critère de réussite pour chacun, et un score. Elle remplace le « ça a l’air bien » par un chiffre comparable d’une version à l’autre. C’est le seul moyen de savoir si un changement de modèle ou de consigne améliore ou dégrade vos résultats.
Concrètement
Deux cents tickets de support notés avant et après un changement de consigne montrent en une heure si la modification a servi à quelque chose.
Pourquoi ça compte
Sans eval, chaque mise à jour d’un fournisseur devient un pari. Les régressions passent inaperçues jusqu’à ce qu’un client les signale.
Définition technique
Jeux de tests et métriques pour mesurer la qualité d’un modèle ou d’un agent sur des tâches ciblées.
À ne pas confondre avec
- Benchmark — Un eval est un protocole de mesure ; un benchmark est souvent un jeu public de comparaison.
Termes liés
Vu dans ces articles
- Agents API : OpenAI ouvre le harness Codex aux développeurs — ce qui est livré, ce qui manque12 septembre 2026
- WordPress 7.0.4 corrige une faille RCE critique via Imagick12 août 2026
- Kitesurf : Cloudflare lance un navigateur conçu pour les agents IA, sans Chromium7 août 2026
- Code Connect dans le MCP Figma : -30 % de tokens, +1 point de qualité5 août 2026