IA
Inférence
Aussi : inference
En clair
L’inférence, c’est le moment où le modèle sert : il est déjà entraîné, on lui soumet une demande, il produit une réponse. À ne pas confondre avec l’entraînement, qui a lieu en amont, coûte très cher et fabrique le modèle une fois pour toutes. L’inférence, elle, se paie à chaque requête : c’est donc elle qui détermine le coût de fonctionnement au quotidien.
Concrètement
Répondre à cinquante demandes par minute avec un modèle existant coûte sans commune mesure moins cher que de le réentraîner chaque semaine.
Pourquoi ça compte
Confondre les deux fausse tous les budgets. La question à trancher n’est pas le prix du modèle, mais le prix d’une réponse multiplié par le nombre de réponses par jour.
Définition technique
Phase d’utilisation d’un modèle déjà entraîné : produire une sortie à partir d’une entrée (par opposition à l’entraînement).
Termes liés
Vu dans ces articles
- Cline Desktop veut faire des modèles open-weight de vrais agents de travail14 septembre 2026
- LLM auto-hébergés en agence : choisir selon l’usage, pas le benchmark13 septembre 2026
- Meta Muse : quand l’IA agit à votre place, la sécurité change d’échelle9 septembre 2026
- Votre IDE IA survivrait-il à une coupure fournisseur ? Grille d'audit en 5 points pour reprendre le contrôle30 août 2026
- Peut-on vraiment construire un détecteur de mensonges pour les IA ?27 août 2026