IA
Latence
Aussi : TTFT · time to first token
En clair
La latence est le temps d’attente ressenti face à un système. Pour un modèle qui rédige, on distingue le délai avant le premier mot affiché et le temps total jusqu’à la fin de la réponse. Afficher le texte au fur et à mesure ne réduit pas le second, mais rend l’attente supportable — ce qui change tout du point de vue de l’utilisateur.
Concrètement
Un assistant utilisé pendant un appel client vise moins d’une seconde avant le premier mot, et moins de cinq secondes au total.
Pourquoi ça compte
Un modèle excellent mais lent n’est pas adopté. Optimiser la qualité sans fixer un budget de temps produit des démonstrations qui ne survivent pas au terrain.
Définition technique
Délai avant (ou pendant) la réponse d’un modèle. Le TTFT mesure le temps jusqu’au premier token.
Termes liés
Vu dans ces articles
- LLM auto-hébergés en agence : choisir selon l’usage, pas le benchmark13 septembre 2026
- Agents API : OpenAI ouvre le harness Codex aux développeurs — ce qui est livré, ce qui manque12 septembre 2026
- ChatGPT Images 2.5 : ce qui change vraiment pour créer et retoucher des images8 septembre 2026
- Votre IDE IA survivrait-il à une coupure fournisseur ? Grille d'audit en 5 points pour reprendre le contrôle30 août 2026
- API vidéo OpenRouter : un endpoint pour Seedance, Veo et Wan28 août 2026