404 Mates
IA Générative

Qwen, Kimi, DeepSeek : la bataille du coût de l’IA

Qwen, Kimi et DeepSeek atteignent désormais la frontière sur plusieurs usages, souvent pour bien moins cher. Mais la récente hausse de DeepSeek montre que la guerre des prix des modèles chinois ne sera pas linéaire.

Profil éditorial · IA & outils

Noa Lumen

En bref

  • Qwen3.8-Max a débuté #4 du leaderboard Frontend Code d’Arena.ai, juste devant Claude Fable 5 (#5). Kimi K3 avait pris la première place en juillet.
  • Dans le test de Kilo, Qwen coûte 3,05 $ contre 8,44 $ pour Fable : 36 % du coût total, et 28 % hors tâche podcast atypique.
  • Qwen3.8-Max est un MoEMixture of Experts : architecture où seules certaines « experts » (sous-réseaux) s’activent par token, pour scaler la capacité. de 2 400 milliards de paramètres, 95 milliards actifs par tokenUnité de texte traitée par un modèle (souvent un morceau de mot). Les coûts et fenêtres de contexte se comptent en tokens. et 1 million de tokens de contexte. En APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks). internationale à Singapour : 2 $/M en entrée, 6 $/M en sortie et 0,25 $/M en lecture de cache implicite.
  • Qwen3.8-Max est désormais open-weightModèle dont les poids sont publiés (ex. Llama, Mistral), par opposition à une API fermée uniquement. sous licence Qwen3.8-Max ; le checkpoint public 2.4T est text-only. À l’inverse, Qwen3.8-27B est multimodalModèle capable de traiter plusieurs modalités (texte, image, audio, vidéo) dans un même pipeline., Apache 2.0 et disponible en GGUFRéduction de la précision numérique des poids pour diminuer mémoire et coût d’inférence, avec un trade-off qualité. Q4_K_M autour de 19 Go.
  • DeepSeek V4-Pro coûte 0,66 $/M en entrée hors cache et 1,98 $/M en sortie hors pointe, 1,32 $ et 3,96 $ en pointe. La guerre des prix reste forte, mais elle n’est ni uniforme ni linéaire.
Sommaire · 6 sections

Pendant longtemps, le marché des grands modèles de langage a surtout été raconté comme une course entre OpenAILaboratoire d’IA américain à l’origine des modèles GPT et de ChatGPT, accessibles par API et non téléchargeables., AnthropicLaboratoire d’IA américain à l’origine des modèles Claude, accessibles par API et non téléchargeables. et Google. Les laboratoires chinois existaient déjà dans le paysage, mais ils étaient souvent présentés comme des challengers : moins chers, parfois ouverts, techniquement solides, sans forcément être placés au même niveau que les meilleurs modèles propriétaires américains.

Cette lecture devient de plus en plus difficile à tenir.

Le 19 août, Kilo a publié un comparatif entre Qwen3.8-Max d’Alibaba et Claude Fable 5 sur dix tâches de génération d’interfaces. Alibaba Cloud a officiellement lancé Qwen3.8-Max le 3 août, après une preview présentée en juillet ; le billet Qwen est lui daté du 2 août. Le modèle avait débuté à la quatrième place du leaderboard Frontend Code d’Arena.ai, juste devant Claude Fable 5, cinquième. Quelques semaines plus tôt, Kimi K3 avait, lui, pris la première place du classement.

Un benchmarkJeu de référence public ou interne pour comparer des modèles (MMLU, HumanEval, etc.) — à lire avec prudence hors domaine. ne suffit évidemment pas à déclarer un vainqueur. Mais quand plusieurs modèles issus de laboratoires chinois commencent à se retrouver dans la même zone que les références du marché, une autre question devient plus intéressante : combien coûte cette performance ?

Qwen n’a plus besoin d’être « presque aussi bon »

Dans le test de Kilo, Claude Fable 5 reste légèrement préféré : quatre victoires contre trois pour Qwen, avec trois égalités. Les auteurs insistent eux-mêmes sur la petite taille de l’échantillon et sur la part subjective d’un jugement visuel.

Mais l’écart qualitatif est suffisamment faible pour que le prix change complètement la lecture du résultat.

Le run complet a coûté 3,05 dollars avec Qwen3.8-Max contre 8,44 dollars avec Claude Fable 5. Qwen représente donc environ 36 % du coût de Fable sur l’ensemble du test. En retirant la tâche podcast, particulièrement atypique, il tombe à 28 %, soit presque exactement le ratio obtenu par Kimi K3 dans le précédent comparatif de Kilo.

L’écart se retrouve aussi dans la grille officielle. Qwen3.8-Max est un Mixture of Experts de 2 400 milliards de paramètres, dont 95 milliards actifs par token, avec 1 million de tokens de contexte sur le service hébergé. Dans la région internationale de Singapour d’Alibaba Cloud Model Studio, l’API est facturée 2 dollars par million de tokens en entrée, 6 dollars en sortie et 0,25 dollar pour les lectures de cache implicite.

Le prix au token ne raconte toutefois qu’une partie de l’histoire. Qwen a mis en moyenne 7 min 55 par tâche, contre 2 min 11 pour Fable. Il a également dû être relancé sur trois tâches, dont une quatre fois. Ces tentatives ratées ont généré des coûts qui ne figurent pas dans le tableau final de Kilo.

À l’inverse, Qwen tournait au niveau de raisonnement xhigh, le plus coûteux de ses cinq réglages disponibles. Un niveau inférieur pourrait encore réduire la facture, sans que l’on sache précisément à quel prix en qualité.

Qwen est désormais open-weight, mais pas sans nuance

Le comparatif de Kilo indiquait encore que les poids n’avaient pas été publiés. Cette information était déjà dépassée au moment de sa parution : Alibaba a bien publié le checkpoint Qwen3.8-2.4T-A95B sur Hugging Face sous une licence propriétaire Qwen3.8-Max. C’est la première fois qu’un modèle Max de Qwen bascule en open-weight.

La nuance se situe ailleurs : le checkpoint 2.4T publié est text-only, alors que la version hébergée de Qwen3.8-Max propose davantage de capacités, notamment la vision et le contexte million de tokens natif. À côté, le plus petit Qwen3.8-27B est publié sous Apache 2.0, conserve des capacités multimodales texte-image-vidéo et dispose de 262 144 tokens de contexte natif, extensibles via YaRN pour des usages plus longs.

Pour une petite équipe, c’est peut-être même la partie la plus concrète de l’annonce. Le 27B existe déjà en GGUF Q4_K_M autour de 19 Go, utilisable avec llama.cpp : sur le papier, cela le rend envisageable sur une machine équipée d’une carte graphique 24 Go. À ne pas confondre avec les builds NVFP4 d’environ 20,6 Go, qui ciblent les GPUProcesseur graphique massivement parallèle, standard de fait pour entraîner et servir des modèles de deep learning. NVIDIA Blackwell et ne tournent pas nativement sur une RTX 4090, basée sur Ada.

Qwen est donc bien entré dans l’open-weight, mais toutes les variantes ne sont ni équivalentes ni soumises à la même licence.

C’est précisément ce qui rend le sujet intéressant : le marché commence à sortir du simple classement des modèles pour entrer dans une comparaison du coût réel d’exécution d’une tâche.

Kimi K3 pousse aussi la frontière des modèles open-weight

Moonshot AI illustre une autre facette de cette montée en puissance avec Kimi K3, lancé le 16 juillet.

Le modèle compte 2 800 milliards de paramètres. Il repose sur Kimi Delta Attention et Attention Residuals, avec un Stable LatentMoE qui active 16 experts sur 896, tout en proposant une vision native et un contexte d’un million de tokens.

Les poids complets ont été publiés fin juillet sous la Kimi K3 License. Juridiquement, elle ressemble beaucoup à MIT mais ajoute deux garde-fousRègles et filtres (policy, classifiers, allowlists) qui limitent les sorties ou actions dangereuses d’un système IA.. Un opérateur de « Model as a Service » dépassant 20 millions de dollars de revenus cumulés sur 12 mois glissants doit conclure un accord séparé avec Moonshot. Et un produit dépassant 100 millions d’utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels doit afficher la mention « Kimi K3 ». L’usage interne est explicitement exempté.

Pour une agence, une PME ou la majorité des équipes produit, la licence reste donc très permissive en pratique. La distinction avec une licence Apache ou MIT pure existe, mais elle vise surtout les très gros opérateurs.

Le laboratoire reconnaît par ailleurs explicitement que K3 reste globalement derrière Claude Fable 5 et GPT 5.6 Sol, et évoque encore un écart d’expérience utilisateur face à ces deux modèles. Le positionnement est néanmoins révélateur : Moonshot ne se compare plus seulement aux autres modèles ouverts, mais directement à la frontière propriétaire.

Son API officielle est facturée 0,30 dollar par million de tokens d’entrée lorsque le cache est utilisé, 3 dollars hors cache et 15 dollars en sortie. Le cache joue ici un rôle important : Moonshot affirme dépasser 90 % de taux de hit dans certains workloads de code, ce qui peut réduire fortement le coût réel d’un agent travaillant longtemps sur le même contexte.

DeepSeek rappelle que la guerre des prix n’est pas linéaire

DeepSeek avait rendu la pression tarifaire particulièrement visible en 2025 et au lancement de V4. Mais son évolution récente apporte une nuance importante au récit du « toujours moins cher ».

À l’occasion de la disponibilité générale de V4-Pro, DeepSeek a annoncé une nouvelle grille tarifaire entrée en vigueur le 16 août 2026 à 16 h UTC, avec distinction entre heures pleines et heures creuses. DeepSeek indique que les tarifs hors pointe sont 50 % inférieurs aux tarifs de pointe.

Pour V4-Pro, l’entrée hors cache est facturée 0,66 dollar par million de tokens hors pointe et 1,32 dollar en pointe. La sortie passe à 1,98 dollar hors pointe et 3,96 dollars en pointe. Avant cette refonte, les prix affichés étaient respectivement de 0,435 dollar pour l’entrée hors cache et 0,87 dollar pour la sortie.

Cette tarification ajoute une dimension très concrète pour les builders : les traitements non urgents, évaluations, indexations ou batchs peuvent être décalés vers les longues plages hors pointe pour diviser la facture par deux. Le prix du modèle devient donc aussi un problème de scheduling.

Autrement dit, même DeepSeek — qui a largement contribué à installer l’idée d’une intelligence très bon marché — vient de relever fortement ses tarifs de pointe.

Cela ne détruit pas la thèse d’une pression générale à la baisse sur le coût de l’IA. Cela la rend plus réaliste. Le prix d’un modèle dépend aussi de la demande, de la rareté du calcul, du niveau de raisonnement et du type de workload. Le coût marginal de l’intelligence ne baisse pas de façon régulière.

Un token moins cher ne fait pas forcément une tâche moins chère

Le premier effet de cette compétition tarifaire est assez évident : davantage d’entreprises peuvent utiliser des modèles performants sans réserver des budgets considérables à l’inférencePhase d’utilisation d’un modèle déjà entraîné : produire une sortie à partir d’une entrée (par opposition à l’entraînement)..

Mais lorsqu’un modèle devient moins cher, un agent peut aussi consommer davantage de calcul : explorer plusieurs pistes, produire plusieurs implémentations, relire son résultat, lancer des tests, inspecter une capture d’écran, corriger son interface ou déléguer certaines étapes à des sous-agents.

Le comparatif de Kilo en donne une bonne illustration. Sur la tâche podcast, Qwen a installé Playwright, lancé Chromium, pris des captures de sa propre page, puis itéré. Cette boucle a coûté 0,90 dollar avec Qwen contre 0,88 dollar avec Fable : son avantage tarifaire a donc non seulement disparu sur cette tâche, mais s’est légèrement inversé.

C’est le meilleur résumé du problème. Un modèle peut coûter cinq ou huit fois moins cher au token et finir par coûter autant sur une tâche s’il raisonne plus longtemps, appelle davantage d’outils ou doit recommencer.

Le futur du coût IA se mesure donc de moins en moins uniquement en dollars par million de tokens. Il faut regarder le coût par tâche réussie.

Vers des stacks où le meilleur modèle n’est plus utilisé partout

Cette évolution favorise aussi les architectures multi-modèles.

Si plusieurs modèles sont suffisamment bons, il devient moins rationnel d’envoyer toutes les requêtes au modèle le plus cher. Un produit peut réserver un modèle premium aux décisions difficiles et utiliser Qwen, Kimi, DeepSeek ou d’autres modèles pour les étapes intermédiaires, la recherche, la synthèse, le classement ou la vérification.

Les routeurs de modèles comme OpenRouter vont exactement dans cette direction : le choix du modèle devient une décision dynamique, prise en fonction de la tâche, du prix, de la latenceDélai avant (ou pendant) la réponse d’un modèle. Le TTFT mesure le temps jusqu’au premier token. ou de la disponibilité.

Et plus les écarts de prix et de comportement grandissent, plus cette optimisation devient intéressante.

La domination ne se jouera probablement pas sur un seul leaderboard

Il serait tentant de résumer le mouvement par « les modèles chinois rattrapent les modèles américains ». C’est probablement trop simple.

Les benchmarks restent sensibles au protocole, au harnessCadre d’évaluation / d’exécution qui mesure, contraint et observe un modèle ou un agent (jeux de tests, métriques, logs). utilisé, au niveau de raisonnement, au nombre de tentatives et au type de tâches. La fiabilité, la vitesse, les outils disponibles, la gouvernance des données, les licences et la disponibilité géographique comptent également.

Mais un changement est déjà visible : les modèles chinois ne sont plus seulement une catégorie à part dans les comparatifs. Qwen, Kimi et DeepSeek sont désormais assez performants pour entrer dans les décisions d’architecture au même titre que Claude, GPT ou Gemini.

Et leur pression tarifaire dépasse largement leurs propres utilisateurs, même lorsqu’elle connaît des à-coups comme la récente hausse de DeepSeek.

Si une qualité proche de la frontière peut être servie pour une fraction du prix sur certaines tâches, tous les fournisseurs sont poussés à rendre leurs modèles plus efficaces, à mieux exploiter le cache, à proposer des variantes rapides ou à justifier le premium de leurs modèles les plus coûteux.

La prochaine bataille des modèles ne sera donc peut-être pas celle du score absolu. Elle pourrait être celle du nombre de tâches utiles que l’on peut accomplir pour un dollar — et du temps nécessaire pour y parvenir.

Lecture 404 Mates

Le signal important n’est pas qu’un modèle chinois gagne ponctuellement un benchmark. C’est que plusieurs laboratoires — Alibaba avec Qwen, Moonshot AI avec Kimi, DeepSeek — arrivent simultanément dans une zone où le choix d’un modèle peut se faire sur le prix, la latence, l’ouverture des poids ou le comportement agentique plutôt que sur un écart massif de qualité.

La récente hausse de prix de DeepSeek ajoute une nuance essentielle : la baisse du coût de l’intelligence n’est pas une ligne droite. À mesure que les workloads agentiques consomment davantage de calcul, le vrai indicateur devient le coût par tâche réussie, pas le simple prix par million de tokens. Le nouveau système peak/off-peak de DeepSeek rend même le scheduling des batchs directement économique.

Pour une agence ou une petite équipe, l’évolution la plus concrète est peut-être ailleurs : Qwen3.8-27B combine texte, image et vidéo, Apache 2.0 et 262 144 tokens de contexte natif. Des quantifications GGUF Q4_K_M tournent autour de 19 Go, ce qui rend le modèle envisageable sur une machine équipée d’une carte 24 Go via llama.cpp. Attention toutefois à ne pas confondre cela avec les builds NVFP4 d’environ 20,6 Go : elles ciblent les GPU Blackwell et ne sont pas compatibles nativement avec une RTX 4090 (Ada).

Poursuivez votre lecture

Tout afficher