404 Mates
Développement web

Query fan-out : quand les moteurs IA ne répondent plus à une requête, mais à vingt

Les moteurs IA transforment une question en plusieurs recherches intermédiaires. Les données 2026 sur ChatGPT montrent que ce fan-out s’intensifie — et change déjà la rédaction, le SEO, le GEO et la mesure de visibilité.

Profil éditorial · Développement web

Ninja Span

En bref

  • Google définit officiellement le query fan-out comme la génération de plusieurs requêtes connexes exécutées en parallèle pour récupérer davantage d’informations.
  • Sur GPT-5.6 Sol, Nectiv mesure une hausse de 2,17 à 7,61 fan-outs par promptConsigne / contexte fourni au modèle pour orienter sa génération (system, user, exemples, outils). sur environ 4 000 prompts. Prudence : GPT-5.6 Luna est devenu le modèle par défaut des utilisateurs Free et Go début août 2026, et plus de 90 % des utilisateurs hebdomadaires de ChatGPT sont sur le plan gratuit, selon Olivier de Segonzac chez Resoneo.
  • Le comportement reste très mouvant : Suganthan Mohanadasan a vu ses propres captures passer de 12 à 4 recherches par réponse début août, au moment où search_model_queries est devenu search_queries.
  • L’opérateur site: explose dans les observations : d’environ 0,3 % à 23 % des fan-outs chez Peec AI, et jusqu’à 64 % dans le jeu de donnéesEnsemble de données structuré utilisé pour entraîner, valider ou tester un modèle. Nectiv — un écart lié notamment aux méthodes de collecte APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks). vs interface.
  • Dans l’étude Suganthan, 110 pages sur 3 554 (3,1 %) finissent citées. Sur les marques, 68,9 % de celles nommées dans une requête du modèle apparaissent dans la réponse, contre 2,1 % des marques seulement récupérées ; ce second écart est directionnel et calculé sur des conversations entières. Le résultat le plus propre reste 21 requêtes initiales sur 27 injectant des marques non demandées.
  • La piste défendue par Lily Ray : site: pourrait fonctionner comme un filtre anti-spam à bas coût, une forme d’E-E-A-TExperience, Expertise, Authoritativeness, Trust : grille qualité Google pour évaluer la crédibilité d’un contenu / d’un site. pragmatique côté retrieval. Mais coût et latenceDélai avant (ou pendant) la réponse d’un modèle. Le TTFT mesure le temps jusqu’au premier token. constituent une explication alternative plausible.
  • L’action la plus simple pour les SEOSearch Engine Optimization : ensemble de pratiques pour améliorer la visibilité organique dans les moteurs de recherche. : surveiller dans Google Search Console et Bing Webmaster Tools les requêtes contenant site: et les motifs anormalement volumineux à CTR quasi nul.
Sommaire · 13 sections

Le mot-clé n’est plus toute la requête

Pendant des années, le référencement a reposé sur une abstraction relativement simple : un utilisateur formule une requête, un moteur identifie les documents pertinents, puis les classe.

Les moteurs génératifs ajoutent une couche entre l’intention et les résultats. Ils peuvent découper une question en plusieurs sous-problèmes, lancer plusieurs recherches, comparer les sources puis synthétiser une réponse.

Google appelle officiellement cette mécanique query fan-out. Pour AI Mode et ses expériences génératives, Google décrit des requêtes concurrentes et connexes générées par le modèle afin d’explorer plusieurs sous-thèmes et sources en parallèle.

OpenAILaboratoire d’IA américain à l’origine des modèles GPT et de ChatGPT, accessibles par API et non téléchargeables. documente publiquement que ChatGPT Search peut transformer une demande en une ou plusieurs requêtes, mais ne publie pas une spécification détaillée de ses fan-outs. Les chiffres précis sur leur nombre, les opérateurs utilisés ou les domaines ciblés viennent donc surtout d’études indépendantes, d’inspection du trafic réseau et d’outils qui exposent les recherches intermédiaires.

Cette nuance est essentielle : le mécanisme général est établi, mais la mécanique interne exacte de ChatGPT reste observée de l’extérieur.

GPT-5.6 Sol cherche beaucoup plus qu’avant

C’est le point que les données rendent difficile à ignorer — à condition de préciser de quel modèle on parle et à quelle date on l’observe.

Dans une étude citée par Lily Ray dans Search Engine Journal, Chris Long de Nectiv a comparé environ 4 000 prompts exécutés sur GPT-5.6 Sol à sa baseline 2025. Le nombre moyen de fan-out queries serait passé de 2,17 à 7,61 par prompt. La chaîne la plus longue serait passée de 4 à 29 recherches.

Cette mesure ne doit pas être extrapolée à tous les utilisateurs de ChatGPT. GPT-5.6 existe en plusieurs variantes : Sol est la version standard étudiée ici, tandis qu’OpenAI a fait de GPT-5.6 Luna, moins chère, le modèle par défaut des utilisateurs Free et Go début août 2026. Olivier de Segonzac, chez Resoneo, rappelle que plus de 90 % des utilisateurs hebdomadaires de ChatGPT sont sur le plan gratuit. Autrement dit, le comportement mesuré sur Sol n’est pas nécessairement celui que rencontre l’écrasante majorité des utilisateurs.

David Konitzny, chez Peec AI, observe néanmoins la même direction avec une autre méthodologie. Lors du passage à GPT-5.6, la part des prompts ne déclenchant qu’un seul fan-out serait tombée de 94 % à 43,5 %. Le nombre moyen de sources récupérées aurait à peu près doublé, d’environ 12 à 24, tandis que les prompts nécessitant une seconde itération de recherche seraient passés d’environ 5 % à 33,5 %.

Les deux études ne mesurent pas exactement le même environnement. Nectiv récupère les fan-outs via l’API ; Peec et d’autres outils observent davantage l’expérience ChatGPT côté interface. Il ne faut donc pas fusionner les chiffres comme s’ils provenaient d’un benchmarkJeu de référence public ou interne pour comparer des modèles (MMLU, HumanEval, etc.) — à lire avec prudence hors domaine. unique.

Et surtout, le comportement peut changer en quelques semaines. Suganthan Mohanadasan note que début août 2026, OpenAI a renommé la clé exposant ces recherches de search_model_queries en search_queries et que, dans ses propres captures, les fan-outs sont passés de 12 à 4 recherches par réponse. Son avertissement est simple : ce qui était vrai en juillet ne le sera pas forcément en septembre.

Les données décrivent donc moins une hausse linéaire de « ChatGPT » qu’un système mouvant, où certaines configurations récentes recherchent beaucoup plus qu’avant, tandis que d’autres peuvent réduire brutalement leur profondeur de retrieval.

L’explosion de site: est peut-être le signal le plus important

Le deuxième changement est plus intéressant encore pour les SEO : ChatGPT semble restreindre une part croissante de ses recherches à des domaines précis.

Dans les données de David Konitzny chez Peec AI rapportées par Search Engine Journal, l’opérateur site: passe d’environ 0,3 % à 23 % des fan-outs. Chez Nectiv, il apparaît dans 64 % des requêtes étudiées.

L’écart est énorme, mais il n’invalide pas le signal. Il rappelle surtout que les études ne capturent pas le même système : API d’un côté, interface grand public de l’autre, avec des modèles, comptes et conditions d’observation différents.

Dans les deux cas, la progression de site: est massive.

Le mot « official » et les références à des domaines gouvernementaux apparaissent aussi de plus en plus souvent dans les recherches observées. Lily Ray rapporte par exemple qu’un lot d’environ vingt prompts juridiques a produit uniquement des citations provenant de domaines .gov.

Pour les spécifications et les prix, le routage semble au contraire privilégier les sites de marque et de fabricants. Pour les opinions, les avis et l’expérience utilisateur, les fan-outs se dirigent davantage vers Reddit et les plateformes de reviews.

Autrement dit, le moteur ne cherche pas seulement une bonne page. Il semble d’abord choisir la catégorie de source qui lui paraît légitime pour la question posée.

La thèse de Lily Ray : site: comme filtre anti-spam

C’est le cœur du papier de Lily Ray, et c’est aussi la partie la plus intéressante à discuter.

Son hypothèse est que l’usage de site:, de « official », de .gov ou de domaines reconnus permettrait à ChatGPT de réduire l’exposition aux contenus spammy, auto-promotionnels ou fortement optimisés pour manipuler les moteurs.

Évaluer en temps réel la qualité de chaque page du Web ouvert est coûteux. Limiter une recherche à une source déjà connue — marque officielle, administration, plateforme d’avis reconnue, grand média ou communauté établie — constitue une approximation beaucoup moins chère.

C’est ce que Lily Ray rapproche d’une forme d’E-E-A-T pragmatique côté OpenAI : plutôt que de scorer finement l’autorité de chaque page, le moteur restreint d’abord l’espace dans lequel il accepte de chercher.

Il faut néanmoins conserver l’hypothèse alternative qu’elle mentionne elle-même : le coût et la latence. Chercher dans une poignée de domaines identifiés est aussi plus rapide et moins cher que d’évaluer l’ensemble du Web. Vu de l’extérieur, une optimisation économique pourrait ressembler exactement à un filtre qualité.

On ne peut donc pas conclure que site: est officiellement un système anti-spam d’OpenAI. Mais les données montrent qu’il devient une composante importante du retrieval, et la question du « pourquoi » mérite autant d’attention que la hausse brute du nombre de requêtes.

Retrieval et citation sont deux compétitions différentes

Une page retrieved est une page récupérée par le système pendant ses recherches. Une page cited est une page finalement créditée dans la réponse visible.

Les deux métriques divergent fortement.

Olivier de Segonzac et l’équipe Resoneo ont observé une baisse du nombre de domaines uniques cités par réponse, de 19 à 15 après la mise à jour 5.3, alors même que d’autres études voyaient le nombre de pages récupérées augmenter.

Le test de Suganthan Mohanadasan rend l’écart encore plus concret. Sur 57 conversations et 3 554 pages récupérées, seules 110 pages, soit environ 3,1 %, ont finalement été citées.

Ces chiffres doivent toutefois être lus avec la méthodologie de l’auteur. Suganthan a travaillé à partir d’un seul compte ChatGPT Plus basé à Dubaï, échantillonné les 24 et 25 juillet 2026, sur un corpus orienté logiciels et outils IA. Le motif d’injection de marque a été mesuré sur 27 requêtes initiales seulement. Il souligne lui-même que la personnalisation est visible dans ses données et qualifie les pourcentages de directionnels. Lily Ray juge l’échantillon relativement petit, tout en notant que la direction rejoint d’autres observations plus larges.

Cela donne une chaîne de visibilité plus complexe que le classique « impression → clic » :

requête utilisateur → fan-out → retrieval → sélection → citation → clic éventuel.

Être trouvé n’est plus la fin du travail. C’est l’entrée dans un nouveau filtre.

Être nommé dans le fan-out augmente fortement les chances d’être mentionné

Le même travail de Suganthan Mohanadasan apporte un autre résultat stratégique — avec les limites d’échantillon rappelées ci-dessus.

Sur 27 requêtes initiales analysées, 21 contenaient des marques que l’utilisateur n’avait pas mentionnées, et ce phénomène apparaissait dans 11 des 13 catégories de produits testées.

Son exemple sur « the best AI note-taking app » est particulièrement parlant. Dès la première recherche intermédiaire, ChatGPT incluait déjà des marques comme Granola, Notion AI, Otter, Fireflies, Fathom, Mem et Limitless.

Ce n’est donc pas un exemple théorique : dans cet échantillon, le moteur semble parfois construire une shortlist avant même d’avoir récupéré les pages.

Sur l’ensemble des conversations, 119 marques nommées dans une requête du modèle ont été mentionnées dans la réponse finale dans 68,9 % des cas. À l’inverse, parmi 515 marques récupérées sans jamais être nommées dans les requêtes du modèle, seules 2,1 % ont été mentionnées dans la réponse.

Ces deux pourcentages ne doivent cependant pas être lus comme une causalité propre. Suganthan précise qu’ils sont calculés sur des conversations entières : une marque découverte au premier tour puis requêtée au second peut être comptée comme « pré-connue ». C’est pourquoi il considère lui-même le 21 sur 27 observé sur la toute première requête comme le résultat le plus propre, plutôt que l’écart spectaculaire de 68,9 % contre 2,1 %.

Il a d’ailleurs corrigé le titre et la formulation forte de son article le 17 août 2026 après de nouveaux tests : des marques qui n’apparaissent jamais dans les requêtes propres au modèle peuvent malgré tout atteindre la réponse finale, y compris la recommandation. La recherche modifie donc réellement le résultat ; la shortlist initiale n’est pas un verdict.

La bonne lecture est plus nuancée : être déjà associé à une catégorie dans les requêtes du modèle constitue un avantage potentiel, mais une marque absente de cette première sélection peut encore émerger grâce au retrieval.

C’est ici que le GEOGenerative Engine Optimization : stratégies pour apparaître dans les réponses génératives (AI Overviews, chatbots). rejoint directement la construction de marque, les relations presse, les comparatifs, les avis et la présence éditoriale : l’enjeu est à la fois d’entrer dans le vocabulaire de la catégorie et de disposer de pages capables de gagner la sélection lorsque le moteur élargit sa recherche.

Reddit : omniprésent dans le retrieval, presque toujours éliminé

Reddit illustre parfaitement la différence entre récupération et citation.

Dan Petrovic a observé que ChatGPT écarterait les pages Reddit récupérées environ 99 % du temps. Pris isolément, le chiffre pourrait donner l’impression que Reddit compte peu.

Pourtant, Reddit apparaît aussi en tête des domaines les plus cités dans les données Ahrefs citées par Lily Ray.

Les deux résultats peuvent coexister : si un domaine est récupéré extrêmement souvent, même un taux de survie d’environ 1 % peut suffire à produire énormément de citations en valeur absolue.

Pour les marques, la conclusion n’est donc pas « il faut spammer Reddit ». Elle est plus subtile : les discussions Reddit peuvent influencer la compréhension d’une catégorie par le modèle, même lorsqu’elles ne deviennent pas la source finale visible.

C’est une différence majeure entre présence dans l’écosystème informationnel et attribution finale.

Quand ChatGPT devine mal le domaine officiel

Le recours massif à site: crée aussi une faiblesse structurelle : encore faut-il que le moteur connaisse le bon domaine.

Malte Landwehr a documenté plusieurs cas où ChatGPT construisait des recherches site: vers des domaines incorrects ou parqués. Pour la startup Census, par exemple, le système cherchait site:census.com alors que son domaine officiel est getcensus.com.

Il a observé des problèmes similaires avec d’autres marques et domaines potentiellement ambigus.

Une étude Netcraft publiée en 2025 avait déjà montré un risque voisin sur les liens de connexion générés par des LLMLarge Language Model : modèle de langage entraîné sur d’énormes corpus pour prédire et générer du texte. : 34 % des domaines suggérés dans leur test n’étaient pas contrôlés par la marque concernée, dont 29 % étaient non enregistrés, parqués ou inactifs.

Le sujet dépasse donc le SEO. Si un modèle associe une marque au mauvais domaine et décide ensuite de lui faire confiance via site:, l’erreur peut contaminer le retrieval lui-même.

Pour les entreprises, cela renforce l’importance de signaux cohérents : nom de marque, domaine officiel, pages institutionnelles, profils sociaux, données structuréesVocabulaire de données structurées pour expliciter entités et contenus aux moteurs (souvent via JSON-LD)., mentions externes et, lorsque c’est naturel, une indication explicite du type « site officiel » dans les métadonnées.

Ce que le query fan-out change pour le GEO et l’AEO

Le vocabulaire reste débattu : SEO, GEO, AEOAnswer / AI Engine Optimization : optimisation pour être cité ou recommandé par les moteurs de réponses et assistants IA., LLMO, AI Search Optimization.

Google a toutefois clarifié sa propre position. Dans son guide Search Central sur les fonctionnalités génératives, l’entreprise explique que les fondamentaux SEO restent applicables et qu’aucune couche spéciale n’est nécessaire pour apparaître dans ses expériences IA.

Google déconseille notamment plusieurs recettes devenues populaires : créer une page pour chaque variation de requête, micro-découper artificiellement les contenus ou considérer llms.txt comme une condition de visibilité dans ses fonctionnalités génératives.

Le changement est donc moins « remplacer le SEO » que rajouter un problème de retrieval et de sélection au-dessus du SEO.

Une page doit toujours être crawlable, indexable, compréhensible et utile. Mais elle doit désormais aussi avoir une chance d’être retenue pour une sous-question précise, puis de survivre au passage du retrieval à la citation.

Dans cette lecture, le GEO est moins un SEO parallèle qu’une extension du champ de bataille : il ne suffit plus de gagner une SERPSearch Engine Results Page : page de résultats d’un moteur (liens bleus, features, AI Overviews…)., il faut devenir une source que la machine sait quand et pourquoi appeler.

Ce que cela change pour la rédaction

Le mauvais réflexe serait de transformer chaque fan-out observé en nouvelle page.

Google met explicitement en garde contre la production à grande échelle de contenus destinés à couvrir artificiellement toutes les variantes d’une recherche. Et les données sur ChatGPT montrent justement que les pages de type listicle, how-to ou comparatif générique — formats très exploités par le GEO opportuniste — perdent du terrain dans certains jeux de données de retrieval.

1. Couvrir les sous-questions réelles, pas les variantes lexicales

Une bonne page doit anticiper les dimensions nécessaires à une décision : prix, limites, intégrations, compatibilité, sécurité, support, alternatives, conditions, preuves.

Le but n’est pas de répéter vingt formulations du même mot-clé. Il est de construire une ressource suffisamment complète pour répondre à plusieurs besoins informationnels que le fan-out pourrait isoler.

2. Mettre les faits importants dans du HTML crawlable

Si ChatGPT lance site:votremarque.com prix produit X, le prix doit être immédiatement trouvable.

Les tarifs, références, caractéristiques techniques, dates, conditions, coordonnées, politiques de retour et informations de support gagnent à être exprimés clairement en texte, plutôt que cachés dans des images ou des interfaces difficiles à récupérer.

3. Séparer faits, preuves et opinions

Les données suggèrent que les moteurs routent les questions factuelles vers les sources officielles et les opinions vers des sources tierces.

Un contenu solide doit donc distinguer clairement ce qui relève du fait vérifiable, de la preuve, du retour d’expérience et de l’analyse.

Cette discipline éditoriale aide le lecteur ; elle aide aussi le système à comprendre ce qu’il peut utiliser et pour quel type de question.

4. Produire du contenu non interchangeable

Google insiste désormais sur le non-commodity content : informations originales, tests, analyses expertes, données propres, expériences réelles ou méthodologies qui ne peuvent pas être reproduites par simple recombinaison de contenus existants.

Le paradoxe est frappant : un article sur l’optimisation pour les moteurs IA qui ne ferait que reformuler des généralités serait précisément le type de page dont la valeur comme source diminue.

Les chiffres, méthodologies et attributions ne sont donc pas un supplément éditorial. Ils constituent une partie de la proposition de valeur du contenu.

Ce que cela change pour la mesure

Le suivi SEO classique — positions, impressions, clics — devient incomplet.

Il faut progressivement distinguer plusieurs niveaux :

  • présence de la marque dans les fan-outs ;
  • pages récupérées ;
  • pages citées ;
  • domaines concurrents sélectionnés ;
  • grounding queries lorsqu’elles sont disponibles ;
  • trafic référent venant des assistants ;
  • conversions et valeur business de ce trafic.

Bing Webmaster Tools a commencé à matérialiser cette couche en février 2026 avec son rapport AI Performance, qui expose notamment les pages citées et des grounding queries liées aux recherches utilisées pour construire des réponses IA.

C’est probablement le début d’une nouvelle famille d’outils : non plus uniquement suivre « sur quel mot-clé suis-je positionné ? », mais comprendre sur quelles recherches intermédiaires mon contenu entre dans le système.

Une vérification simple à faire dès maintenant dans GSC et Bing

Lily Ray propose une piste directement actionnable : rechercher les requêtes contenant site: dans les données de Google Search Console et Bing Webmaster Tools.

Dans un compte observé, une seule requête site: a généré environ 197 000 impressions pour un seul clic. Elle rapporte avoir trouvé sur d’autres grands sites des milliers d’impressions similaires avec un CTR proche de zéro.

Ce profil ressemble beaucoup plus à de l’activité automatisée — LLM, scrapers, outils de suivi — qu’à une recherche humaine classique. Lily Ray reste prudente : il n’existe pas de « ChatGPT Search Console », Google a connu ses propres anomalies de reporting, et il est impossible d’attribuer chaque impression à un système précis.

Mais le contrôle vaut la peine :

  1. Dans Google Search Console, ouvrir le rapport Performance et filtrer les requêtes contenant site: — éventuellement avec une expression régulière.
  2. Dans Bing Webmaster Tools, inspecter la table des requêtes du rapport Search Performance pour les chaînes contenant site:.
  3. Repérer les volumes d’impressions disproportionnés avec très peu ou aucun clic.
  4. Comparer l’évolution dans le temps et croiser avec les grounding queries ou citations IA disponibles côté Bing.

Ce n’est pas une mesure propre de « trafic ChatGPT ». C’est un signal indirect de comportement de retrieval qui devient intéressant précisément parce que les fan-outs utilisent de plus en plus ce type d’opérateur.

Une nouvelle bataille : entrer dans la requête et gagner la réponse

Le query fan-out révèle finalement un changement plus profond que l’arrivée d’un nouveau format de recherche.

Le moteur devient un orchestrateur : il reformule la demande, décide quelles sources semblent légitimes, récupère davantage de pages qu’il n’en citera, puis construit une réponse à partir d’une sélection très étroite.

Les données 2026 suggèrent plusieurs compétitions imbriquées : être une marque que le modèle associe déjà à la catégorie peut aider ; être une source qu’il accepte de récupérer reste indispensable ; être une source qu’il juge utile de citer ou de mentionner constitue encore un autre filtre. Aucune de ces étapes n’est parfaitement déterministe, et la recherche peut faire émerger un acteur absent des requêtes initiales.

Le SEO classique reste indispensable pour alimenter ce système. Mais le travail s’élargit vers la marque, l’autorité externe, la clarté des données propriétaires et la capacité à produire quelque chose que les autres pages ne peuvent pas simplement paraphraser.

C’est probablement à cet endroit que SEO, GEO et AEO se rejoignent vraiment.

Le query fan-out ne tue pas le mot-clé. Il montre simplement que, désormais, une partie des requêtes qui comptent n’est plus tapée par l’utilisateur — et que leur forme peut changer d’une version de modèle à l’autre.

Lecture 404 Mates

Le query fan-out déplace le centre de gravité du référencement. Pendant vingt ans, l’industrie a surtout observé la requête de l’utilisateur. Avec les moteurs génératifs, une partie décisive de la recherche devient invisible : le modèle reformule, subdivise, choisit des sources candidates et peut même injecter des marques avant le premier retrieval.

Les données 2026 rendent ce changement mesurable, mais elles ne décrivent pas encore un comportement uniforme de « ChatGPT » : les variantes de modèle, les plans, la personnalisation et les méthodes de collecte produisent des écarts importants. Le nouveau problème n’est plus seulement d’être trouvé, mais de franchir plusieurs filtres : entrer dans le fan-out, être récupéré, survivre à la sélection, puis être cité.

La conséquence éditoriale est assez ironique : plus les moteurs filtrent les pages génériques et auto-promotionnelles, plus les éditeurs ont intérêt à produire exactement ce que Google appelle du contenu non interchangeable — données propres, tests, expertise, preuves et informations primaires clairement extractibles.

Poursuivez votre lecture

Tout afficher