404 Mates
Développement web

llms.txt : beaucoup de sites l’utilisent encore mal

Common Crawl a analysé 584 107 fichiers llms.txt et llms-full.txt. Deux tiers sont générés par des templates, plus d’un sur cinq ne contient aucun lien et Wix oriente massivement le format vers MCP. Un constat qui complète notre précédent bilan sur l’utilité réelle du format.

Profil éditorial · Développement web

Ninja Span

En bref

  • Common CrawlExploration automatisée des URLs par un robot (Googlebot, etc.) pour découvrir et mettre à jour l’index. a analysé 584 107 fichiers llms.txt et llms-full.txt issus de son crawl de juillet 2026, après avoir retenu uniquement les réponses HTTP 200 non vides servies en text/plain ou text/markdown.
  • 68,27 % du corpus est issu de templates ou de générateurs ; Wix représente à lui seul 41,34 % des fichiers.
  • 44,87 % de tous les fichiers mentionnent le Model Context ProtocolModel Context Protocol : standard pour brancher des outils / données à un LLM (serveurs, resources, tools)., presque entièrement parce que Wix insère un endpoint MCP : Common Crawl y voit l’usage dominant actuel du format.
  • 22,56 % des fichiers ne contiennent aucun lien. AIOSEO pousse l’extrême « sitemapFichier listant les URLs importantes d’un site pour guider le crawl (complément, pas un ranking factor magique). » avec 138 liens médians et 0 % de résumés, tandis que GoDaddy parking affiche 100 % de conformité structurelle mais zéro lien.
  • Common Crawl a aussi trouvé 136 578 robots.txt servis à l’URL /llms.txt et 32 fichiers prétendant bloquer CCBot alors qu’aucun des 31 sites vérifiables ne le bloquait totalement dans son véritable robots.txt.
  • L’étude ne mesure ni l’usage par les IA ni l’impact sur les citations, et exclut 519 484 réponses text/html qui pourraient éventuellement cacher des fichiers valides derrière une mauvaise configuration serveur.
Sommaire · 5 sections

Un mois après notre article sur la pertinence réelle de llms.txt, Common Crawl apporte une pièce supplémentaire au dossier. Cette fois, la question n’est pas de savoir si les agents IASystème qui planifie et enchaîne des actions (outils, APIs, code) pour atteindre un objectif, au-delà d’une seule réponse texte. lisent le fichier, mais ce que les sites mettent réellement dedans.

Le constat est assez parlant : une part non négligeable des hôtes testés expose déjà un fichier llms.txt, mais une partie importante des contenus observés est produite automatiquement, parfois sans respecter l’usage attendu du format. Common Crawl observe que 11,72 % des requêtes vers /llms.txt de son échantillon renvoient un corps texte. Ce taux est supérieur à l’ordre de grandeur d’environ 2 % relevé par le Web Almanac 2025, mais l’organisation précise que les deux mesures portent sur des populations différentes et ne sont pas directement comparables : cette comparaison ne permet donc pas d’inférer une progression dans le temps (Common Crawl).

Surtout, certains générateurs utilisent le fichier comme un sitemap, d’autres comme une passerelle vers MCP, et certains éditeurs le confondent encore avec robots.txt.

584 107 fichiers llms.txt et llms-full.txt passés au crible

Pour son crawl de juillet 2026, Common Crawl a demandé /llms.txt et /llms-full.txt à un large échantillon de sites qu’il pouvait crawler. L’organisation a retenu les réponses HTTP 200, non vides, servies en text/plain ou text/markdown, soit 584 107 fichiers au total (Common Crawl).

Premier enseignement : 68,27 % du corpus est issu d’un template ou d’un générateur. Wix représente à lui seul 41,34 % des fichiers analysés (Common Crawl).

Autrement dit, compter le nombre de fichiers présents sur le Web ne suffit pas à mesurer une adoption volontaire du format. Une grande partie peut simplement apparaître parce qu’un CMS ou un plugin le génère automatiquement.

Wix pousse llms.txt vers MCP

L’un des résultats les plus structurants concerne le Model Context Protocol (MCP).

Common Crawl constate que 44,87 % de tous les fichiers analysés mentionnent MCP, presque entièrement parce que Wix insère une ligne pointant vers un endpoint APIApplication Programming Interface : contrat machine pour consommer un service (HTTP, SDK, webhooks).. L’organisation résume le phénomène sans détour : l’usage dominant de llms.txt aujourd’hui est celui d’un constructeur de sites qui demande aux agents de cesser de scraper et d’appeler un service à la place (Common Crawl).

C’est une évolution intéressante par rapport à la vision initiale du format comme simple carte Markdown d’un site. Chez Wix, llms.txt devient aussi une sorte de panneau indicateur vers une interface machine-à-machine.

Et comme Wix représente plus de 41 % du corpus, ce choix de conception pèse lourd sur ce que signifie llms.txt dans la pratique.

Même structure, usages très différents

Sur la forme, 49,90 % des fichiers respectent la structure complète testée par Common Crawl : un H1, un résumé en citation et des sections contenant des liens. Mais 22,56 % ne contiennent aucun lien (Common Crawl).

Ce chiffre paraît paradoxal jusqu’à ce qu’on regarde les générateurs séparément.

All in One SEO (AIOSEO) produit 73 136 fichiers dans le corpus. Aucun n’atteint le résumé attendu par la spécification (0,00 %), mais ils contiennent une médiane de 138 liens. Common Crawl considère qu’AIOSEO traite ainsi llms.txt comme un sitemap (Common Crawl).

À l’autre extrême, le bucket GoDaddy parking compte 14 711 fichiers, soit 2,52 % du corpus. Ces fichiers atteignent 100 % de conformité structurelle, mais avec zéro lien en médiane. Common Crawl constate par ailleurs que 2,54 % de l’ensemble du corpus sert à annoncer qu’un nom de domaine est à vendre (Common Crawl).

La leçon est assez nette : être conforme à la structure de llms.txt ne garantit pas que le fichier remplisse réellement son objectif. Et inversement, certains générateurs produisent beaucoup de liens tout en ignorant la structure éditoriale proposée par la spécification.

Quand llms.txt est pris pour robots.txt

La confusion la plus évidente reste toutefois celle avec robots.txt.

Parmi les réponses HTTP 200 obtenues lors du crawl, Common Crawl a identifié 136 578 fichiers robots.txt servis à l’emplacement /llms.txt, soit 10,61 % de toutes les réponses réussies de l’expérience (Common Crawl).

L’organisation a également trouvé 1 570 fichiers mentionnant explicitement un crawler. Parmi eux, 32 indiquaient que CCBot — le crawler de Common Crawl — était interdit.

Common Crawl a alors vérifié le véritable robots.txt de ces 32 sites le 17 août 2026. Un site n’a pas pu être contrôlé à cause d’une réponse HTTP 429. Sur les 31 sites vérifiables, aucun ne bloquait totalement CCBot dans robots.txt : cinq l’autorisaient explicitement, onze ne bloquaient que certains chemins et quinze ne lui imposaient aucune restriction (Common Crawl).

Le problème est concret : écrire une interdiction dans llms.txt ne bloque pas un crawler. Common Crawl rappelle que ce fichier n’est pas un mécanisme de contrôle d’accès et qu’aucun crawler n’est obligé de le lire. Pour CCBot, c’est bien robots.txt qui porte les règles d’accès.

L’adoption ne dit pas encore l’utilité

Cette nouvelle analyse complète plutôt qu’elle ne contredit notre précédent constat.

Dans notre précédent article, nous rappelions déjà le résultat d’une étude d’Ahrefs selon laquelle 97 % des fichiers llms.txt observés n’avaient jamais été requêtés. Common Crawl mentionne lui aussi ce chiffre dans son billet d’août 2026, mais son analyse répond à une autre question : lorsque le fichier existe, à quoi ressemble-t-il réellement ? (notre précédent article, Common Crawl).

La réponse est moins flatteuse qu’un simple chiffre d’adoption. Le format est largement automatisé, parfois transformé en sitemap, parfois réduit à un message commercial, massivement utilisé par Wix pour orienter les agents vers MCP, et quelquefois confondu avec un fichier de directives pour robots.

Il faut toutefois éviter de faire dire à cette étude ce qu’elle ne mesure pas. Common Crawl souligne trois limites importantes : l’analyse repose sur un seul crawl ; l’échantillon est aléatoire uniquement parmi les hôtes que Common Crawl parvient à récupérer correctement ; et surtout, les chiffres ne portent que sur les réponses 200 avec un corps texte exploitable (Common Crawl).

Cela exclut notamment 519 484 réponses servies en text/html. Common Crawl précise qu’une partie pourrait éventuellement correspondre à des fichiers valides derrière un serveur mal configuré, mais qu’elles sont absentes de tous les chiffres de l’analyse (Common Crawl).

Enfin, l’étude porte sur le contenu des fichiers, pas sur ceux qui les lisent. Elle ne permet donc pas de savoir quels systèmes IA consultent effectivement llms.txt, ni si le format améliore les citations ou la visibilité d’un site.

Elle apporte un constat plus simple : la présence du fichier n’est pas encore synonyme de bonne implémentation — ni même d’un usage commun du format.

Et avec plus de deux tiers des fichiers produits par des templates ou des plugins, l’avenir pratique de llms.txt pourrait dépendre autant de la manière dont Wix, les CMS et les outils SEO le génèrent que des choix des éditeurs eux-mêmes.

Lecture 404 Mates

Notre précédent article concluait que llms.txt n’avait toujours pas démontré de valeur comme levier SEOSearch Engine Optimization : ensemble de pratiques pour améliorer la visibilité organique dans les moteurs de recherche., mais pouvait devenir utile comme couche de navigation pour agents. L’analyse de Common Crawl ajoute une nuance importante : même lorsque le fichier existe, sa présence ne garantit ni une intention éditoriale ni une implémentation cohérente.

Le signal le plus structurant est sans doute ailleurs : avec 44,87 % du corpus mentionnant MCP, presque uniquement à cause de Wix, llms.txt sert déjà massivement de passerelle vers un service plutôt que de simple carte de contenu. En pratique, les choix de quelques plateformes et plugins peuvent façonner l’usage réel du format davantage que les décisions individuelles des éditeurs.

Poursuivez votre lecture

Tout afficher