Conseils

llms.txt : faut-il vraiment en mettre un sur ton site ?

On te vend le llms.txt comme LE fichier qui va enfin faire citer ton site par ChatGPT. On est allés voir ce que disent vraiment les chiffres, et comment configurer ce fichier correctement.

llms.txt : ce que les IA lisent vraiment sur ton site
Mélanie
Mélanie
12 min de lecture
Introduction

Le fichier qu'on te vend comme magique

On te vend le llms.txt comme LE fichier qui va enfin faire citer ton site par ChatGPT. On est allés voir ce que disent vraiment les chiffres.

Trois études sont sorties récemment sur le sujet, et leurs résultats se ressemblent beaucoup. Voici ce qu'elles montrent, et comment configurer ton fichier si jamais tu décides d'en installer un.

97%

Des llms.txt publiés ne reçoivent jamais aucune requête

Ahrefs, mai 2026

0

Effet mesuré sur les citations IA, sur 300 000 domaines analysés

SE Ranking

408

Requêtes vers un llms.txt sur 500 millions d'événements de bots IA

Analyse de logs, 90 jours

Les bases

C'est quoi un llms.txt, et pourquoi il existe

Un llms.txt, c'est tout simple. Un fichier texte, écrit au format Markdown, que tu places à la racine de ton site, à l'adresse tonsite.com/llms.txt. Dedans, tu expliques en quelques lignes ce que fait ton entreprise, puis tu listes les pages qui comptent vraiment, chacune avec une petite description.

L'idée de départ n'a rien à voir avec le référencement. Elle vient de Jeremy Howard, cofondateur d'Answer.AI et de fast.ai, qui a proposé ce format le 3 septembre 2024 pour régler un problème bien concret. Une IA ne peut lire qu'une quantité limitée de texte à la fois, un peu comme une mémoire de travail, elle ne peut donc pas avaler un site entier d'un coup. Et transformer une page web, remplie de menus, de bannières de cookies, de publicités et de scripts, en texte simple et exploitable, c'est en pratique assez difficile. Le llms.txt devait être un raccourci propre pour éviter tout ça.

En novembre 2024, Mintlify, une plateforme qui héberge de la documentation technique, active le support du format sur tous les sites qu'elle héberge. D'autres suivent le mouvement. Puis le monde du SEO s'en empare et le transforme en promesse de visibilité IA. Un simple tournevis présenté comme une baguette magique.

Ce que le llms.txt n'est pas

Trois confusions reviennent tout le temps. Autant les régler tout de suite.

Ce n'est pas un robots.txt. Malgré le nom qui y ressemble, il ne bloque rien et ne contrôle aucun accès. C'est plutôt une suggestion de lecture qu'une vraie règle.

Ce n'est pas un sitemap non plus. Un sitemap liste toutes tes URL pour les moteurs de recherche. Un llms.txt, lui, fait un tri, une petite sélection des pages qui comptent vraiment, avec un commentaire à chaque fois.

Et ce n'est pas non plus une copie de ton site en Markdown. Générer un fichier Markdown pour chaque page est une pratique différente, et souvent une mauvaise idée. On y revient plus loin.

Les données

Est-ce que les IA le lisent vraiment ?

C'est la seule question qui compte vraiment. Si les IA lisent ce fichier, il a un intérêt. Sinon, ce n'est que de la décoration. Trois études récentes ont cherché à y répondre, et leurs résultats se recoupent.

L'étude Ahrefs : 97% des fichiers ne sont jamais lus

Ahrefs a passé au crible 137 210 sites ayant reçu du trafic en mai 2026. Premier constat, seuls 28% d'entre eux ont un llms.txt, un chiffre à prendre avec des pincettes puisque cet échantillon est plus technique que la moyenne du web.

Et surtout, 97% de ces fichiers n'ont reçu absolument aucune requête. Pas une seule, sur tout un mois. Quant aux rares requêtes qui arrivent, les robots de recherche d'OpenAI, de Perplexity et de Claude réunis n'en ont fait que quelques centaines, à travers des milliers de sites.

La conclusion d'Ahrefs ne tourne pas autour du pot. Si ton objectif est d'apparaître dans ChatGPT, Perplexity ou les AI Overviews de Google, ce fichier reste largement décoratif.

L'analyse des logs : les bots IA l'ignorent

Une autre analyse, portant sur plus de 500 millions d'événements de bots IA sur une période de 90 jours, arrive au même constat. Les robots GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot et Google-Extended ignorent très largement ce fichier, et vont lire directement le code de la page. Sur ces 500 millions d'événements, seuls 408 concernaient un llms.txt.

Le test le plus direct : aucun effet sur les citations

SE Ranking a étudié environ 300 000 domaines pour répondre à la question la plus directe qui soit. Est-ce que le fait d'avoir un llms.txt est lié aux chances d'être cité par une IA ?

Ils ont fait tourner les données dans un modèle statistique, puis dans un algorithme de machine learning appelé XGBoost (un outil qui repère des liens entre plusieurs facteurs dans de gros volumes de données). Et le résultat est sans appel : aucun effet. Retirer cette variable améliorait même légèrement la précision du modèle. Autre indice révélateur, le taux d'adoption est à peu près le même quel que soit le niveau de trafic du site. Ce n'est donc pas une pratique réservée aux meilleurs élèves, que les autres copieraient ensuite.

Et les fournisseurs d'IA, ils disent quoi ?

Aucun grand fournisseur, ni OpenAI, ni Anthropic, ni Google, ni Meta, ni Mistral, n'a confirmé publiquement lire ce fichier ou s'en servir dans ses systèmes.

Une nuance mérite d'être posée. Anthropic et Perplexity publient bien leur propre llms.txt pour leur documentation, et beaucoup y voient une forme de validation. Sauf que publier un fichier pour soi et aller lire celui des autres au moment de répondre à un utilisateur, ce sont deux choses très différentes. Aucune des deux entreprises n'a confirmé la seconde.

Le paradoxe

Ce que Google a dit, et pourquoi Chrome fait l'inverse

La position officielle de Google Search

En juillet 2025, Gary Illyes, qui travaille sur Search chez Google, confirme lors d'un Search Central Live que Google ne prend pas en charge le llms.txt et n'a pas prévu de le faire. John Mueller, de son côté, compare ce fichier à l'ancienne balise meta keywords, ce champ que les spammeurs remplissaient à outrance et que Google a fini par ignorer complètement.

Puis, le 15 juin 2026, Google met à jour son guide officiel sur l'optimisation pour les fonctionnalités d'IA générative, avec une section entière consacrée au llms.txt. Le motif ? Mettre fin à la désinformation qui circulait sur le sujet.

Le message est clair. Tu n'as besoin d'aucun fichier spécial pour les machines, d'aucun texte pensé pour l'IA, d'aucun balisage ou format Markdown particulier pour apparaître dans Google Search, même dans ses réponses générées par IA, tout simplement parce que Search ne s'en sert pas. Et si tu tiens à garder ton fichier quand même, aucun souci, ça ne t'aidera pas mais ça ne te pénalisera pas non plus. Search l'ignore, un point c'est tout.

Sauf que Chrome, lui, l'audite

Et c'est là que ça devient intéressant. Le 7 mai 2026, Chrome fait passer sa catégorie d'audit Agentic Browsing du statut expérimental à activée par défaut, dans Lighthouse 13.3.

Depuis, toute personne qui lance un rapport Lighthouse, et donc aussi PageSpeed Insights ou les DevTools de Chrome, voit apparaître automatiquement un contrôle de ton llms.txt. Ce test vérifie simplement que le fichier existe, qu'il est accessible, et qu'il respecte bien le format attendu.

On a donc deux équipes chez Google qui donnent deux réponses opposées. Search dit d'ignorer le fichier. Chrome l'audite par défaut. Interrogé sur cette contradiction apparente, Mueller a précisé que ce fichier n'est pas pensé pour la recherche, mais qu'il sert plutôt de solution temporaire pour les outils de code qui parcourent de la documentation.

En réalité, ce n'est pas vraiment une contradiction. Ce sont deux équipes qui répondent à deux questions différentes, chacune misant sur un futur différent.

Le llms.txt n'est pas vraiment un sujet de référencement. C'est un sujet qui concerne les agents IA.

Les vrais lecteurs

Qui lit vraiment ce fichier aujourd'hui

Le fichier est bel et bien lu. Simplement, pas par ceux qu'on imagine.

Les agents de code

Cursor, Claude Code, GitHub Copilot, Windsurf, Cline, Aider. Quand un agent développe et cherche à comprendre une bibliothèque, il va chercher son llms.txt, puis ne charge que les pages utiles. C'est le cas d'usage le plus mature, et de loin.

Les serveurs MCP

LangChain a publié mcpdoc, un serveur open source qui connecte les fichiers llms.txt à des applications comme Cursor, Windsurf ou Claude Desktop, grâce au protocole MCP (un standard qui permet à une IA d'aller chercher des informations dans des outils externes).

Les pipelines RAG internes

Les entreprises qui construisent leur propre moteur de recherche IA en interne (une technique qu'on appelle le RAG, qui consiste à aller chercher l'information avant de répondre) utilisent le llms.txt comme une liste de lecture, pour choisir quelles pages garder.

Les outils d'audit et les constructeurs de sites

Wix génère déjà le fichier automatiquement. Framer et Lovable le scannent. Yoast SEO et Rank Math ont ajouté sa génération native en 2025. Et Chrome l'audite, comme on vient de le voir.

Côté entreprises, Stripe, Cloudflare, Vercel, Anthropic et Mastercard publient tous un llms.txt. Ce n'est pas pour plaire à Google. C'est parce qu'elles se préparent pour un web piloté par des agents IA.

L'argument de ceux qui y croient, et il se tient

Joost de Valk, le fondateur de Yoast, défend quand même ce fichier, avec un raisonnement honnête. Les données te montrent ce qui se passe aujourd'hui, pas forcément ce qui va se passer demain.

Un standard du web ne s'impose jamais parce que des robots réclament un fichier qui n'existe pas encore. Il s'impose parce que quelques éditeurs commencent à le proposer, ce qui donne aux robots une raison d'aller le chercher, ce qui donne à d'autres éditeurs une raison de le proposer à leur tour. Il faut bien que quelqu'un commence.

Son exemple est parlant. Google lance le protocole sitemap en juin 2005. Pendant plus d'un an, il est le seul à s'en servir. Yahoo et Microsoft ne le rejoignent qu'en novembre 2006. Si tu avais regardé les logs serveurs début 2006 pour en conclure que ça ne valait pas le coup, tu aurais eu raison sur les chiffres du moment, et complètement tort sur la suite.

Notre position

Alors, faut-il en mettre un ?

Chez Line'up, notre réponse est oui, mais pas pour la raison qu'on te vend habituellement.

Ce que le llms.txt ne fera pas

Il ne va pas te faire remonter dans Google. Il ne va pas te faire citer plus souvent par ChatGPT ou Perplexity. Ce n'est pas un levier de visibilité, et si un prestataire te le facture comme tel, demande-lui simplement une source qui vient d'un fournisseur d'IA. Il n'en trouvera pas.

Ce qu'il fait vraiment, et qui justifie les 30 minutes

  • La justesse de ta marque. Le jour où une IA regarde ton site, elle tombe sur une description que tu as écrite toi-même, pas une reconstitution approximative bricolée à partir de ta page de contact. Le vrai bénéfice n'est pas le trafic, c'est de garder la main sur ce qui se dit de toi.

  • Un pari peu coûteux sur le futur. Les agents lisent déjà ce fichier, Chrome l'audite déjà. Si le trafic piloté par des IA finit par grandir, tu es prêt. Et si ça ne prend jamais, tu n'auras perdu qu'une demi-heure.

  • Un bon exercice de clarté. Résumer en une phrase ce que fait ton entreprise, pour qui, et ce qui la rend différente, c'est un exercice redoutable. Si cette phrase pourrait tout aussi bien décrire quatre concurrents, le problème ne vient pas de ton llms.txt. Il vient de ton positionnement.

La pratique

Comment configurer ton llms.txt correctement

La structure attendue

Le fichier doit être écrit en Markdown, posé à la racine de ton domaine, pas dans un sous-dossier, à l'adresse tonsite.com/llms.txt. Il doit répondre correctement (un code 200) et s'afficher en texte brut dans le navigateur. La spécification demande simplement trois choses.

1

Un titre H1, en premier

C'est le nom de ton site.

2

Un résumé en blockquote

Une seule phrase. Ce que tu fais, pour qui, ce qui te rend différent. Le test : relis-la, et si elle pourrait décrire quatre autres entreprises, réécris-la.

3

Des sections H2 avec des liens annotés

Chaque lien est accompagné d'une description qui dit précisément ce qu'on va trouver derrière.

Un exemple concret

# Line'up

> Agence web à Bordeaux-Mérignac. On conçoit des sites vitrines et
> des landing pages sur-mesure qui allient une image de marque forte
> et un vrai travail de conversion. Zéro template.

## Nos services

- [Création de site vitrine](https://line-up.tech/creation-site-vitrine) :
  notre offre de site vitrine sur-mesure, en ligne en 30 jours, design
  personnalisé et SEO intégré.
- [Nos expertises](https://line-up.tech/expertises) : le détail de ce
  qu'on fait, design, développement, conversion.

## Ressources

- [Outil d'audit gratuit](https://line-up.tech/audit-conversion-performance-site-web) :
  analyse gratuite d'un site sur 6 critères, dont la conversion. Sans inscription.
- [Blog](https://line-up.tech/blog) : nos articles sur la conversion,
  la refonte et le web design.

## Contact

- [Réserver un appel](https://zcal.co/line-up/15min) : 15 minutes pour
  cadrer un projet de site.

Le llms-full.txt, l'option

C'est la version longue, celle qui regroupe tout ton contenu dans un seul document Markdown. Elle a du sens pour une grosse documentation technique. Pour un site vitrine, elle ne sert à rien.

Attention quand même à un piège assez courant. Un llms-full.txt trop volumineux finit par saturer la mémoire de lecture qu'il est censé justement soulager. Si tu en crées un, garde un œil sur sa taille.

Les 5 erreurs qui rendent ton fichier inutile

  • Le traiter comme un sitemap. Lister toutes tes URL sans aucune description revient à recréer exactement le bruit que ce fichier devait justement éviter.

  • Des libellés vagues. « En savoir plus », « cliquez ici »... un agent n'apprend rien de ces formules toutes faites. Chaque lien doit dire clairement ce qu'il contient.

  • Le laisser vieillir. Un fichier qui pointe vers des pages déplacées ou supprimées est pire que pas de fichier du tout.

  • Générer une copie Markdown de chaque page. C'est la fausse bonne idée la plus classique. Tu crées du contenu dupliqué à grande échelle, tu gaspilles le temps que les robots passent à explorer ton site, et tu risques même de faire baisser tes pages d'origine dans les résultats. Comme le SEO reste le principal signal utilisé par les IA pour juger de ta crédibilité, abîmer ton référencement finit par abîmer ta visibilité IA aussi.

  • Oublier de vérifier ton robots.txt. C'est l'erreur la plus coûteuse, et la plus courante. Si ton robots.txt bloque GPTBot, ClaudeBot, PerplexityBot ou OAI-SearchBot, tu restes invisible pour ces IA, llms.txt ou pas.

Cette dernière erreur n'est pas un hasard. C'est le même réflexe que celui qui pousse à tout confier à l'IA sans personne pour la piloter. On a expliqué pourquoi c'est souvent une fausse bonne idée dans un autre article.

Comment savoir s'il est lu

Le plus simple est de regarder tes logs serveur, ou de passer par les statistiques de ton CDN, en filtrant les requêtes vers /llms.txt par nom de robot (GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended). Cloudflare Analytics permet de le faire sans avoir à fouiller dans les logs bruts.

L'essentiel

Ce qui te fait vraiment citer par les IA

Si tu es venu ici pour la visibilité IA, c'est là qu'il faut mettre ton énergie. C'est moins vendeur qu'un fichier magique, mais c'est ce qui compte vraiment.

1

L'accès, d'abord

La raison la plus fréquente d'une absence totale de citations, c'est tout simplement que les robots des IA n'arrivent pas à accéder à ton site. Vérifie ton robots.txt avant toute autre chose.

2

La donnée structurée

Yext a analysé 17,2 millions de citations IA sur ChatGPT, Perplexity, Gemini et Claude. Les données vérifiées et bien organisées représentent plus de la moitié des sources citées. Et les pages qui utilisent des données structurées (des balises invisibles qui aident les moteurs à comprendre le contenu d'une page) ont 30 à 40% de chances en plus d'être citées.

3

Le contenu facile à extraire

Une IA ne lit pas comme un humain, elle va plutôt piocher des passages précis. 44% des citations viennent des 30 premiers pour cent du texte d'une page. La première phrase sous chacun de tes titres devrait donc pouvoir se lire seule, comme une réponse complète.

4

La cohérence de ton identité

Même nom, même description, même adresse, partout : sur ton site, sur LinkedIn, dans la presse. Si tu es « Line'up » ici et « Lineup Agence » ailleurs, tu sèmes le doute dans le modèle.

5

Les citations venues d'ailleurs

Être mentionné par des sources que les IA jugent fiables reste le signal le plus fort de tous. Aucun fichier ne peut remplacer ça.

6

Les fondations de ton site

Un site rapide et propre, qui affiche son contenu directement plutôt que de tout faire dépendre du JavaScript, avec des textes écrits par des gens qui connaissent vraiment leur sujet. Les sites les plus cités par les IA sont d'abord ceux qui ont un bon socle SEO. Le llms.txt vient en complément de ce travail. Il ne le remplace jamais.

Envie de savoir où tu en es sur ces fondations ? Tu peux commencer par auditer gratuitement ton site. Et si le socle te semble un peu fragile, on a réuni les 7 signaux qui montrent qu'une refonte s'impose.

Sources

  • Google Search Central, guide d'optimisation pour les fonctionnalités d'IA générative, section sur les fichiers llms.txt, mise à jour du 15 juin 2026.
  • Gary Illyes, Google, Search Central Live, juillet 2025.
  • John Mueller, Google, déclarations publiques comparant llms.txt à la balise meta keywords.
  • Chrome Lighthouse 13.3, catégorie d'audit Agentic Browsing activée par défaut, 7 mai 2026.
  • Ahrefs, étude sur 137 210 domaines, données de mai 2026.
  • SE Ranking, étude d'adoption sur environ 300 000 domaines, modèle statistique et XGBoost.
  • Limy, analyse de plus de 500 millions d'événements de bots IA sur 90 jours.
  • Yext Research, analyse de 17,2 millions de citations IA sur ChatGPT, Perplexity, Gemini et Claude.
  • Jeremy Howard, Answer.AI, proposition initiale du format llms.txt, 3 septembre 2024.
  • Joost de Valk, fondateur de Yoast, argumentaire sur la trajectoire d'adoption des standards web.

Outil gratuit · 30 secondes

Teste ton site gratuitement

Avant de te demander si les IA lisent ton llms.txt, la vraie question est de savoir si ton site tient la route côté vitesse, mobile, clarté, confiance, référencement et conversion. Notre outil d'audit est gratuit, sans inscription, et te donne un diagnostic en 30 secondes avec les actions à mener classées par priorité.