llms.txt : à quoi sert ce fichier et faut-il en créer un ?
En bref
llms.txt est un fichier Markdown placé à la racine d'un site, proposé en septembre 2024 par Jeremy Howard (Answer.AI), qui présente le site aux modèles de langage et renvoie vers ses pages clés en version texte. Il ne bloque ni n'autorise rien. Google écrit qu'il l'ignore et aucun moteur IA grand public n'a documenté le lire : utile pour une documentation technique, accessoire pour un site vitrine.
- llms.txt est une proposition publiée le 3 septembre 2024 sur llmstxt.org, pas un standard : seul le titre H1 y est obligatoire.
- Google Search écrit qu'il ignore ces fichiers : en publier un ne vous aide ni ne vous pénalise dans ses résultats, AI Overviews compris.
- Contrairement à robots.txt, llms.txt ne donne aucune consigne d'accès : il décrit le site, il ne l'ouvre ni ne le ferme aux robots.
- Anthropic et OpenAI publient un llms.txt pour leur documentation développeurs, ce qui ne dit rien de ce que leurs robots lisent chez vous.
- Le seul moyen de savoir si votre fichier est lu est de chercher les requêtes vers /llms.txt dans vos journaux serveur.
Qu’est-ce qu’un fichier llms.txt ?
Un fichier llms.txt est un fichier texte au format Markdown, publié à l’adresse /llms.txt d’un site, qui résume ce site pour un modèle de langage et lui indique quelles pages lire en priorité.
llms.txt : llms.txt est une proposition de convention qui consiste à publier à la racine d’un site un fichier Markdown décrivant le site en quelques lignes, suivi de listes de liens vers ses contenus les plus utiles, dans une version lisible sans le gabarit HTML.
L’idée vient de Jeremy Howard, cofondateur d’Answer.AI et de fast.ai. Il l’a publiée sur llmstxt.org avec un constat simple : une page web moderne est encombrée de menus, de scripts et de publicités, et la fenêtre de contexte d’un modèle est trop petite pour avaler un site entier. Un sommaire propre, en texte, règle les deux problèmes.
3 septembre 2024 date de publication de la proposition llms.txt par Jeremy Howard sur llmstxt.org[1]
Un point que la plupart des articles oublient : la proposition vise l’inférence, pas l’entraînement. Le fichier sert à un assistant qui doit répondre à une question maintenant, en allant chercher la bonne page, pas à nourrir le corpus d’un futur modèle. C’est ce qui explique qui l’utilise vraiment, on y revient plus bas.
Si vous découvrez le sujet par ce bout, sachez que llms.txt n’est qu’une petite pièce d’un travail plus large : celui qui consiste à être cité comme source dans les réponses des IA génératives. Ce fichier n’y joue qu’un rôle secondaire, et je le dis d’entrée pour que vous rangiez vos attentes au bon endroit.
À quoi ressemble un fichier llms.txt ?
Un llms.txt suit une structure fixe : un titre H1 avec le nom du site, seul élément obligatoire, puis un résumé en citation (la ligne qui commence par >), un texte libre facultatif, et des sections H2 qui contiennent chacune une liste de liens commentés.
Voici un exemple pour une entreprise fictive. Les crochets sont à remplacer par vos propres informations, rien de plus.
# Atelier Martin
> Atelier Martin conçoit et pose des cuisines en bois massif sur mesure
> à Lyon, pour les particuliers et les architectes.
Fondé en [année] par [nom]. Devis sur rendez-vous, pose dans le Rhône et l'Ain.
## Offres
- [Cuisines sur mesure](https://www.atelier-martin.fr/cuisines.md): essences de bois, délais, étapes du projet
- [Rénovation de cuisine](https://www.atelier-martin.fr/renovation.md): ce qui est repris, ce qui est remplacé
## Références
- [Réalisations](https://www.atelier-martin.fr/realisations.md): projets livrés, avec photos et descriptifs
## Optional
- [Blog](https://www.atelier-martin.fr/blog.md): conseils d'entretien et choix des matériaux
La section Optional a un sens particulier dans la convention : elle regroupe ce qu’un agent peut sauter quand il manque de place. Les liens pointent de préférence vers une version Markdown de chaque page. La proposition demande de la servir à la même adresse que la page, avec l’extension .md ajoutée ou substituée.
La version 2, publiée en août 2026, a changé trois choses utiles à connaître. Elle accepte page.md en plus de page.html.md. Elle définit deux balises HTML pour qu’un agent trouve ces fichiers depuis une page : rel="alternate" type="text/markdown" pour la version Markdown et rel="describedby" pour le llms.txt. Et elle abandonne l’outil qui fusionnait automatiquement tous les liens en un seul gros contexte : l’agent est désormais censé lire le sommaire et choisir lui-même les liens à suivre.
Vous croiserez aussi llms-full.txt. Ce fichier n’est pas dans la proposition. C’est un usage des plateformes de documentation, qui y concatènent le texte intégral de toutes leurs pages. Anthropic en publie un, lié depuis son propre llms.txt.
Quelle différence entre llms.txt et robots.txt ?
robots.txt dit aux robots ce qu’ils ont le droit d’explorer ; llms.txt ne donne aucun droit et n’en retire aucun, il décrit le site. Les deux noms se ressemblent, leurs rôles n’ont presque rien en commun.
| robots.txt | llms.txt | |
|---|---|---|
| Rôle | Autoriser ou refuser l’exploration | Présenter le site et ses pages clés |
| Statut | Norme publiée (RFC 9309) et respectée par les grands moteurs | Proposition, sans organisme de normalisation |
| Format | Directives User-agent, Allow, Disallow |
Markdown : titre, résumé, listes de liens |
| Lu par | Googlebot, Bingbot, OAI-SearchBot, ClaudeBot, PerplexityBot | Surtout des agents et assistants de code, à la demande |
| Effet d’une erreur | Un site entier peut disparaître d’un moteur | À peu près aucun |
La dernière ligne est celle qui compte pour vos priorités. Une règle robots.txt qui bloque OAI-SearchBot vous retire des réponses de recherche de ChatGPT. Un llms.txt absent, mal écrit ou périmé ne vous retire de nulle part. Si vous n’avez qu’une heure à consacrer à ces fichiers, passez-la sur robots.txt.
Que disent Google, OpenAI, Anthropic et Perplexity du fichier llms.txt ?
Google est le seul à avoir pris position par écrit, et sa position est négative : Google Search n’utilise pas ces fichiers. Son guide d’optimisation pour les fonctionnalités d’IA générative écrit : « Google Search itself doesn’t use them. » La même page ajoute qu’en créer un est « completely fine » pour d’autres services, et que cela ne va ni aider ni nuire à votre visibilité dans Google.
Les déclarations publiques vont dans le même sens. En avril 2025, sur Reddit, John Mueller a comparé le fichier à la balise meta keywords : une page où le propriétaire du site affirme lui-même de quoi parle son site, alors qu’il suffit d’aller vérifier le site. Il ajoutait qu’aucun service d’IA n’avait annoncé l’utiliser, et que les journaux serveur montrent qu’ils ne le demandent même pas. En juillet 2025, lors du Search Central Deep Dive en Asie-Pacifique, Gary Illyes a confirmé que Google ne prenait pas en charge llms.txt et n’avait pas prévu de le faire.
Google n’est pas parfaitement cohérent pour autant. Lighthouse 13.3, l’outil d’audit de Chrome, contient un audit expérimental dans sa catégorie « Agentic browsing » qui vérifie que /llms.txt ne renvoie pas d’erreur serveur. Un fichier absent (404) y est simplement classé « non applicable ». Search Engine Journal a aussi relevé en mai 2026 que des llms.txt étaient apparus sur developer.chrome.com et web.dev, et brièvement sur Search Central avant d’en être retiré. Lecture honnête : llms.txt ne sert à rien pour Google Search, et une autre équipe de Google le regarde du côté des agents qui naviguent sur le web.
Côté OpenAI, Anthropic et Perplexity, je n’ai trouvé aucune documentation qui dise que leurs robots lisent le llms.txt des sites tiers. La page d’OpenAI qui décrit ses robots (OAI-SearchBot, GPTBot, ChatGPT-User) n’en parle pas comme d’un signal. En revanche, ces trois entreprises publient chacune un llms.txt pour leur documentation développeurs. C’est une information sur leurs docs, pas sur leurs moteurs.
Qui utilise vraiment llms.txt ?
Ce sont surtout les éditeurs de documentation technique et les outils qui aident à coder. Anthropic publie un llms.txt pour sa documentation développeurs, avec un llms-full.txt en complément. OpenAI fait de même pour la documentation de son API, dont chaque page a un double en Markdown. Perplexity aussi, pour sa plateforme API. Les plateformes de documentation comme Mintlify et GitBook le génèrent pour leurs clients.
La raison est concrète. Un développeur qui demande à un assistant de code d’intégrer une API veut que l’outil lise la bonne page de référence, pas une page marketing. Jeremy Howard l’écrit dans la version 2 : les agents de code utilisent ces fichiers de manière fiable. C’est le cas d’usage pour lequel le format a été pensé, et c’est là qu’il fonctionne.
Pour un artisan, un cabinet de conseil ou une boutique en ligne, la situation est différente. Personne ne demande à un agent de code de lire votre page tarifs. Et les moteurs de réponse grand public, ceux où vos clients vous cherchent, n’ont rien documenté.
Comment savoir si votre llms.txt est lu ?
En regardant vos journaux serveur, parce qu’aucun outil d’analyse d’audience ne vous le dira : un robot qui lit un fichier texte n’exécute pas de script de mesure. Il faut chercher les requêtes vers /llms.txt, puis regarder quel agent les a faites.
Sur un serveur Apache ou Nginx au format de journal standard, une commande suffit :
grep "GET /llms.txt" access.log | awk -F'"' '{print $6}' | sort | uniq -c | sort -rn
Elle compte les requêtes vers le fichier, regroupées par user-agent. Faites de même pour vos pages .md si vous en publiez. Trois précautions : un user-agent se falsifie facilement, donc vérifiez les adresses IP des robots qui comptent auprès des plages publiées par leurs éditeurs ; les outils SEO qui testent votre site génèrent aussi des requêtes ; et un passage isolé ne prouve pas qu’un modèle se sert du contenu dans ses réponses.
Les témoignages publics se contredisent, ce qui rend le contrôle chez vous d’autant plus utile. John Mueller dit que les robots d’IA ne demandent même pas le fichier. Le consultant Ray Martinez a publié en juillet 2025 des captures de journaux montrant, selon lui, un robot d’OpenAI qui interrogeait son llms.txt toutes les 15 minutes. Les deux peuvent être vrais sur des sites différents. Seuls vos journaux tranchent pour le vôtre.
Pourquoi advised-seo.fr publie-t-il son propre llms.txt ?
Parce que le coût est quasi nul et que je préfère tester sur mon site avant d’en parler à un client. Le blog d’advised-seo.fr génère /llms.txt automatiquement à chaque déploiement : un titre, la même phrase de présentation que dans les données structurées du site, un contact, puis la liste des articles publiés.
Chaque lien de cette liste pointe vers la version Markdown de l’article, publiée à l’adresse /blog/<slug>.md. Cette version reprend le titre, l’auteur, les dates, le résumé, le texte, la FAQ et les sources, sans le gabarit du site. Elle est servie en text/markdown, marquée noindex pour ne pas concurrencer la page HTML dans Google, et annoncée dans l’en-tête de chaque article par une balise rel="alternate" type="text/markdown", celle que recommande la version 2 de la proposition.
Je n’ai aucun résultat à vous vendre là-dessus, et je ne vais pas en inventer. J’ai fait ce choix parce qu’il ne demande aucune maintenance : un article publié entre tout seul dans le fichier. Un llms.txt écrit à la main et oublié depuis un an, qui renvoie vers des pages supprimées, fait plus de tort à votre image qu’aucun fichier.
J’ai aussi une page de faits vérifiables destinée aux assistants IA, en HTML classique, qui dit qui je suis et ce que je fais. Elle est lisible par Google, par les moteurs IA et par un humain, ce qui en fait à mes yeux un meilleur investissement que le llms.txt lui-même.
Faut-il créer un fichier llms.txt ?
Oui si vous publiez une documentation technique, une API ou un logiciel que des développeurs intègrent avec l’aide d’un assistant de code. Pour un site vitrine, une PME ou une boutique, c’est facultatif : faites-le s’il se génère sans effort, et ne le payez pas comme une prestation GEO.
Mon ordre de priorité pour être cité par les IA reste le même. D’abord, vérifier que robots.txt laisse entrer OAI-SearchBot, PerplexityBot, Claude-SearchBot et Googlebot. Ensuite, des pages qui répondent dès leur première phrase, avec des preuves sourcées. Puis une entité de marque cohérente partout. Le llms.txt vient après, s’il vient.
Méfiez-vous des deux discours extrêmes. Celui qui vend llms.txt comme le « robots.txt de l’IA » indispensable ignore ce que Google écrit noir sur blanc. Celui qui le déclare mort oublie que les agents de code l’utilisent et que Chrome commence à le vérifier. La bonne réponse est plus ennuyeuse : un fichier de dix minutes, qui ne remplace aucun des vrais chantiers.
Avant de vous poser la question du fichier, posez-vous celle du résultat : les IA citent-elles votre site quand un client potentiel décrit son besoin ? GEO-Track vous donne la réponse gratuitement, sur six requêtes de votre catégorie.
Questions fréquentes
Le fichier llms.txt améliore-t-il le référencement Google ?
Non. Google Search Central écrit que Google Search n'utilise pas ces fichiers et que les publier ne va ni aider ni nuire à la visibilité ou au classement d'un site, fonctionnalités d'IA générative comprises. John Mueller l'a comparé en avril 2025 à la balise meta keywords, que les moteurs ignorent depuis longtemps.
Où placer le fichier llms.txt ?
À la racine du domaine, à l'adresse /llms.txt, en texte brut encodé en UTF-8. La version 2 de la proposition, publiée en août 2026, accepte aussi un fichier dans un sous-dossier : il couvre alors les pages situées sous ce chemin, et le fichier le plus spécifique l'emporte.
Quelle différence entre llms.txt et llms-full.txt ?
llms.txt est un sommaire : une présentation courte et des liens. llms-full.txt, quand il existe, rassemble dans un seul fichier le texte complet des pages de documentation. Ce second fichier n'est pas défini par la proposition de llmstxt.org : c'est un usage répandu dans les plateformes de documentation, par exemple chez Anthropic.
WordPress ou Yoast peuvent-ils générer un llms.txt ?
Oui. Yoast SEO propose depuis juin 2025 un générateur à activer dans ses réglages, qui publie le fichier à la racine et le met à jour chaque semaine, avec une sélection automatique ou manuelle des contenus. C'est pratique, mais relisez le résultat : l'intérêt du format est de trier ce qui compte, pas de lister tout le site.
Peut-on bloquer ChatGPT avec un fichier llms.txt ?
Non. llms.txt ne contient aucune directive d'accès. Pour refuser ou autoriser un robot d'IA, c'est le fichier robots.txt qui s'en charge, avec le nom du robot concerné : OAI-SearchBot ou GPTBot pour OpenAI, ClaudeBot pour Anthropic, PerplexityBot pour Perplexity.
Sources
- The /llms.txt file, Jeremy Howard, Answer.AI, 3 septembre 2024
- Changes in v2, llmstxt.org, 10 août 2026
- Google's Guide to Optimizing for Generative AI Features on Google Search, Google Search Central
- Google Says LLMs.Txt Comparable To Keywords Meta Tag, Search Engine Journal, 17 avril 2025
- OpenAI Crawling LLMs.txt Files? Google Says It Won't., Search Engine Roundtable, 24 juillet 2025
- Google's llms.txt Guidance Depends On Which Product You Ask, Search Engine Journal, 20 mai 2026
- llms.txt (Lighthouse, Agentic browsing audits), Chrome for Developers
- Anthropic Developer Documentation (llms.txt), Anthropic
- OpenAI API documentation (llms.txt), OpenAI
- RFC 9309: Robots Exclusion Protocol, IETF, 1 septembre 2022
- New: Future proof your website for tomorrow's visitors with Yoast SEO llms.txt, Yoast, 10 juin 2025
Advised