Loading...
Web lisible par les agents (llms.txt / NLWeb)
Des contrats côté offre qui exposent le contenu d'un site directement aux agents, au lieu de les contraindre à extraire le HTML rendu. llms.txt (Jeremy Howard, 2024) est un index Markdown curé, situé à /llms.txt, complété par des pages « fantômes » .md qui fournissent à un LLM un contenu à haute densité et sans navigation au moment de l'inférence. Microsoft NLWeb (2025, sous la direction de R.V. Guha, co-créateur de Schema.org) va plus loin avec un point de terminaison en langage naturel /ask qui renvoie du JSON structuré ancré dans les données Schema.org du site lui-même, chaque instance NLWeb faisant également office de serveur MCP. Ensemble, ils définissent le site lisible par les agents, le pendant côté lecture de robots.txt pour le web agentique.
In 30 seconds
- What
- Le site publie du Markdown curé sur /llms.txt et des pages miroir .md, avec un point de terminaison /ask optionnel renvoyant du JSON structuré, afin que les agents récupèrent le contenu sans scraper le HTML.
- When to use
- Vous exploitez un service ou un site de contenu et voulez que les agents accèdent à vos données de façon fiable, exacte et à grande échelle, sans analyser les pages rendues.
- Watch out
- Impose de maintenir deux surfaces de contenu synchronisées ; un /llms.txt obsolète ou incomplet ruine tout l'intérêt du dispositif et les agents reviennent de toute façon au scraping.
Loading technique guide…