J’ai d’abord lu argentique. Non, pas question de photo ici mais d’intelligence artificielle. On entend pas mal parler de scraping quand ses robots aspirent et digèrent les contenus d’un site pour mêler ça à d’autres données et produire une soupe souvent indigeste. Tout bloquer ? Ça marche mal à moins d’invisibiliser le site. Orienter vers des citations sourcées et bien attribuées ? Une évolution se dessine…
Composer avec l’ennemi ?
Chaque situation est à évaluer au cas par cas. Je ne dirais pas la même chose si je créais un site demain matin en partant de zéro.
Ici, avant même que je n’en prenne conscience, les robots ont depuis longtemps passé l’aspirateur sur les nombreuses pages… Il y a plus de 1400 articles… Une fois que c’est sur le Web, il n’y a pas de réel retour en arrière possible.
Autre situation : si j’avais un site de vente de spectacles ou de voyages avec des réservations à faire en ligne, j’aurais besoin de permettre à des outils automatisés (des robots d’IA) de faire des opérations comme des réservations automatiques sur le site. Pour ça, il y a besoin que les standards soient très clairs et que tout soit très lisible.
Le site KaruWeb explique assez bien la chose : « C’est exactement la même structure de données qu’utilisent les logiciels de synthèse vocale pour les personnes aveugles ou malvoyantes depuis plus de deux décennies. » Sans le percevoir peut-être ce qui ne l’excuse pas, KaruWeb emploie un ton validiste assez déplorable. Vous savez que je fais attention à ce que ce site soit accessible pour tout le monde. Je trouve que c’est une vigilance pertinente et pas si simple.
Mais pour ce site ? Outre l’accessibilité, la lisibilité, je peux trouver utile d’informer les agents de l’IA.
Pas de naïveté, mais prendre la main
Depuis peu, si vous évaluez votre site par PageSpeed Insights ou Lighthouse vous découvrez qu’en plus des performances (vitesse d’affichage) de l’accessibilité, des bonnes pratiques et du SEO (qui sert à optimiser le référencement naturel dans les résultats d’un moteur de recherche), on a maintenant un onglet « évaluation agentique ».
Le site a obtenu 3/3 :
- L’arborescence d’accessibilité est bien formée : Elle aide les agents IA à naviguer sur la page et à interagir avec elle.
- Cumulative Layout Shift 0 mesure le mouvement des éléments visibles dans la fenêtre d’affichage.
- llms.txt suit les recommandations .
De plus en plus de personnes effectuent des recherches directement dans leurs IA conversationnelles. Des moteurs de recherche présentent souvent des synthèses produites avec l’IA.
Si un modèle répond à une question ou fait une citation en s’appuyant sur des pages existantes, je voudrais que la source soit correctement identifiée et attribuée (un peu comme j’aimerais que le fasse une personne qui s’inspire de mes écrits). J’aime partager, je n’attends pas la gloire mais au moins d’être cité.
C’est le but de ce fichier llms.txt demandé par cette nouvelle évaluation. Ce fichier est déposé à la racine du site, écrit en Markdown il est lisible par les agents IA.
C’est un peu le cousin de la hcard (une sorte de carte d’identité) pour Indieweb. Il explique : qui écrit ici, de quoi il s’agit, ce qui est permis et ce qui ne l’est pas.
Depuis aujourd’hui, vincentbreton.fr dispose du sien. Ce fichier précise que le site est un espace littéraire personnel, que les textes sont originaux, qu’on peut les lire, les résumer et les citer pour répondre à des questions sur mon travail.
Moment de rêve : j’indique aussi comme ailleurs sur le site que la reproduction intégrale et l’utilisation à des fins d’entraînement restent exclues. Le droit d’auteur quoi !
Je ne suis pas naïf. Ce sera forcément imparfait. On voit tout de même un mouvement qui s’esquisse avant que la norme ne s’impose partout. Yoast Seo (une extension qui aide au référencement) par exemple, permet de produire ce fichier automatiquement. Je suis allé chercher et le copier comme un grand dans mon gestionnaire de fichiers.
En verrais-je le retour ? Peut-être sur certains sujets ou si on évoque un type d’écrit. Peut-être cela permettra à des lectrices et lecteurs un peu perdus de retrouver le chemin du site.
Le fichier est visible ici : vincentbreton.fr/llms.txt
Et vous ? une stratégie pour votre propre site ?

Un mot en retour ?