un-article-au-hasard
Avec des centaines d’articles au compteur, pourquoi ne pas laisser le hasard décider ? Laissez-vous surprendre. Vous pouvez rejouer à l’infini.
un coup de dés
en ce moment 1506 articles sont en ligne
3 choses que je fais pour limiter le scraping des IA sur le site
Certains humains font fi du droit d’auteur. Les IA s’entraînent sur tout ce qu’elles trouvent. Tout ce qui est aspiré alimente des modèles. Ces modèles vont produire d’autres contenus dérivés de ce qui aura été « gratté » sans accord. Partant du fait de « qui ne dit mot consent », la Loi permet des protections. Même si elles sont imparfaites, des parades techniques existent. Les voici en partage.
3 choses à faire pour limiter le scraping
- 1. J’interdis explicitement l’utilisation de mon contenu dans mes pages légales
- 2. Je bloque les crawlers IA dans mon fichier robots.txt
- Fichier robots.txt
- 3. J'ajoute des balises HTML Méta en haut de chaque page
- à noter
- Retour en arrière :
1. J’interdis explicitement l’utilisation de mon contenu dans mes pages légales
Comme le précise le site juridique TLMR, « l’Union européenne permet aux titulaires de droits de s’opposer à l’utilisation de leurs œuvres à l’aide d’un opt-out juridiquement encadré. »
Qui ne dit mot consent, c’est à dire que si on ne s’oppose pas, l’IA peut prendre. C’est tout de même gonflé. Imaginez qu’on vienne faire pareil avec ce qu’il y a chez vous !
— Je me suis servi car tu n’avais pas interdit l’accès !
Une mention légale dédiée
Elle comprend les termes anglais compris par les IA.
L’utilisation des contenus de ce site à des fins de data mining, scraping, crawling automatisé ou d’entraînement d’intelligence artificielle (IA) est strictement interdite, sauf autorisation écrite préalable de l’auteur. Toute violation pourra faire l’objet de poursuites.
La mention est insérée :
- dans la page dédiée aux mentions légales
- dans la page spéciale dédiée au droit d’auteur
Vous pouvez bien entendu reprendre la formulation ou l’adapter pour votre site.
2. Je bloque les crawlers IA dans mon fichier robots.txt
Bon, c’est basé sur la « bonne volonté » des différentes IA mais les plus connues savent le faire et en tout cas c’est opposable.
Il y a différentes façons de modifier son fichier Robots.txt. Souvent ça fonctionne via l’extension SEO. J’utilise pour ma part la très légère SLIM SEO. Sinon vous devez l’avoir à la racine du site.
Fichier robots.txt
# Sobriété numérique et refus de l'exploitation des contenus
# par des bots d'entraînement d'IA ou de scraping massif
#
# Liste volontairement non exhaustive :
# tout bot d'entraînement IA non explicitement autorisé est réputé non souhaité.
# OpenAI
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
# Google AI
User-agent: Google-Extended
Disallow: /
# Anthropic (Claude)
User-agent: ClaudeBot
Disallow: /
User-agent: ClaudeWeb
Disallow: /
User-agent: anthropic-ai
Disallow: /
# Common Crawl
User-agent: CCBot
Disallow: /
# Apple AI
User-agent: Applebot-Extended
Disallow: /
# Perplexity
User-agent: PerplexityBot
Disallow: /
# Amazon
User-agent: Amazonbot
Disallow: /
# ByteDance (TikTok)
User-agent: Bytespider
Disallow: /
# You.com
User-agent: YouBot
Disallow: /
# Meta / Facebook AI
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: FacebookBot
Disallow: /
# xAI (Grok)
User-agent: GrokBot
Disallow: /
User-agent: xAI-Grok
Disallow: /
User-agent: Grok-DeepSearch
Disallow: /
# Mistral AI
User-agent: mistral-ai
Disallow: /
User-agent: MistralAI-User
Disallow: /
# DeepSeek
User-agent: DeepSeek
Disallow: /
User-agent: DeepSeekBot
Disallow: /
# Autres bots de scraping IA connus
User-agent: Diffbot
Disallow: /
User-agent: Omgilibot
Disallow: /
User-agent: ImagesiftBot
Disallow: /
User-agent: cohere-ai
Disallow: /
# Règles générales pour les autres bots (moteurs de recherche classiques)
User-agent: *
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /page/*/?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php
# Sitemap pour faciliter l'indexation SEO
Sitemap: https://vincentbreton.fr/sitemap.xml
Le fichier est modifiable en fonction d’autres besoins, de l’arrivée de nouvelles IA etc.
Vous pouvez évidemment le récupérer.
Un ajustement au 12 janvier 26
L’idée est de permettre aux IA de voir le site et de l’évoquer (intérêt de citations pour la notoriété) sans s’attaquer à la partie créations. J’ai donc produit un nouveau fichier moins restrictif et plus ciblé : autrement dit, je veux bien être vu sur la partie « journal » pas sur la partie relative à la fiction, à la poésie ou aux chansons.
# Autoriser les IA qui citent des sources (pour être visible dans leurs réponses)
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: YouBot
Allow: /
# Bloquer les IA d'entraînement uniquement sur les archives de catégories créatives
# (ça bloque les listes d'articles, mais pas grave – les articles individuels sont déjà protégés par les meta)
User-agent: GPTBot
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
User-agent: Google-Extended
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
User-agent: CCBot
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
User-agent: anthropic-ai
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
User-agent: Bytespider
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
User-agent: Amazonbot
Disallow: /chanson-2/
Disallow: /fiction/
Disallow: /poesie/
# Règles générales pour tous les autres robots (Google, Bing, etc.)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
# Sitemap
Sitemap: https://vincentbreton.fr/sitemap.xml
3. J’ajoute des balises HTML Méta en haut de chaque page
L’intérêt est de proposer un signal redondant et renforcé : si un robot ignore le fichier robots.txt, il verra l’interdiction directement dans le HTML qu’il aspire. C’est une protection « en profondeur » présente sur chaque page.
En cas de souci (même si je ne me vois pas prendre un avocat), c’est une preuve juridique plus solide. Elle permet de prouver que chaque page contient explicitement l’interdiction.
Pour installer ces balises, je ne le fais évidemment pas page par page mais je passe par un « bout de code » ou « snippet ».
J’utilise l’extension WP Code.
Configuration :
- Type de code : PHP Snippet
- Emplacement : Run Everywhere (ou spécifiquement sur le frontend)
- Activation : Activez le snippet
add_action('wp_head', function() {
echo '<meta name="robots" content="noai, noimageai">' . "\n";
echo '<meta name="googlebot" content="noai">' . "\n";
}, 1);
Comme j’ai changé de stratégie en ne bloquant que l’accès aux créations, j’ai désactivé cette fonctionnalité. C’est à faire ou non en fonction de vos choix et besoins.
Pour en revanche protéger les pages relatives aux créations (relevant des catégories fiction, poésie et chansons), j’ai activé un nouveau snippet (appliqué via WP Code en PHP)
add_action('wp_head', function() {
// IDs des trois catégories parentes à protéger
$categories_parentes_ids = [229, 228, 216]; // Chansons, Fiction, Poésie
if (is_single() || is_page()) { // is_page() au cas où tu aurais des pages dans ces catégories
$post_categories = wp_get_post_categories(get_the_ID());
if (!empty($post_categories)) {
foreach ($post_categories as $cat_id) {
// Récupère la catégorie actuelle + tous ses ancêtres (parents)
$ancestors = get_ancestors($cat_id, 'category');
$all_related = array_merge([$cat_id], $ancestors);
// Si l'une des catégories liées correspond à une des trois parentes
if (array_intersect($all_related, $categories_parentes_ids)) {
echo '<meta name="robots" content="noai, noimageai">' . "\n";
echo '<meta name="GPTBot" content="noarchive">' . "\n";
echo '<meta name="Google-Extended" content="noindex">' . "\n";
echo '<meta name="CCBot" content="noindex">' . "\n";
echo '<meta name="anthropic-ai" content="noindex">' . "\n";
echo '<meta name="Bytespider" content="noindex">' . "\n";
return; // On arrête là, pas besoin de vérifier plus loin
}
}
}
}
}, 1);
à noter
Le site se veut écoresponsable et ultra-léger. Cela minimise l’impact des bots : moins de données transférées par page signifie moins de ressources gaspillées, même si un scraper passe outre les interdictions. Ces 3 mesures n’ont pas d’impact par exemple sur l’EcoIndex.
L’ensemble des snippets et codes partagés sont disponibles librement sur https://codeberg.org/VincentBreton-auteur
Retour en arrière :
Après analyse et examen, cette stratégie n’est pas vraiment efficace et doit être reprise à terme. Elle pose d’autres soucis vis à vis des moteurs de recherche.