# robots.txt — olud.ai # Politique : le site est un annuaire public. On veut être lu, indexé et cité. # # ───────────────────────────────────────────────────────────────────────────── # CONTENT SIGNALS — ajoutés le 20/07/2026 # Jusqu'ici, notre politique n'était écrite qu'en commentaires : lisibles par un # humain, invisibles pour un robot. Les Content Signals disent la même chose # dans un format normalisé. Trois réglages indépendants : # # search = apparaître dans un index de recherche classique # ai-input = être lu et CITÉ dans une réponse d'IA, avec un lien vers nous # ai-train = servir à l'entraînement d'un modèle # # Ce qui nous amène des lecteurs, c'est « ai-input », pas « ai-train ». # Passer ai-train à « no » ne coûterait donc aucun visiteur : c'est le réglage # de beaucoup d'éditeurs — « lis-moi et cite-moi, ne m'absorbe pas ». # On le laisse à « yes » par cohérence avec la décision assumée plus bas sur # les robots d'entraînement. Réversible en un mot. # ───────────────────────────────────────────────────────────────────────────── User-agent: * Content-Signal: search=yes, ai-input=yes, ai-train=yes Allow: / # /api/ est un proxy technique : rien à indexer, et l'exposer n'aurait aucun sens. Disallow: /api/ # ───────────────────────────────────────────────────────────────────────────── # Robots de RECHERCHE IA — explicitement bienvenus. # Ceux-ci répondent à des questions en citant leurs sources avec un lien : ce # sont des apporteurs de lecteurs, au même titre qu'un moteur classique. Nos # données factuelles et à jour sont exactement ce qu'ils cherchent. # Mesuré sur Cloudflare : ils lisent le site neuf fois plus que Googlebot, et # 78 visiteurs sont arrivés par un assistant en trente jours. # ───────────────────────────────────────────────────────────────────────────── User-agent: OAI-SearchBot Content-Signal: search=yes, ai-input=yes Allow: / Disallow: /api/ User-agent: Claude-SearchBot Content-Signal: search=yes, ai-input=yes Allow: / Disallow: /api/ User-agent: PerplexityBot Content-Signal: search=yes, ai-input=yes Allow: / Disallow: /api/ User-agent: Applebot Content-Signal: search=yes, ai-input=yes Allow: / Disallow: /api/ User-agent: Bingbot Content-Signal: search=yes, ai-input=yes Allow: / Disallow: /api/ # ───────────────────────────────────────────────────────────────────────────── # Robots d'ENTRAÎNEMENT — accès complet, décision assumée. # Ils collectent pour entraîner des modèles et ne renvoient jamais de visiteur. # Cloudflare montre qu'ils explorent surtout nos fichiers .json (~8 Mo/jour). # On les laisse faire pour deux raisons : avec le cache CDN, ce trafic ne coûte # plus rien ; et un modèle entraîné sur nos données peut mentionner ce site # spontanément — bénéfice invérifiable, mais gratuit. # # POUR REVENIR EN ARRIÈRE (décision réversible en une ligne, effet sous ~1 semaine) : # · leur fermer les données brutes → ajouter « Disallow: /*.json$ » # · les refuser entièrement → remplacer « Allow: / » par « Disallow: / » # · refuser l'entraînement seul → « Content-Signal: ai-train=no » # Aucune de ces options n'affecte le référencement Google : Googlebot suit le # groupe « * » ci-dessus, et Google-Extended ne concerne que l'entraînement de # Gemini, jamais le classement dans la recherche. # ───────────────────────────────────────────────────────────────────────────── User-agent: GPTBot Content-Signal: ai-train=yes Allow: / Disallow: /api/ User-agent: ClaudeBot Content-Signal: ai-train=yes Allow: / Disallow: /api/ User-agent: Google-Extended Content-Signal: ai-train=yes Allow: / Disallow: /api/ User-agent: CCBot Content-Signal: ai-train=yes Allow: / Disallow: /api/ User-agent: meta-externalagent Content-Signal: ai-train=yes Allow: / Disallow: /api/ # ───────────────────────────────────────────────────────────────────────────── # SITEMAPS # Une seule déclaration : l'index. Il référence déjà les 38 autres, y compris # sitemap-projects.xml et sitemap-alt.xml qui étaient listés séparément ici. # Les déclarer deux fois n'apporte rien et envoie des dates de dernière # modification contradictoires sur les mêmes URL. # ───────────────────────────────────────────────────────────────────────────── Sitemap: https://olud.ai/sitemap-index.xml