Wer einen KI-Crawler aussperrt, verschwindet aus den Antworten der zugehörigen Engine. Wer ihn zulässt, kann zitiert werden. Die Entscheidung fällt pro Crawler und nicht pauschal, und sie fällt in zwei getrennten Dateien beziehungsweise Systemen: in robots.txt und in Ihrer Firewall.
Welche User-Agents senden KI-Suchmaschinen?
- OpenAI:
GPTBot(Training),OAI-SearchBot(Suchindex),ChatGPT-User(Abruf durch eine Nutzerfrage) - Anthropic:
ClaudeBot,Claude-User,Claude-SearchBot,anthropic-ai - Perplexity:
PerplexityBot,Perplexity-User - Google:
Google-Extended(KI-Grounding;Googlebotist davon getrennt) - Weitere:
Bytespider(ByteDance),CCBot(Common Crawl),meta-externalagent(Meta),Applebot-Extended(Apple)
Die *-User-Agents sind etwas anderes als die übrigen: Sie rufen eine URL ab, weil eine Person gerade danach gefragt hat. Wer sie blockiert, ändert nicht die Zukunft des Index, sondern die Antwort, die ein Mensch im selben Moment erhält.
Wie blockiere ich GPTBot in robots.txt?
# GPTBot vollstaendig aussperren User-agent: GPTBot Disallow: / # Nur Teile aussperren (Index bleibt erlaubt) User-agent: GPTBot Disallow: /intern/ Disallow: /suche?
Wichtig: GPTBot deckt Training und Grounding ab. Wer nur das Training ablehnen, aber weiterhin in ChatGPT-Antworten erscheinen will, muss zwischen den Agents unterscheiden und nicht den ganzen Anbieter aussperren.
Wie erlaube ich KI-Crawler gezielt?
Ohne robots.txt ist alles erlaubt – der Standardfall ist also bereits zulässig. Sinnvoll ist eine ausdrückliche Regel trotzdem, weil sie die Absicht dokumentiert und verhindert, dass eine später hinzugefügte Wildcard-Regel die KI-Crawler unbeabsichtigt mit aussperrt.
User-agent: GPTBot Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: / User-agent: * Allow: / Disallow: /intern/ Sitemap: https://ihre-domain.de/sitemap.xml
Sollte ich KI-Trainingscrawler blockieren?
Das ist eine legitime Entscheidung, aber eine andere als die Frage der Sichtbarkeit.CCBot und GPTBot betreffen Training und Grounding.OAI-SearchBot und PerplexityBot entscheiden darüber, ob Sie überhaupt zitiert werden können. Wer Sichtbarkeit will, sperrt die zweiten nicht aus – und sperrt Googlebot oder Bingbot nie versehentlich mit.
Warum sehe ich trotzdem eine 403-Antwort?
Weil große Websites Crawler nicht am User-Agent, sondern an der IP-Adresse prüfen. Ein Scan-Werkzeug, das sich als GPTBot ausgibt, wird dann als Fälschung erkannt und abgewiesen – obwohl echter GPTBot-Verkehr problemlos bedient wird. Eine 403-Antwort gegenüber einem fremden Rechner beweist also nichts über echte KI-Crawler. Verlässlich ist allein die robots.txt: Sie ist die erklärte Absicht der Website.
Wie prüfe ich, was tatsächlich blockiert ist?
- Rufen Sie
https://ihre-domain.de/robots.txtauf und suchen Sie die Gruppen der genannten Agents. - Beachten Sie, dass eine exakte Agent-Gruppe Vorrang vor
*hat und die letzte passende Regel gewinnt. - Prüfen Sie, ob Ihre Firewall den Agents ein
403zurückgibt und ob der Headercf-mitigatedauftaucht. - Suchen Sie im Sicherheitsprotokoll Ihres CDN nach abgewiesenen Anfragen aus den Adressbereichen von OpenAI, Anthropic und Perplexity.
Die ersten drei Schritte führt der LLMention-Scanner automatisch aus und benennt, welcher Agent blockiert wird und warum. Die vollständige Bewertungslogik steht in der Methodik (EN).