User-Agent ist kein Nachweis
Ein User-Agent ist eine frei wählbare Zeichenkette in einem HTTP-Header. Jeder kann jede Kennung senden. Google schreibt das in seiner eigenen Dokumentation ausdrücklich hin, Common Crawl warnt gesondert vor Nachahmern.
Das hat zwei Folgen, die in der Praxis regelmäßig übersehen werden. Erstens: Wer im Logfile Agentenzugriffe zählt, zählt Behauptungen, nicht Zugriffe. Zweitens: Wer per WAF-Regel nach Zeichenketten sperrt, sperrt die kooperativen Crawler und nicht die, die es darauf anlegen.
Es gibt drei belastbare Verfahren:
- Veröffentlichte IP-Listen. Die meisten Betreiber pflegen eine JSON-Datei mit ihren Adressbereichen. Die Spalte „Verifikation" unten nennt sie je Kennung.
- Reverse DNS. Bei Google und Common Crawl lässt sich die abrufende Adresse auf einen Betreiber-Hostnamen zurückführen und anschließend vorwärts bestätigen.
- Web Bot Auth. Kryptografische Signatur des Requests nach RFC 9421. Das ist die einzige Methode, die den Nachweis in den Request selbst legt, statt ihn aus Nebeninformationen zu erschließen.
Nutzen Sie robots.txt für die Absichtserklärung und IP- oder Signaturprüfung für die Durchsetzung. Wer beides verwechselt, hat entweder eine Regel ohne Wirkung oder eine Sperre gegen die Falschen.
Verzeichnis
Sortiert nach Zweck. Die Spalte „robots.txt" bezeichnet das vom Betreiber dokumentierte Verhalten, nicht das, was wir beobachtet haben.
Nutzergetriggert
Handelt im Auftrag eines konkreten Menschen, der bereits Interesse hat. Blockieren ist meist ein Eigentor.
| Kennung | Betreiber | robots.txt | Verifikation | Quelle |
|---|---|---|---|---|
| ChatGPT-User Ruft eine Seite ab, weil ein Mensch in ChatGPT danach gefragt hat. | OpenAI | ignoriert Befolgt robots.txt nicht, da der Abruf durch eine Nutzeraktion ausgelöst wird. | IP-Liste: https://openai.com/chatgpt-user.json | OpenAI, Bots-Dokumentation |
| Claude-User Ruft Seiten ab, wenn ein Mensch Claude eine Frage stellt. | Anthropic | befolgt Anthropic nennt eine eigene robots.txt-Kennung – bemerkenswert, weil nutzergetriggerte Fetcher robots.txt üblicherweise ignorieren. | IP-Liste: https://claude.com/crawling/bots.json | Anthropic, Crawler-Dokumentation |
| Perplexity-User Ruft Seiten ab, um eine konkrete Nutzerfrage zu beantworten. | Perplexity | ignoriert Ignoriert robots.txt, weil der Abruf nutzerinitiiert ist. | IP-Liste: https://www.perplexity.com/perplexity-user.json | Perplexity, Bots-Dokumentation |
| Google-Agent Agenten auf Google-Infrastruktur, die im Auftrag eines Nutzers durch das Web navigieren. | ignoriert Nutzergetriggerte Fetcher ignorieren robots.txt generell, weil ein Mensch den Abruf angefordert hat. | IP-Bereiche: user-triggered-agents.json und user-triggered-fetchers-google.json | Google, User-Triggered Fetchers | |
| meta-externalfetcher Ruft Links für agentenbasierte KI-Funktionen auf Nutzerwunsch ab. | Meta | teilweise Kann robots.txt-Regeln umgehen. | Betreiber veröffentlicht keine IP-Bereiche. | Meta, Web Crawlers |
Retrieval
Baut den Index auf, aus dem Antworten belegt werden. Wer hier fehlt, fehlt in den Antworten.
| Kennung | Betreiber | robots.txt | Verifikation | Quelle |
|---|---|---|---|---|
| OAI-SearchBot Indexiert Inhalte für die Suchfunktion in ChatGPT. | OpenAI | befolgt Befolgt robots.txt. | IP-Liste: https://openai.com/searchbot.json | OpenAI, Bots-Dokumentation |
| Claude-SearchBot Navigiert das Web, um die Qualität von Suchergebnissen zu verbessern. | Anthropic | befolgt Befolgt robots.txt. | IP-Liste: https://claude.com/crawling/bots.json | Anthropic, Crawler-Dokumentation |
| PerplexityBot Indexiert Inhalte für Suchergebnisse, laut Betreiber nicht für Modelltraining. | Perplexity | befolgt Befolgt robots.txt. | IP-Liste: https://www.perplexity.com/perplexitybot.json | Perplexity, Bots-Dokumentation |
| Googlebot Klassischer Crawler für Google Search, Bilder, Video und News. | befolgt Befolgt robots.txt beim automatischen Crawlen. | Reverse DNS auf crawl-***-***-***-***.googlebot.com sowie common-crawlers.json | Google, Common Crawlers | |
| meta-webindexer Indexiert das Web, um KI-Suchergebnisse zu verbessern. | Meta | befolgt Befolgt robots.txt. | Betreiber veröffentlicht keine IP-Bereiche. | Meta, Web Crawlers |
| Applebot Versorgt Spotlight, Siri und Safari. Die erhobenen Daten können laut Apple zusätzlich dem Training der Apple-Foundation-Modelle dienen – dafür greift Applebot-Extended. | Apple | befolgt Befolgt robots.txt, aber nicht Crawl-delay. Wichtig: Nennt Ihre robots.txt kein Applebot, sondern nur Googlebot, folgt Applebot den Googlebot-Regeln. | Reverse DNS auf *.applebot.apple.com sowie CIDR-Liste: https://search.developer.apple.com/applebot.json | Apple, About Applebot |
Training
Sammelt Material für künftige Modelle. Ein direkter Rückfluss zu Ihnen entsteht in der Regel nicht.
| Kennung | Betreiber | robots.txt | Verifikation | Quelle |
|---|---|---|---|---|
| GPTBot Sammelt Inhalte zum Training generativer Modelle. | OpenAI | befolgt Befolgt robots.txt. | IP-Liste: https://openai.com/gptbot.json | OpenAI, Bots-Dokumentation |
| ClaudeBot Sammelt Webinhalte für Training und Sicherheit der Claude-Modelle. | Anthropic | befolgt Befolgt robots.txt und unterstützt Crawl-delay. | IP-Liste: https://claude.com/crawling/bots.json | Anthropic, Crawler-Dokumentation |
| Google-Extended Steuert die Nutzung von Inhalten für Gemini-Training. Kein eigener HTTP-User-Agent – reines robots.txt-Token. | befolgt Wirkt ausschließlich als robots.txt-Steuerung, nicht als eigener Abruf. | Nicht anwendbar – es gibt keinen eigenen Request unter dieser Kennung. | Google, Common Crawlers | |
| CCBot Erstellt einen offenen Web-Datensatz. Er trainiert selbst kein Modell, ist aber die Grundlage vieler Trainingskorpora. | Common Crawl Foundation | befolgt Befolgt robots.txt. | Reverse DNS auf crawl.commoncrawl.org sowie https://index.commoncrawl.org/ccbot.json | Common Crawl Foundation |
| meta-externalagent Indexiert Inhalte für das Training von KI-Modellen. | Meta | befolgt Befolgt robots.txt. | Betreiber nennt IP-Prüfung als sicherere Methode, veröffentlicht aber keine Bereiche. | Meta, Web Crawlers |
| Amazonbot Verbessert Amazon-Produkte und kann zum Training von KI-Modellen genutzt werden. Amazon betreibt daneben Amzn-SearchBot und Amzn-User mit anderem Zweck. | Amazon | befolgt Befolgt das Robots Exclusion Protocol und nutzt bei Nichterreichbarkeit eine bis zu 30 Tage alte zwischengespeicherte robots.txt. | IP-Liste: https://developer.amazon.com/amazonbot/ip-addresses/ | Amazon, Amazonbot |
| Applebot-Extended Steuert, ob Inhalte zum Training der generativen Apple-Foundation-Modelle genutzt werden. Kein eigener HTTP-User-Agent – reines robots.txt-Token. | Apple | befolgt Wirkt ausschließlich als robots.txt-Steuerung. Ein Disallow hier beendet die Trainingsnutzung, lässt Applebot aber weiter für Suche crawlen. | Nicht anwendbar – es gibt keinen eigenen Request unter dieser Kennung. | Apple, About Applebot |
Werbung
Prüft Anzeigenziele. Für die Sichtbarkeit in Antworten ohne Bedeutung.
| Kennung | Betreiber | robots.txt | Verifikation | Quelle |
|---|---|---|---|---|
| OAI-AdsBot Prüft Landingpages von Anzeigen. | OpenAI | befolgt Befolgt robots.txt. | IP-Liste: https://openai.com/adsbot.json | OpenAI, Bots-Dokumentation |
Bewusst nicht enthalten sind Kennungen, für die wir keine Betreiberdokumentation prüfen konnten. Sie erscheinen erst hier, wenn die Quelle vorliegt. Amazon nennt in derselben Dokumentation zusätzlich Amzn-SearchBot und Amzn-User, veröffentlicht dort aber keine User-Agent-Strings – deshalb fehlen sie. Alle Einträge wurden am 19. August 2026 geprüft (2026-08-19).
Entscheidungsmatrix
Die Frage „KI-Crawler blockieren, ja oder nein?" ist falsch gestellt, weil sie vier verschiedene Zugriffsarten in einen Topf wirft. Nach Zweck getrennt wird sie beantwortbar.
- Nutzergetriggert
Zulassen - Hinter dem Abruf steht ein konkreter Mensch mit einer konkreten Frage. Eine Sperre entfernt Sie aus genau der Situation, in der Sie vorkommen wollen. Mehrere dieser Kennungen ignorieren robots.txt ohnehin – die Sperre bräuchte eine CDN-Regel und würde dann echtes Nutzerinteresse blockieren.
- Retrieval
Zulassen - Diese Crawler bauen den Index auf, aus dem Antworten belegt werden. Wer hier sperrt, verschwindet aus Antworten, ohne dafür etwas zu bekommen. Das ist die teuerste der drei Entscheidungen.
- Training
Abwägen - Hier ist Sperren am ehesten begründbar, weil ein direkter Rückfluss selten ist. Gegenargument: Modellwissen über Ihre Marke entsteht auch aus Trainingsdaten. Wer sperrt, überlässt die Beschreibung seiner Marke dem, was Dritte über sie schreiben.
- Werbung
Zulassen, wenn Sie dort werben - Ohne eigene Anzeigen auf der Plattform ist die Entscheidung ohne Wirkung.
Zwei Steuerungen laufen bewusst nicht über Crawler-Namen und werden deshalb regelmäßig übersehen. Cloudflares Content Signals in der robots.txt erklären die Erlaubnis für Suche, KI-Eingabe und KI-Training, ohne einen einzigen Crawler zu benennen. Und Apple verweist für den Ausschluss aus allgemeinen Wissensantworten in Siri und Search auf das nosnippet-Meta-Tag – ein Disallow für Applebot-Extended allein reicht dafür nicht.
Zur Abrechnung statt Sperre: Cloudflares Pay Per Crawl beantwortet Zugriffe ohne Zahlungsabsicht mit HTTP 402. Status, Voraussetzungen und die Fallstricke stehen im Agentic Web Index.
Regel-Generator
Die Ausgabe entsteht in Ihrem Browser. Es wird nichts an uns übertragen und nichts gespeichert. Ohne JavaScript sehen Sie die Standardauswahl.
robots.txt
# Regeln für KI-Crawler # Erzeugt mit agentsearchoptimization.de/ki-crawler-verzeichnis User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: meta-externalagent Disallow: / User-agent: Amazonbot Disallow: / User-agent: Applebot-Extended Disallow: / # Ausdrücklich erlaubt: User-agent: ChatGPT-User Allow: / User-agent: OAI-SearchBot Allow: / User-agent: OAI-AdsBot Allow: / User-agent: Claude-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: Googlebot Allow: / User-agent: Google-Agent Allow: / User-agent: meta-externalfetcher Allow: / User-agent: meta-webindexer Allow: / User-agent: Applebot Allow: /
Cloudflare WAF Custom Rule
# Cloudflare WAF Custom Rule, Aktion: Block # Prüfen Sie die Regel im Log-Modus, bevor Sie sie scharf schalten. (http.user_agent contains "GPTBot" or http.user_agent contains "ClaudeBot" or http.user_agent contains "CCBot" or http.user_agent contains "meta-externalagent" or http.user_agent contains "Amazonbot") # Google-Extended ist bewusst nicht enthalten: Es existiert kein Request unter dieser # Kennung, eine WAF-Regel darauf würde nie greifen. Nur robots.txt wirkt hier. # Applebot-Extended ist bewusst nicht enthalten: Es existiert kein Request unter dieser # Kennung, eine WAF-Regel darauf würde nie greifen. Nur robots.txt wirkt hier. # Wichtig: Diese Regel prüft eine Zeichenkette, keinen Nachweis. # Für verifizierte Bots ist cf.verified_bot_category die belastbarere Grundlage.
Prüfen Sie jede WAF-Regel zuerst im Protokollmodus. Und beachten Sie: Bei Cloudflare überschreiben WAF- und Bot-Management-Regeln die Pay-per-Crawl-Einstellung – gestapelte Regeln können die eigene Monetarisierung unbemerkt abschalten.
Prüfen, was auf Ihrer Seite tatsächlich ankommt
Der Agent Readiness Check ruft eine URL mit mehreren dieser Kennungen ab und zeigt, wo Ihre Infrastruktur unterschiedlich antwortet.
Zum Agent Readiness Check