VERZEICHNISSTAND 19. AUGUST 202619 BELEGTE EINTRÄGE

Kennung, Zweck, Verifikation

KI-Crawler-Verzeichnis

Jeder Eintrag stammt aus der Dokumentation des jeweiligen Betreibers, nicht aus Listen Dritter. Wo ein Betreiber eine Angabe nicht veröffentlicht, steht das hier – und nicht ein Wert aus zweiter Hand.

User-Agent ist kein Nachweis

Ein User-Agent ist eine frei wählbare Zeichenkette in einem HTTP-Header. Jeder kann jede Kennung senden. Google schreibt das in seiner eigenen Dokumentation ausdrücklich hin, Common Crawl warnt gesondert vor Nachahmern.

Das hat zwei Folgen, die in der Praxis regelmäßig übersehen werden. Erstens: Wer im Logfile Agentenzugriffe zählt, zählt Behauptungen, nicht Zugriffe. Zweitens: Wer per WAF-Regel nach Zeichenketten sperrt, sperrt die kooperativen Crawler und nicht die, die es darauf anlegen.

Es gibt drei belastbare Verfahren:

  • Veröffentlichte IP-Listen. Die meisten Betreiber pflegen eine JSON-Datei mit ihren Adressbereichen. Die Spalte „Verifikation" unten nennt sie je Kennung.
  • Reverse DNS. Bei Google und Common Crawl lässt sich die abrufende Adresse auf einen Betreiber-Hostnamen zurückführen und anschließend vorwärts bestätigen.
  • Web Bot Auth. Kryptografische Signatur des Requests nach RFC 9421. Das ist die einzige Methode, die den Nachweis in den Request selbst legt, statt ihn aus Nebeninformationen zu erschließen.
Der praktische Rat

Nutzen Sie robots.txt für die Absichtserklärung und IP- oder Signaturprüfung für die Durchsetzung. Wer beides verwechselt, hat entweder eine Regel ohne Wirkung oder eine Sperre gegen die Falschen.

Verzeichnis

Sortiert nach Zweck. Die Spalte „robots.txt" bezeichnet das vom Betreiber dokumentierte Verhalten, nicht das, was wir beobachtet haben.

Nutzergetriggert

Handelt im Auftrag eines konkreten Menschen, der bereits Interesse hat. Blockieren ist meist ein Eigentor.

KennungBetreiberrobots.txtVerifikationQuelle
ChatGPT-User
Ruft eine Seite ab, weil ein Mensch in ChatGPT danach gefragt hat.
OpenAIignoriert
Befolgt robots.txt nicht, da der Abruf durch eine Nutzeraktion ausgelöst wird.
IP-Liste: https://openai.com/chatgpt-user.jsonOpenAI, Bots-Dokumentation
Claude-User
Ruft Seiten ab, wenn ein Mensch Claude eine Frage stellt.
Anthropicbefolgt
Anthropic nennt eine eigene robots.txt-Kennung – bemerkenswert, weil nutzergetriggerte Fetcher robots.txt üblicherweise ignorieren.
IP-Liste: https://claude.com/crawling/bots.jsonAnthropic, Crawler-Dokumentation
Perplexity-User
Ruft Seiten ab, um eine konkrete Nutzerfrage zu beantworten.
Perplexityignoriert
Ignoriert robots.txt, weil der Abruf nutzerinitiiert ist.
IP-Liste: https://www.perplexity.com/perplexity-user.jsonPerplexity, Bots-Dokumentation
Google-Agent
Agenten auf Google-Infrastruktur, die im Auftrag eines Nutzers durch das Web navigieren.
Googleignoriert
Nutzergetriggerte Fetcher ignorieren robots.txt generell, weil ein Mensch den Abruf angefordert hat.
IP-Bereiche: user-triggered-agents.json und user-triggered-fetchers-google.jsonGoogle, User-Triggered Fetchers
meta-externalfetcher
Ruft Links für agentenbasierte KI-Funktionen auf Nutzerwunsch ab.
Metateilweise
Kann robots.txt-Regeln umgehen.
Betreiber veröffentlicht keine IP-Bereiche.Meta, Web Crawlers

Retrieval

Baut den Index auf, aus dem Antworten belegt werden. Wer hier fehlt, fehlt in den Antworten.

KennungBetreiberrobots.txtVerifikationQuelle
OAI-SearchBot
Indexiert Inhalte für die Suchfunktion in ChatGPT.
OpenAIbefolgt
Befolgt robots.txt.
IP-Liste: https://openai.com/searchbot.jsonOpenAI, Bots-Dokumentation
Claude-SearchBot
Navigiert das Web, um die Qualität von Suchergebnissen zu verbessern.
Anthropicbefolgt
Befolgt robots.txt.
IP-Liste: https://claude.com/crawling/bots.jsonAnthropic, Crawler-Dokumentation
PerplexityBot
Indexiert Inhalte für Suchergebnisse, laut Betreiber nicht für Modelltraining.
Perplexitybefolgt
Befolgt robots.txt.
IP-Liste: https://www.perplexity.com/perplexitybot.jsonPerplexity, Bots-Dokumentation
Googlebot
Klassischer Crawler für Google Search, Bilder, Video und News.
Googlebefolgt
Befolgt robots.txt beim automatischen Crawlen.
Reverse DNS auf crawl-***-***-***-***.googlebot.com sowie common-crawlers.jsonGoogle, Common Crawlers
meta-webindexer
Indexiert das Web, um KI-Suchergebnisse zu verbessern.
Metabefolgt
Befolgt robots.txt.
Betreiber veröffentlicht keine IP-Bereiche.Meta, Web Crawlers
Applebot
Versorgt Spotlight, Siri und Safari. Die erhobenen Daten können laut Apple zusätzlich dem Training der Apple-Foundation-Modelle dienen – dafür greift Applebot-Extended.
Applebefolgt
Befolgt robots.txt, aber nicht Crawl-delay. Wichtig: Nennt Ihre robots.txt kein Applebot, sondern nur Googlebot, folgt Applebot den Googlebot-Regeln.
Reverse DNS auf *.applebot.apple.com sowie CIDR-Liste: https://search.developer.apple.com/applebot.jsonApple, About Applebot

Training

Sammelt Material für künftige Modelle. Ein direkter Rückfluss zu Ihnen entsteht in der Regel nicht.

KennungBetreiberrobots.txtVerifikationQuelle
GPTBot
Sammelt Inhalte zum Training generativer Modelle.
OpenAIbefolgt
Befolgt robots.txt.
IP-Liste: https://openai.com/gptbot.jsonOpenAI, Bots-Dokumentation
ClaudeBot
Sammelt Webinhalte für Training und Sicherheit der Claude-Modelle.
Anthropicbefolgt
Befolgt robots.txt und unterstützt Crawl-delay.
IP-Liste: https://claude.com/crawling/bots.jsonAnthropic, Crawler-Dokumentation
Google-Extended
Steuert die Nutzung von Inhalten für Gemini-Training. Kein eigener HTTP-User-Agent – reines robots.txt-Token.
Googlebefolgt
Wirkt ausschließlich als robots.txt-Steuerung, nicht als eigener Abruf.
Nicht anwendbar – es gibt keinen eigenen Request unter dieser Kennung.Google, Common Crawlers
CCBot
Erstellt einen offenen Web-Datensatz. Er trainiert selbst kein Modell, ist aber die Grundlage vieler Trainingskorpora.
Common Crawl Foundationbefolgt
Befolgt robots.txt.
Reverse DNS auf crawl.commoncrawl.org sowie https://index.commoncrawl.org/ccbot.jsonCommon Crawl Foundation
meta-externalagent
Indexiert Inhalte für das Training von KI-Modellen.
Metabefolgt
Befolgt robots.txt.
Betreiber nennt IP-Prüfung als sicherere Methode, veröffentlicht aber keine Bereiche.Meta, Web Crawlers
Amazonbot
Verbessert Amazon-Produkte und kann zum Training von KI-Modellen genutzt werden. Amazon betreibt daneben Amzn-SearchBot und Amzn-User mit anderem Zweck.
Amazonbefolgt
Befolgt das Robots Exclusion Protocol und nutzt bei Nichterreichbarkeit eine bis zu 30 Tage alte zwischengespeicherte robots.txt.
IP-Liste: https://developer.amazon.com/amazonbot/ip-addresses/Amazon, Amazonbot
Applebot-Extended
Steuert, ob Inhalte zum Training der generativen Apple-Foundation-Modelle genutzt werden. Kein eigener HTTP-User-Agent – reines robots.txt-Token.
Applebefolgt
Wirkt ausschließlich als robots.txt-Steuerung. Ein Disallow hier beendet die Trainingsnutzung, lässt Applebot aber weiter für Suche crawlen.
Nicht anwendbar – es gibt keinen eigenen Request unter dieser Kennung.Apple, About Applebot

Werbung

Prüft Anzeigenziele. Für die Sichtbarkeit in Antworten ohne Bedeutung.

KennungBetreiberrobots.txtVerifikationQuelle
OAI-AdsBot
Prüft Landingpages von Anzeigen.
OpenAIbefolgt
Befolgt robots.txt.
IP-Liste: https://openai.com/adsbot.jsonOpenAI, Bots-Dokumentation
Lücken

Bewusst nicht enthalten sind Kennungen, für die wir keine Betreiberdokumentation prüfen konnten. Sie erscheinen erst hier, wenn die Quelle vorliegt. Amazon nennt in derselben Dokumentation zusätzlich Amzn-SearchBot und Amzn-User, veröffentlicht dort aber keine User-Agent-Strings – deshalb fehlen sie. Alle Einträge wurden am 19. August 2026 geprüft (2026-08-19).

Entscheidungsmatrix

Die Frage „KI-Crawler blockieren, ja oder nein?" ist falsch gestellt, weil sie vier verschiedene Zugriffsarten in einen Topf wirft. Nach Zweck getrennt wird sie beantwortbar.

Nutzergetriggert
Zulassen
Hinter dem Abruf steht ein konkreter Mensch mit einer konkreten Frage. Eine Sperre entfernt Sie aus genau der Situation, in der Sie vorkommen wollen. Mehrere dieser Kennungen ignorieren robots.txt ohnehin – die Sperre bräuchte eine CDN-Regel und würde dann echtes Nutzerinteresse blockieren.
Retrieval
Zulassen
Diese Crawler bauen den Index auf, aus dem Antworten belegt werden. Wer hier sperrt, verschwindet aus Antworten, ohne dafür etwas zu bekommen. Das ist die teuerste der drei Entscheidungen.
Training
Abwägen
Hier ist Sperren am ehesten begründbar, weil ein direkter Rückfluss selten ist. Gegenargument: Modellwissen über Ihre Marke entsteht auch aus Trainingsdaten. Wer sperrt, überlässt die Beschreibung seiner Marke dem, was Dritte über sie schreiben.
Werbung
Zulassen, wenn Sie dort werben
Ohne eigene Anzeigen auf der Plattform ist die Entscheidung ohne Wirkung.

Zwei Steuerungen laufen bewusst nicht über Crawler-Namen und werden deshalb regelmäßig übersehen. Cloudflares Content Signals in der robots.txt erklären die Erlaubnis für Suche, KI-Eingabe und KI-Training, ohne einen einzigen Crawler zu benennen. Und Apple verweist für den Ausschluss aus allgemeinen Wissensantworten in Siri und Search auf das nosnippet-Meta-Tag – ein Disallow für Applebot-Extended allein reicht dafür nicht.

Zur Abrechnung statt Sperre: Cloudflares Pay Per Crawl beantwortet Zugriffe ohne Zahlungsabsicht mit HTTP 402. Status, Voraussetzungen und die Fallstricke stehen im Agentic Web Index.

Regel-Generator

Die Ausgabe entsteht in Ihrem Browser. Es wird nichts an uns übertragen und nichts gespeichert. Ohne JavaScript sehen Sie die Standardauswahl.

Auswahl je Kennung

Vorbelegt ist: Trainings-Crawler sperren, antwortrelevante Zugriffe zulassen. Das ist eine begründbare Ausgangslage, keine Empfehlung für jeden Fall.

robots.txt

# Regeln für KI-Crawler
# Erzeugt mit agentsearchoptimization.de/ki-crawler-verzeichnis

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Ausdrücklich erlaubt:
User-agent: ChatGPT-User
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: OAI-AdsBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: Google-Agent
Allow: /

User-agent: meta-externalfetcher
Allow: /

User-agent: meta-webindexer
Allow: /

User-agent: Applebot
Allow: /

Cloudflare WAF Custom Rule

# Cloudflare WAF Custom Rule, Aktion: Block
# Prüfen Sie die Regel im Log-Modus, bevor Sie sie scharf schalten.
(http.user_agent contains "GPTBot" or http.user_agent contains "ClaudeBot" or http.user_agent contains "CCBot" or http.user_agent contains "meta-externalagent" or http.user_agent contains "Amazonbot")

# Google-Extended ist bewusst nicht enthalten: Es existiert kein Request unter dieser
# Kennung, eine WAF-Regel darauf würde nie greifen. Nur robots.txt wirkt hier.
# Applebot-Extended ist bewusst nicht enthalten: Es existiert kein Request unter dieser
# Kennung, eine WAF-Regel darauf würde nie greifen. Nur robots.txt wirkt hier.

# Wichtig: Diese Regel prüft eine Zeichenkette, keinen Nachweis.
# Für verifizierte Bots ist cf.verified_bot_category die belastbarere Grundlage.
Vor dem Einsatz

Prüfen Sie jede WAF-Regel zuerst im Protokollmodus. Und beachten Sie: Bei Cloudflare überschreiben WAF- und Bot-Management-Regeln die Pay-per-Crawl-Einstellung – gestapelte Regeln können die eigene Monetarisierung unbemerkt abschalten.

Prüfen, was auf Ihrer Seite tatsächlich ankommt

Der Agent Readiness Check ruft eine URL mit mehreren dieser Kennungen ab und zeigt, wo Ihre Infrastruktur unterschiedlich antwortet.

Zum Agent Readiness Check