robots.txt-Assistent für KI-Crawler
GPTBot blockieren, aber ChatGPT Search erlauben? Erstellen Sie nachvollziehbare Regeln für Training, KI-Suche und nutzerinitiierte Abrufe – statt alle Bots pauschal gleichzubehandeln.
Regeln konfigurieren# Sichtbarkeit ohne Training
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Disallow: /intern/
Schritt 1 · Strategie
Passendes Preset wählen
Schritt 2 · Crawler
Zugriff einzeln steuern
Ein grüner Schalter erzeugt eine Freigabe mit Ihren privaten Pfaden. Ein ausgeschalteter Schalter erzeugt Disallow: /.
GPTBotCrawlt Inhalte, die potenziell für das Training generativer OpenAI-Modelle verwendet werden können.
Offizielle DokumentationVollständig blockiert
OAI-SearchBotHilft, Websites in den Suchfunktionen von ChatGPT zu finden und als Quelle zu verlinken.
Offizielle DokumentationErlaubt
ChatGPT-UserRuft Seiten bei bestimmten Aktionen durch ChatGPT-Nutzer oder Custom GPTs ab.
OpenAI weist darauf hin, dass robots.txt bei nutzerinitiierten Abrufen möglicherweise nicht gilt.
Offizielle DokumentationErlaubt
ClaudeBotSammelt öffentliche Webinhalte, die potenziell in Anthropic-Trainingsdatensätze einfließen können.
Offizielle DokumentationVollständig blockiert
Claude-SearchBotAnalysiert Webinhalte zur Verbesserung der Relevanz und Genauigkeit von Claude-Suchergebnissen.
Offizielle DokumentationErlaubt
Claude-UserRuft Websites auf, wenn Nutzer Claude um den Zugriff auf aktuelle Webinhalte bitten.
Offizielle DokumentationErlaubt
PerplexityBotIndexiert Seiten für Perplexity-Suchergebnisse und wird laut Anbieter nicht zum Training von Foundation Models eingesetzt.
Offizielle DokumentationErlaubt
Perplexity-UserBesucht eine Seite als Reaktion auf eine konkrete Nutzerfrage in Perplexity.
Perplexity weist darauf hin, dass dieser nutzerinitiierte Abruf robots.txt im Allgemeinen ignoriert.
Offizielle DokumentationErlaubt
Google-ExtendedSteuert die Nutzung gecrawlter Inhalte für Gemini-Modelltraining und bestimmte Grounding-Funktionen.
Eine Sperre beeinflusst laut Google nicht die Aufnahme oder das Ranking in der klassischen Google-Suche.
Offizielle DokumentationVollständig blockiert
Schritt 3 · Website
Pfade und bestehende Regeln
Ein Pfad pro Zeile. Diese Sperren werden nur bei erlaubten Crawlern ergänzt.
Diese Regeln bleiben am Anfang unverändert erhalten. Bereits vorhandene KI-Gruppen werden als mögliche Duplikate gemeldet.
Sicher veröffentlichen
Prüfen Sie vorhandene Regeln und ersetzen Sie die Datei nicht blind.
- 1Bestehende robots.txt sichern und in den Assistenten einfügen.
- 2Crawler-Zwecke sowie private Pfade einzeln kontrollieren.
- 3Entwurf als UTF-8-Datei robots.txt im Webroot veröffentlichen.
- 4Unter https://ihre-domain.de/robots.txt Erreichbarkeit und Inhalt prüfen.
Was robots.txt nicht kann
Die Datei steuert freiwillig beachtete Crawl-Zugriffe. Sie verhindert weder unbefugten Zugriff noch garantiert eine Freigabe Erwähnungen, Rankings oder Zitate. WAF- und CDN-Regeln können erlaubte Bots außerdem technisch blockieren.
Häufige Fragen
Sollte ich alle KI-Crawler blockieren?
Nicht pauschal. Trainingscrawler, automatische KI-Suche und nutzerinitiierte Abrufe erfüllen unterschiedliche Zwecke. Wer Sichtbarkeit in KI-Suchen wünscht, kann Suchcrawler erlauben und Trainingscrawler separat blockieren.
Schützt robots.txt vertrauliche Inhalte?
Nein. robots.txt ist öffentlich und wird freiwillig beachtet. Vertrauliche Inhalte benötigen Authentifizierung oder eine andere echte Zugriffskontrolle.
Beeinflusst Google-Extended meine klassischen Google-Rankings?
Google beschreibt Google-Extended als separaten Kontroll-Token für Gemini-Training und bestimmte Grounding-Funktionen. Die Einstellung soll die Aufnahme oder das Ranking in der Google-Suche nicht beeinflussen.
Wo muss die Datei veröffentlicht werden?
Die Datei muss als robots.txt im Webroot der jeweiligen Domain beziehungsweise Subdomain liegen und unter /robots.txt öffentlich erreichbar sein.
Danach die Inhalte kuratieren
robots.txt steuert den Crawl-Zugang. Die llms.txt beschreibt dagegen, welche öffentlichen Seiten Ihre wichtigsten Inhalte tragen.