Kostenlos · ohne Registrierung

robots.txt-Assistent für KI-Crawler

GPTBot blockieren, aber ChatGPT Search erlauben? Erstellen Sie nachvollziehbare Regeln für Training, KI-Suche und nutzerinitiierte Abrufe – statt alle Bots pauschal gleichzubehandeln.

Regeln konfigurieren

# Sichtbarkeit ohne Training

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /
Disallow: /intern/

Schritt 1 · Strategie

Passendes Preset wählen

Schritt 2 · Crawler

Zugriff einzeln steuern

Ein grüner Schalter erzeugt eine Freigabe mit Ihren privaten Pfaden. Ein ausgeschalteter Schalter erzeugt Disallow: /.

OpenAI
GPTBot
Modellentwicklung

Crawlt Inhalte, die potenziell für das Training generativer OpenAI-Modelle verwendet werden können.

Offizielle Dokumentation

Vollständig blockiert

OAI-SearchBot
KI-Suche

Hilft, Websites in den Suchfunktionen von ChatGPT zu finden und als Quelle zu verlinken.

Offizielle Dokumentation

Erlaubt

ChatGPT-User
Nutzerabruf

Ruft Seiten bei bestimmten Aktionen durch ChatGPT-Nutzer oder Custom GPTs ab.

OpenAI weist darauf hin, dass robots.txt bei nutzerinitiierten Abrufen möglicherweise nicht gilt.

Offizielle Dokumentation

Erlaubt

Anthropic
ClaudeBot
Modellentwicklung

Sammelt öffentliche Webinhalte, die potenziell in Anthropic-Trainingsdatensätze einfließen können.

Offizielle Dokumentation

Vollständig blockiert

Claude-SearchBot
KI-Suche

Analysiert Webinhalte zur Verbesserung der Relevanz und Genauigkeit von Claude-Suchergebnissen.

Offizielle Dokumentation

Erlaubt

Claude-User
Nutzerabruf

Ruft Websites auf, wenn Nutzer Claude um den Zugriff auf aktuelle Webinhalte bitten.

Offizielle Dokumentation

Erlaubt

Perplexity
PerplexityBot
KI-Suche

Indexiert Seiten für Perplexity-Suchergebnisse und wird laut Anbieter nicht zum Training von Foundation Models eingesetzt.

Offizielle Dokumentation

Erlaubt

Perplexity-User
Nutzerabruf

Besucht eine Seite als Reaktion auf eine konkrete Nutzerfrage in Perplexity.

Perplexity weist darauf hin, dass dieser nutzerinitiierte Abruf robots.txt im Allgemeinen ignoriert.

Offizielle Dokumentation

Erlaubt

Google
Google-Extended
Training & Grounding

Steuert die Nutzung gecrawlter Inhalte für Gemini-Modelltraining und bestimmte Grounding-Funktionen.

Eine Sperre beeinflusst laut Google nicht die Aufnahme oder das Ranking in der klassischen Google-Suche.

Offizielle Dokumentation

Vollständig blockiert

Schritt 3 · Website

Pfade und bestehende Regeln

Ein Pfad pro Zeile. Diese Sperren werden nur bei erlaubten Crawlern ergänzt.

Diese Regeln bleiben am Anfang unverändert erhalten. Bereits vorhandene KI-Gruppen werden als mögliche Duplikate gemeldet.

Sicher veröffentlichen

Prüfen Sie vorhandene Regeln und ersetzen Sie die Datei nicht blind.

  1. 1Bestehende robots.txt sichern und in den Assistenten einfügen.
  2. 2Crawler-Zwecke sowie private Pfade einzeln kontrollieren.
  3. 3Entwurf als UTF-8-Datei robots.txt im Webroot veröffentlichen.
  4. 4Unter https://ihre-domain.de/robots.txt Erreichbarkeit und Inhalt prüfen.

Was robots.txt nicht kann

Die Datei steuert freiwillig beachtete Crawl-Zugriffe. Sie verhindert weder unbefugten Zugriff noch garantiert eine Freigabe Erwähnungen, Rankings oder Zitate. WAF- und CDN-Regeln können erlaubte Bots außerdem technisch blockieren.

Häufige Fragen

Sollte ich alle KI-Crawler blockieren?

Nicht pauschal. Trainingscrawler, automatische KI-Suche und nutzerinitiierte Abrufe erfüllen unterschiedliche Zwecke. Wer Sichtbarkeit in KI-Suchen wünscht, kann Suchcrawler erlauben und Trainingscrawler separat blockieren.

Schützt robots.txt vertrauliche Inhalte?

Nein. robots.txt ist öffentlich und wird freiwillig beachtet. Vertrauliche Inhalte benötigen Authentifizierung oder eine andere echte Zugriffskontrolle.

Beeinflusst Google-Extended meine klassischen Google-Rankings?

Google beschreibt Google-Extended als separaten Kontroll-Token für Gemini-Training und bestimmte Grounding-Funktionen. Die Einstellung soll die Aufnahme oder das Ranking in der Google-Suche nicht beeinflussen.

Wo muss die Datei veröffentlicht werden?

Die Datei muss als robots.txt im Webroot der jeweiligen Domain beziehungsweise Subdomain liegen und unter /robots.txt öffentlich erreichbar sein.

Danach die Inhalte kuratieren

robots.txt steuert den Crawl-Zugang. Die llms.txt beschreibt dagegen, welche öffentlichen Seiten Ihre wichtigsten Inhalte tragen.