ForHosting KIT · Websites auslesen & überwachen

Robots.txt aus Crawling-Regeln und Sitemap erstellen

Dieser robots.txt-Generator wandelt strukturierte Anweisungen für Crawler in eine saubere, veröffentlichungsfertige Datei um.

● BetaKostenlos · im Browser
Nutzen Sie es über WebAPIE-MailTelegramApp bald

Sie tragen jeden User-Agent ein, legen fest, ob sein Pfad erlaubt oder gesperrt wird, und geben die absolute URL Ihrer XML-Sitemap an. Der Generator prüft sämtliche Pfade, fasst Regeln desselben Crawlers zusammen, verwendet die übliche Schreibweise der Direktiven und liefert deterministischen Klartext mit sicheren Zeilenumbrüchen. Damit können Sie eine neue Richtlinie entwerfen, eine fehleranfällige handgeschriebene Datei ersetzen oder konsistente robots.txt-Inhalte innerhalb einer Bereitstellungspipeline erzeugen.

Beschreiben Sie den Crawler-Zugriff durch eindeutige Regeln

Fügen Sie zunächst für jede Entscheidung zu einem Crawler und einem Pfad eine Zeile hinzu. Der User-Agent bestimmt, welcher Crawler die Anweisung erhalten soll. Verwenden Sie ein Sternchen, wenn eine Regel für alle Crawler gilt, oder tragen Sie ein bestimmtes Token ein, wenn ein Crawler anders behandelt werden muss. Wählen Sie anschließend Allow oder Disallow und geben Sie das passende Pfadmuster an. Jeder Pfad muss mit einem Schrägstrich beginnen, auch der Stammpfad selbst. Dadurch wird ein häufiger Fehler in robots.txt erkannt, bevor die Datei veröffentlicht wird. Regeln für denselben User-Agent werden in einer Gruppe zusammengefasst, selbst wenn ihre Eingabezeilen voneinander getrennt sind. Die Reihenfolge der Gruppen und Regeln richtet sich nach ihrem ersten Auftreten. Diese stabile Sortierung erleichtert Prüfungen und verhindert unnötige Unterschiede zwischen wiederholten Builds. Der Generator entscheidet nicht, welche Bereiche privat oder crawlbar sein sollen, sondern setzt Ihre Vorgaben unverändert um. Prüfen Sie deshalb die Pfade anhand der tatsächlichen Routing-Struktur Ihrer Website.

Verstehen Sie die Wirkung der erzeugten Datei

Eine robots.txt teilt kooperativen Webcrawlern mit, welche URL-Pfade sie abrufen dürfen. Sie ist weder ein Authentifizierungssystem noch eine Zugriffskontrollliste oder ein Mittel zum Verbergen vertraulicher Inhalte. Eine gesperrte Adresse kann weiterhin über Links gefunden werden. Clients, die das Protokoll ignorieren, können sie abrufen, sofern der Server keine eigenständige Autorisierung verlangt. Schützen Sie sensible Ressourcen daher mit Anwendungsberechtigungen, privatem Speicher oder Serverregeln. Innerhalb einer User-Agent-Gruppe werten einzelne Crawler Allow- und Disallow-Muster gemäß ihrer eigenen Dokumentation aus, insbesondere bei Platzhaltern oder Endmarkierungen. Dieses Werkzeug behält den Pfadtext bei, statt die Prioritätsregeln eines bestimmten Crawlers vorherzusagen. Außerdem weist es eingebettete Zeilenumbrüche in User-Agent-Namen, Direktiven, Pfaden und der Sitemap zurück. So kann kein Feld unbemerkt zusätzliche Einträge einschleusen. Das Ergebnis nutzt die übliche Großschreibung und Leerzeilen, ohne Kommentare oder Annahmen hinzuzufügen, die in der strukturierten Eingabe nicht enthalten waren.

Veröffentlichen und prüfen Sie das Ergebnis

Speichern Sie den zurückgegebenen Inhalt als Klartextdatei namens robots.txt im Stammverzeichnis des betreffenden Website-Ursprungs, beispielsweise unter https://example.com/robots.txt. Das Sitemap-Feld muss eine absolute HTTP- oder HTTPS-URL enthalten. Der Generator normalisiert diese URL, bevor er die abschließende Sitemap-Zeile ergänzt. Damit können Crawler die XML-Sitemap auch dann finden, wenn sie unter einem weniger naheliegenden Pfad oder auf einem anderen zulässigen Host liegt. Rufen Sie nach der Bereitstellung die öffentliche robots.txt-URL direkt auf. Stellen Sie sicher, dass die Antwort erfolgreich ist, als Klartext ausgeliefert wird und nicht durch eine Fehlerseite, Weiterleitungsschleife oder Anmeldemaske ersetzt wurde. Testen Sie wichtige Pfade mit den Prüfwerkzeugen der für Sie relevanten Suchmaschinen und Crawler, da Unterstützung und Auswertung voneinander abweichen können. Erzeugen Sie die Datei erneut, wenn sich Routen, private Bereiche, Staging-Schutz oder Sitemap-Adressen ändern. Die deterministische Ausgabe eignet sich für Versionskontrolle und reproduzierbare Bereitstellungen.

Eine neue Website starten

Erstellen Sie eine lesbare Crawling-Richtlinie und einen Sitemap-Hinweis, bevor die Produktionsdomain indexiert wird.

Bereitstellung einheitlich konfigurieren

Erzeugen Sie in reproduzierbaren Website-Builds identische robots.txt-Inhalte aus strukturierten Einstellungen.

Crawler-Richtlinien trennen

Fassen Sie allgemeine Regeln und crawlerbezogene Ausnahmen zusammen, ohne Textblöcke von Hand umzustellen.

Was geschieht, wenn ein Regelpfad nicht mit einem Schrägstrich beginnt?

Die Anfrage endet mit einem Eingabefehler, der die betroffene Regel nennt, und es wird kein Dateiinhalt erzeugt.

Kann ich Regeln für mehrere User-Agents hinzufügen?

Ja. Regeln werden nach User-Agent in der Reihenfolge des jeweiligen ersten Auftretens gruppiert.

Schützt Disallow private Informationen?

Nein. Robots.txt gibt kooperativen Crawlern Hinweise, bietet aber keine Sicherheit. Schützen Sie sensible Ressourcen durch serverseitige Autorisierung.

Wo soll ich den erzeugten Inhalt veröffentlichen?

Veröffentlichen Sie ihn als robots.txt im Stammverzeichnis des Website-Ursprungs, dessen Crawling-Richtlinie er beschreibt.

Welche Sitemap-URLs werden akzeptiert?

Die Sitemap benötigt eine gültige absolute URL mit HTTP oder HTTPS.

Was kostet die API?

Die API kostet $0.002 pro Anfrage. Die Browserversion steht auf dieser Seite kostenlos bereit.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/web/robots-txt-generate

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/web/robots-txt-generate \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"rules":[{"user_agent":"*","directive":"allow","path":"/"},{"user_agent":"*","directive":"disallow","path":"/private/"},{"user_agent":"ResearchBot","directive":"disallow","path":"/"}],"sitemap_url":"https://example.com/sitemap.xml"}'
{
  "rules": [
    {
      "user_agent": "*",
      "directive": "allow",
      "path": "/"
    },
    {
      "user_agent": "*",
      "directive": "disallow",
      "path": "/private/"
    },
    {
      "user_agent": "ResearchBot",
      "directive": "disallow",
      "path": "/"
    }
  ],
  "sitemap_url": "https://example.com/sitemap.xml"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.robots_txt_generate",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

timeout_sec30
max_crawl_pages25
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →