Robots.txt erklärt: Was es wirklich blockiert (und was nicht)

Teste AuditMe live — kostenloser Sofort-Scan
Füge unten eine beliebige URL ein und erhalte in ca. 60 Sekunden ein echtes SEO-Ergebnis. Keine Registrierung nötig — dieselbe Engine, die in diesem Artikel beschrieben wird.
Die Datei, die mehr SEOs verwirrt als jede andere
Ich habe den Überblick über die Audits verloren, bei denen die erste rote Flagge eine robots.txt-Datei war, die jemand mit guten Absichten geschrieben und die damit die Seite zerstört hat. Einer meiner absoluten Favoriten: ein Kunde, dessen gesamte Sitemap blockiert war — nicht weil er das wollte, sondern weil er ein "Best-Practice"-robots.txt aus einem Forenbeitrag kopiert hatte, das /sitemap/ verbot — während seine echte Sitemap unter /sitemap.xml lebte.
Ein anderer Slash. Mehr war nicht nötig. Google crawlerte seine Startseite, sah, dass die Sitemap-URL nicht erlaubt war, und entdeckte leise die Hälfte seines Contents nicht mehr.
Das Frustrierende? Nichts sah falsch aus. Die Seite rankte für die Seiten gut, die Google bereits kannte. Aber neue Seiten? Sie crawlen in ein Vakuum. Ich brauchte drei Stunden, um herauszufinden, warum der frische Content eines Kunden nicht indexiert wurde — und die Antwort war eine Zeile in einer Textdatei, die sechs Monate lang falsch gewesen war.
Was robots.txt wirklich tut
Robots.txt ist eine Reihe von Regeln, die Crawlern sagt, welche Pfade sie anfragen dürfen und welche nicht. Gelesen wird es von Googlebot, Bingbot und den meisten anderen Crawlern, bevor sie mit dem Abrufen einer Website beginnen.
Das entscheidende Verständnis: robots.txt ist keine Zugriffskontrolle. Es ist eine Anfrage. Ein höfliches Schild an der Tür, kein Schloss. Und entscheidend: Das Blockieren einer URL in robots.txt entfernt sie NICHT aus dem Index. Wenn eine Seite bereits indexiert ist und du sie blockierst, zeigt Google sie weiterhin in den Ergebnissen — es kann sie nur nicht mehr crawlen, was bedeutet, dass es Titel, Beschreibung und Content-Updates nicht sehen kann. Du bekommst einen Eintrag mit dem Snippet, das Google zuletzt gespeichert hat.
Robots.txt dient dazu, Crawling-Budget zu sparen und Googlebot vom Müll fernzuhalten. Die Seiten, die du wirklich nicht in der Suche willst, verdienen ein Noindex-Tag, kein Disallow.
Die Struktur, entmystifiziert
Eine robots.txt-Datei ist absichtlich langweilig:
User-agent: *
Disallow: /private/
Allow: /private/public/
Sitemap: https://deinewebsite.com/sitemap.xml- User-agent sagt, auf welchen Crawler die Regeln angewendet werden.
- Disallow listet Pfade auf, die der Crawler nicht abrufen soll.
- Allow schafft Ausnahmen innerhalb eines blockierten Bereichs.
- Sitemap weist die Crawler auf deine Sitemap hin.
Wildcards werden von Googlebot unterstützt — $ für "endet mit" und * für "beliebige Zeichen" — aber viele SEOs übertreiben es und landen bei Regeln, die mehr blockieren als beabsichtigt.
Die Fehler, die dich leise schädigen
1. Deine Sitemap blockieren
Deine Sitemap sollte nie blockiert sein. Ich weiß ehrlich nicht, warum so viele Beispieldateien sie enthalten. Die Sitemap zu blockieren ist, als würdest du Googlebot sagen: "Schau dir meine Liste von allem nicht an."
2. Disallow auf Seiten, die du indexiert haben willst
Alles, was du im Google-Index haben willst, muss crawlbar sein. Wenn du es verbietest, kann Google es nicht von deiner Website aus entdecken. Das klingt offensichtlich, aber ich habe Websites gesehen, die ihr ganzes Blog-Verzeichnis, ihre Kategorien, ihre Produkte blockieren. Manchmal wegen einer alten Regel, an die sich niemand erinnert, sie hinzugefügt zu haben.
3. robots.txt statt Noindex verwenden
Wie gesagt: Disallow ist kein Noindex. Wenn du eine Seite aus dem Index haben willst, setze ihr ein Noindex-Tag auf und lasse sie crawlbar. Wenn du sie in robots.txt blockierst, wird das Noindex-Tag für Google unsichtbar (es kann die Seite nicht abrufen, um das Tag zu lesen), und du steckst in einem schlimmeren Zustand fest als zuvor.
4. Googlebot blockieren statt nur langsame Ressourcen
Eine ganze JS- oder CSS-Datei zu blockieren, um "Bandbreite zu sparen", ist ein 2013er-Move. Moderner Googlebot rendert Seiten, und wenn du die Assets blockierst, die die Seite rendern, bleibt eine Seite übrig, die Google nicht verstehen kann. Blockiere die Ressourcendateien, die wirklich Crawling-Budget verschwenden, nicht die, die deine Seiten aufbauen.
5. Gar keine Sitemap-Zeile
Die Sitemap-Direktive ist nicht obligatorisch, aber wenn deine Website groß oder komplex ist, ist es gratis Hilfe. Crawler finden deine Sitemap über deine robots.txt, über deine Search-Console-Einreichung oder über die Links deiner Startseite. Lass sie nicht dafür arbeiten.
So prüfst du deine robots.txt richtig
Das ist der Validierungsdurchlauf, den ich mache:
- Rufe deine robots.txt ab und lies jede Regel Zeile für Zeile.
- Bestätige, dass der Sitemap-Pfad exakt mit dem tatsächlichen Sitemap-Standort übereinstimmt.
- Prüfe, dass keine Regel /, /sitemap.xml oder deine Hauptverzeichnisse blockiert.
- Stelle sicher, dass jedes Disallow, das du hast, für Seiten ist, die du wirklich nicht gecrawlt haben willst.
- Teste ein paar echte URLs gegen deine Regeln mit einem Robots-Tester.
- Verifiziere, dass du deine Seiten noch in einem Inkognito-Browser abrufen kannst — robots.txt blockiert auch deinen eigenen Browser, wenn du auf einem nicht erlaubten Pfad bist.
Der robots.txt-Checker von AuditMe erledigt die Schritte 1 bis 5 für dich. Gib ihm eine Domain, er holt die Datei, bewertet die Regeln gegen deine wichtigsten Pfade und markiert die Landminen — einschließlich des Klassikers des blockierten Sitemaps.
Solltest du die Datei einfach löschen?
Wenn deine robots.txt ein Chaos ist und du dir nicht sicher bist, welche Regeln behalten werden sollten, ist die ehrliche Antwort oft ja: Lösche das Ganze und beginne neu. Eine leere Datei bedeutet "crawle alles, was du finden kannst", was die richtige Standardeinstellung für 95% der Websites ist. Füge dann nur die Regeln wieder hinzu, die du laut in einem Satz erklären kannst.
Für Websites, die Struktur brauchen — einen Staging-Bereich, einen privaten Admin-Pfad, ein schwarzes Loch endloser Paginierung — halte die Datei minimal und kommentiere deine Überlegung, damit die nächste Person sie nicht reverse-engineeren muss.
FAQ
Entfernt das Blockieren einer Seite in robots.txt sie aus Google?
Nein. Es stoppt nur das Crawling durch Google. Die Seite kann mit veraltetem Content im Index bleiben. Verwende Noindex, wenn du willst, dass die Seite verschwindet.
Sollte meine Sitemap in robots.txt aufgeführt sein?
Ja, und der Pfad muss exakt übereinstimmen. Es ist eine kleine Annehmlichkeit, die Crawlern das Suchen erspart.
Kann robots.txt Google am Rendern von JavaScript hindern?
Ja, indirekt. Wenn du die JS- oder CSS-Dateien verbietest, kann Googlebot die Seite nicht richtig rendern, was deinen Content unsichtbar machen kann, obwohl das HTML crawlbar ist.
Validiere, bevor es dich etwas kostet
Die teuersten Bugs im SEO sind die, die gesund aussehen. Eine schlechte robots.txt ist das Vorzeigebeispiel — die Website "funktioniert", der Traffic ist gut, und niemand merkt, dass neuer Content leise nicht indexiert wird. Führe noch heute einen robots.txt-Check auf deiner Domain durch, lies jede Regel und lösche alles, was du nicht erklären kannst. Dein zukünftiges Ich wird dir danken.

Eduard Tymchenko
SEO Expert & Founder of AuditMe
“I built AuditMe after 10+ years of manual SEO audits — every check in this report is one I used to run by hand.”
Specializes in technical SEO, Core Web Vitals, and WordPress optimization.
Starte dein kostenloses SEO-Audit
Erhalte in 60 Sekunden eine vollständige SEO-Analyse beliebiger URLs. Keine Registrierung erforderlich.
Oder öffne das vollständige Analyse-Tool mit mehr Details
Deine Seite kostenlos analysierenKostenlose SEO-Tools
Verwandte Artikel
Lerne weiter mit diesen verwandten SEO-Anleitungen und Tutorials:
Your Website Was Seen 116,181 Times and Clicked 9 Times. Here's What Search Engines and AI Systems Are Actually Doing.
A first-party 2026 investigation from AuditMe into the Visibility Gap: how crawling, indexing, retrieval, ranking, AI citations, clicks, trust, and conversions form one measurable website intelligence system.
21 min read
How AI Systems Read the Web in 2026: Discovery, Retrieval, Citations and Agents
An evidence-first guide to AI search, GEO, retrieval, entity clarity, citations and agent-ready websites — with a practical framework, implementation patterns and a proposed open benchmark methodology.
45 min read
The New SEO: When Search Engines Stop Reading Websites and Start Using Them
Search is moving from ranking pages to running them as machine interfaces. This guide explains the six-dimension Website Intelligence framework — discoverability, understanding, verification, actionability, reliability, and observability — that makes your site machine-readable, verifiable, and actionable for AI search engines and agents.
23 min read
AI Readiness Guide: llms.txt, AI Bot Access & Semantic HTML for AI Search in 2026
Is your website ready for AI search? Complete guide to llms.txt, AI bot access, semantic HTML, and content architecture for ChatGPT, Claude, Perplexity, and Gemini in 2026.
24 min read
