Modul 05

Crawling und Indexierung

Kurz erklärt

Crawling bedeutet, dass ein System eine URL abruft; Indexierung bedeutet, dass der Inhalt verarbeitet und möglicherweise in einen Suchindex aufgenommen wird. Statuscode, robots.txt, noindex, Canonical, interne Links und Sitemap müssen zusammenpassen, damit eine Seite zuverlässig auffindbar werden kann.

75–90 Min. inkl. AufgabeTechnik

Der beste Text bleibt unsichtbar, wenn Systeme ihn nicht zuverlässig erreichen oder nicht als maßgebliche Version erkennen können.

Substanziell menschlich geprüft · Stand:

Der technische Mindeststandard

  • Die Seite liefert einen erfolgreichen HTTP-Status und funktioniert ohne Anmeldung.
  • Wichtiger Text ist im ausgelieferten HTML oder zuverlässig gerendert verfügbar.
  • Kein unbeabsichtigtes noindex und keine widersprüchliche Canonical-Angabe.
  • Interne Links führen mit verständlichen Linktexten zur Seite.
  • Die kanonische URL steht in einer aktuellen XML-Sitemap.
  • Mobile Darstellung, Ladezeit und Barrierefreiheit sind brauchbar.

Crawler bewusst steuern

robots.txt steuert den Abruf, ist aber kein zuverlässiges Mittel, eine URL aus Suchergebnissen zu entfernen. Dafür ist gewöhnlich ein erreichbares noindex nötig. Wer eine Seite blockiert, kann zugleich verhindern, dass Systeme ein vorhandenes noindex lesen.

User-AgentZweckFolge einer Sperre
GPTBotmögliches ModelltrainingTraining wird begrenzt; ChatGPT-Suche wird dadurch nicht gesteuert.
OAI-SearchBotChatGPT-SucheInhalte können nicht als Zusammenfassung oder Snippet in ChatGPT Search aufgenommen werden.
ClaudeBotmögliches ModelltrainingKünftige Inhalte sollen nicht in Trainingsdatensätze einfließen.
Claude-SearchBotClaude-SucheSichtbarkeit und Aktualität in Claude-Suchergebnissen können sinken.
PerplexityBotPerplexity-SucheEine Anzeige und Verlinkung in Perplexity wird unwahrscheinlicher.
Google-ExtendedTraining und Grounding bestimmter Google-KI-SystemeKein Einfluss auf Google Search, AI Overviews oder AI Mode.

Praxisbeispiel: veröffentlicht, aber nicht auffindbar

Beispiel 1 · Neuer Ratgeber

Die Seite ist online – trotzdem findet sie kein Crawler zuverlässig

Ein Ratgeber unter /ratgeber/altbau-daemmen.html liefert Status 200. Er ist aber in keinem Menü verlinkt, fehlt in der Sitemap und enthält versehentlich noindex. Die URL existiert technisch, ist aber kein sinnvoller Kandidat für Suchergebnisse.

  1. noindex entfernen, wenn die Seite öffentlich auffindbar sein soll.
  2. Von einer thematisch passenden Übersichtsseite mit verständlichem Linktext verlinken.
  3. Die kanonische URL in die Sitemap aufnehmen und lastmod nur bei echter Änderung aktualisieren.
  4. Nach dem Upload mit URL-Prüfung und Webmaster-Werkzeugen kontrollieren.
Beispiel 2 · doppelte Versionen: HTML-Seite, Druckansicht und PDF enthalten denselben Text. Interne Links zeigen abwechselnd auf alle drei Versionen. Eine klare Hauptversion, konsistente Links und passende Canonicals verhindern widersprüchliche Signale.

Was du tatsächlich steuern kannst

Für Googles generative Suchfunktionen muss eine Seite indexiert und für Snippets zugelassen sein. nosnippet, max-snippet:0 oder großflächiges data-nosnippet können eine Verwendung verhindern. Dieser Wissenspfad setzt bewusst max-snippet:-1.

Zusätzlich wird in der Search Console eine Steuerung ausgerollt, mit der eine Property aus AI Overviews, AI Mode und generativen Discover-Funktionen ausgeschlossen werden kann. Die Standardeinstellung ist Teilnahme. Der Schalter kann ausschließen, aber keine Anzeige erzwingen.

User-agent: OAI-SearchBot
Allow: /ki-suche-lernpfad/

User-agent: GPTBot
Disallow: /

Dieses Beispiel erlaubt ChatGPT Search, schließt aber potenzielles Training durch GPTBot aus. Es muss mit vorhandenen Regeln, Firewall und CDN abgestimmt werden.

Änderungen melden und prüfen

XML-Sitemaps helfen bei der Entdeckung. Bing und weitere teilnehmende Suchmaschinen unterstützen außerdem IndexNow, um neue, geänderte oder entfernte URLs zeitnah zu melden. Google nimmt an IndexNow nicht teil.

  1. URL veröffentlichen und intern verlinken.
  2. Sitemap mit korrektem lastmod aktualisieren – nur bei echter Inhaltsänderung und nicht pauschal für alle Seiten.
  3. URL-Inspektion in den Webmaster-Werkzeugen verwenden.
  4. Serverprotokolle und Indexstatus nach einigen Tagen kontrollieren.

Offizielle Grundlagen dieses Moduls

Arbeitsauftrag

Jetzt anwenden

Prüfe eine wichtige URL: Statuscode, robots-Regeln, noindex, Canonical, interne Links und Sitemap. Halte Ergebnis, Prüftag und notwendige Änderung in einer Tabelle fest.

Kurztest

Was regelt robots.txt in erster Linie?