Crawling und Indexierung
Kurz erklärt
Crawling bedeutet, dass ein System eine URL abruft; Indexierung bedeutet, dass der Inhalt verarbeitet und möglicherweise in einen Suchindex aufgenommen wird. Statuscode, robots.txt, noindex, Canonical, interne Links und Sitemap müssen zusammenpassen, damit eine Seite zuverlässig auffindbar werden kann.
Der beste Text bleibt unsichtbar, wenn Systeme ihn nicht zuverlässig erreichen oder nicht als maßgebliche Version erkennen können.
Substanziell menschlich geprüft · Stand:
Der technische Mindeststandard
- Die Seite liefert einen erfolgreichen HTTP-Status und funktioniert ohne Anmeldung.
- Wichtiger Text ist im ausgelieferten HTML oder zuverlässig gerendert verfügbar.
- Kein unbeabsichtigtes
noindexund keine widersprüchliche Canonical-Angabe. - Interne Links führen mit verständlichen Linktexten zur Seite.
- Die kanonische URL steht in einer aktuellen XML-Sitemap.
- Mobile Darstellung, Ladezeit und Barrierefreiheit sind brauchbar.
Crawler bewusst steuern
robots.txt steuert den Abruf, ist aber kein zuverlässiges Mittel, eine URL aus Suchergebnissen zu entfernen. Dafür ist gewöhnlich ein erreichbares noindex nötig. Wer eine Seite blockiert, kann zugleich verhindern, dass Systeme ein vorhandenes noindex lesen.
| User-Agent | Zweck | Folge einer Sperre |
|---|---|---|
GPTBot | mögliches Modelltraining | Training wird begrenzt; ChatGPT-Suche wird dadurch nicht gesteuert. |
OAI-SearchBot | ChatGPT-Suche | Inhalte können nicht als Zusammenfassung oder Snippet in ChatGPT Search aufgenommen werden. |
ClaudeBot | mögliches Modelltraining | Künftige Inhalte sollen nicht in Trainingsdatensätze einfließen. |
Claude-SearchBot | Claude-Suche | Sichtbarkeit und Aktualität in Claude-Suchergebnissen können sinken. |
PerplexityBot | Perplexity-Suche | Eine Anzeige und Verlinkung in Perplexity wird unwahrscheinlicher. |
Google-Extended | Training und Grounding bestimmter Google-KI-Systeme | Kein Einfluss auf Google Search, AI Overviews oder AI Mode. |
Praxisbeispiel: veröffentlicht, aber nicht auffindbar
Die Seite ist online – trotzdem findet sie kein Crawler zuverlässig
Ein Ratgeber unter /ratgeber/altbau-daemmen.html liefert Status 200. Er ist aber in keinem Menü verlinkt, fehlt in der Sitemap und enthält versehentlich noindex. Die URL existiert technisch, ist aber kein sinnvoller Kandidat für Suchergebnisse.
noindexentfernen, wenn die Seite öffentlich auffindbar sein soll.- Von einer thematisch passenden Übersichtsseite mit verständlichem Linktext verlinken.
- Die kanonische URL in die Sitemap aufnehmen und
lastmodnur bei echter Änderung aktualisieren. - Nach dem Upload mit URL-Prüfung und Webmaster-Werkzeugen kontrollieren.
Was du tatsächlich steuern kannst
Für Googles generative Suchfunktionen muss eine Seite indexiert und für Snippets zugelassen sein. nosnippet, max-snippet:0 oder großflächiges data-nosnippet können eine Verwendung verhindern. Dieser Wissenspfad setzt bewusst max-snippet:-1.
Zusätzlich wird in der Search Console eine Steuerung ausgerollt, mit der eine Property aus AI Overviews, AI Mode und generativen Discover-Funktionen ausgeschlossen werden kann. Die Standardeinstellung ist Teilnahme. Der Schalter kann ausschließen, aber keine Anzeige erzwingen.
User-agent: OAI-SearchBot
Allow: /ki-suche-lernpfad/
User-agent: GPTBot
Disallow: /
Dieses Beispiel erlaubt ChatGPT Search, schließt aber potenzielles Training durch GPTBot aus. Es muss mit vorhandenen Regeln, Firewall und CDN abgestimmt werden.
Änderungen melden und prüfen
XML-Sitemaps helfen bei der Entdeckung. Bing und weitere teilnehmende Suchmaschinen unterstützen außerdem IndexNow, um neue, geänderte oder entfernte URLs zeitnah zu melden. Google nimmt an IndexNow nicht teil.
- URL veröffentlichen und intern verlinken.
- Sitemap mit korrektem
lastmodaktualisieren – nur bei echter Inhaltsänderung und nicht pauschal für alle Seiten. - URL-Inspektion in den Webmaster-Werkzeugen verwenden.
- Serverprotokolle und Indexstatus nach einigen Tagen kontrollieren.
Offizielle Grundlagen dieses Moduls
Jetzt anwenden
Prüfe eine wichtige URL: Statuscode, robots-Regeln, noindex, Canonical, interne Links und Sitemap. Halte Ergebnis, Prüftag und notwendige Änderung in einer Tabelle fest.
