Was ist Common Crawl?
Common Crawl ist ein frei zugängliches Archiv von Webseiten, das die gemeinnützige Common Crawl Foundation seit 2008 mit ihrem Crawler CCBot aufbaut und etwa einmal im Monat um einen neuen Crawl erweitert. Jeder Crawl enthält Rohdaten, Metadaten und extrahierten Text von rund zwei Milliarden Seiten und steht kostenlos zum Download bereit. Common Crawl ist damit eine der wichtigsten Quellen, aus denen große Sprachmodelle ihr Wissen über das Web beziehen.

Kurzprofil des Begriffs
| Merkmal | Angabe |
|---|---|
| Wortart | Eigenname (englisch), ohne Artikel gebraucht |
| Aussprache | ˈkɒmən ˈkrɔːl |
| Betreiber | Common Crawl Foundation, gemeinnützige Organisation nach US-Recht, gegründet 2007 |
| Crawler | CCBot, User-Agent CCBot/2.0 (https://commoncrawl.org/faq/) |
| Aktueller Crawl | CC-MAIN-2026-39: 2,17 Milliarden Seiten von 40,4 Millionen Hosts, erfasst vom 4. bis 17. September 2026 |
| Dateiformate | WARC (Rohdaten), WAT (Metadaten und Links), WET (reiner Text) |
| Verwandte Begriffe | CCBot, KI-Crawler, Trainingsdaten, robots.txt, Web Graph |
Wie funktioniert Common Crawl?
Common Crawl arbeitet in 4 Schritten: Der Crawler wählt Kandidaten aus, ruft die Seiten ab, archiviert sie in 3 Dateiformaten und veröffentlicht den fertigen Crawl als offenen Datensatz. Ein Crawl läuft rund zwei Wochen; der September-Crawl 2026 lief vom 4. bis 17. September.
- Kandidaten auswählen: Common Crawl berechnet aus seinem eigenen Linkgraphen für jede Domain die Harmonic Centrality. Der Wert misst, wie nah eine Domain über Links an allen anderen Domains liegt. Gut verlinkte Domains bekommen mehr Crawl-Budget und landen mit mehr Seiten im Archiv.
- Seiten abrufen: Der Crawler CCBot basiert auf Apache Nutch. Er liest zuerst die robots.txt einer Domain, folgt bis zu vier Weiterleitungen und nutzt die dort angegebene Sitemap. CCBot führt kein JavaScript aus und setzt keine Cookies.
- Archivieren: Jede abgerufene Seite landet als WARC-Datei mit vollständiger HTTP-Antwort, als WAT-Datei mit Metadaten und Links und als WET-Datei mit dem reinen Text. Dazu archiviert Common Crawl die robots.txt-Dateien und die Fehlerantworten jedes Crawls.
- Veröffentlichen: Der fertige Crawl liegt im öffentlichen Datenbestand von Amazon Web Services und unter data.commoncrawl.org. Der Zugriff ist kostenlos, ein URL-Index macht einzelne Seiten auffindbar.
Common Crawl erfasst eine Stichprobe des Webs. Die Foundation beschreibt ihren Datensatz selbst als zufällig ausgewählten Ausschnitt jeder Website. Für Website-Betreiber heißt das: Welche Seiten im Archiv landen, wechselt von Crawl zu Crawl.
Inhalte, die erst per JavaScript nachgeladen werden, fehlen im Archiv. Das ist dieselbe Hürde, die JavaScript-SEO für Suchmaschinen beschreibt; bei CCBot gibt es keinen Renderdienst, der sie später auflöst.
Welche Sprachmodelle nutzen Common Crawl?
Mindestens 30 von 47 großen Sprachmodellen, die zwischen 2019 und Oktober 2023 erschienen sind, wurden mit einer gefilterten Fassung von Common Crawl trainiert, das sind 64 Prozent. Das zeigt die Studie „Training Data for the Price of a Sandwich“ der Mozilla Foundation vom Februar 2024. Bei GPT-3 von OpenAI stammten mehr als 80 Prozent der Trainings-Tokens aus Common Crawl.
Ein Large Language Model verarbeitet Common Crawl in der Regel über eine aufbereitete Fassung. Die Rohdaten enthalten Menüs, Cookie-Hinweise, Dubletten und Spam; KI-Entwickler greifen deshalb auf gefilterte Datensätze zurück. Die 3 bekanntesten sind:
- C4 (Colossal Clean Crawled Corpus): Google hat C4 für das Sprachmodell T5 gebaut. Der Datensatz gehört zu den meistgenutzten Filterfassungen.
- Pile-CC: Pile-CC ist der Common-Crawl-Anteil im Datensatz „The Pile“ von EleutherAI.
- FineWeb: Hugging Face hat FineWeb aus zahlreichen Common-Crawl-Snapshots gefiltert und frei veröffentlicht.
Meta hat für die erste Llama-Generation gleich zwei Filterfassungen kombiniert. Die Filter entfernen vor allem Pornografie, Textbausteine und Dubletten. Die Auswahl der Seiten, die Common Crawl vorher getroffen hat, übernehmen sie unverändert: Inhalte aus englischsprachigen und gut verlinkten Domains sind überproportional vertreten.
Warum leben alte Inhalte über Common Crawl in KI-Antworten weiter?
Ein Sprachmodell kennt eine Website in dem Stand, den der Crawl zum Zeitpunkt des Trainings erfasst hat. Aktualisierst du eine Seite heute, ändert das nichts am Wissen eines Modells, das mit einem Crawl von 2024 trainiert wurde. Die alte Fassung steht im Archiv, in den daraus gebauten Filterdatensätzen und in jedem Modell, das damit trainiert wurde.
Drei Folgen sind für Website-Betreiber relevant:
- Veraltete Angaben bleiben abrufbar: Alte Preise, frühere Leistungen oder ein überholter Firmenname stehen in früheren Crawls weiter zur Verfügung und können in Modellantworten auftauchen.
- Neues braucht einen Trainingszyklus: Eine neue Seite erreicht das Modellwissen erst, wenn ein späterer Crawl sie erfasst und ein Anbieter damit neu trainiert.
- Aktualität kommt über die Live-Suche: Viele KI-Systeme gleichen ihr Trainingswissen per Retrieval Augmented Generation mit aktuellen Suchergebnissen ab. Dort zählt der heutige Stand deiner Seite.
Für eine Marke heißt das: Konsistente Angaben über Jahre zahlen sich doppelt aus. Wer Name, Leistung und Kernaussagen stabil hält, prägt das Trainingswissen und die Live-Antwort mit derselben Information. So wird das Unternehmen für Modelle zu einer klar erkennbaren Entität.
Wie prüfst du, ob deine Website in Common Crawl enthalten ist?
Ob deine Website in Common Crawl steht, zeigt der öffentliche URL-Index unter index.commoncrawl.org. Eine einzige Abfrage je Crawl liefert alle erfassten Adressen deiner Domain mit Statuscode und Dateityp:
https://index.commoncrawl.org/CC-MAIN-2026-39-index?url=deine-domain.de/*&output=json
Die Kennung CC-MAIN-2026-39 steht für den September-Crawl 2026; die Liste aller Crawls liefert index.commoncrawl.org/collinfo.json. Der Index ist stark gedrosselt. Stell deine Abfragen nacheinander und mit Pause, sonst sperrt der Server deine IP-Adresse für 24 Stunden.
Für taismo.de haben wir das am 24. September 2026 nachgesehen. Der August-Crawl CC-MAIN-2026-34 enthält 213 abrufbare Seiten der Domain, der September-Crawl CC-MAIN-2026-39 nur 69. Beide Crawls teilen sich gerade 7 URLs, bei rund 450 Adressen in der Sitemap. Die Messung bestätigt das Stichprobenprinzip: Jeder Crawl zeigt einen anderen Ausschnitt derselben Website.
Wie steuerst du CCBot über die robots.txt?
CCBot hält sich an die robots.txt und reagiert auf den User-Agent CCBot. Mit zwei Zeilen sperrst du den Crawler für die ganze Website:
User-agent: CCBot
Disallow: /
Soll CCBot weiter crawlen, aber langsamer, genügt ein Crawl-delay in Sekunden. CCBot beachtet diese Angabe ausdrücklich, Googlebot ignoriert sie:
User-agent: CCBot
Crawl-delay: 2
Vier Punkte gehören zur Steuerung dazu:
- Die Sperre wirkt nach vorn: Sie verhindert künftige Abrufe. Frühere Crawls mit deinen Seiten bleiben veröffentlicht, ebenso die daraus gebauten Datensätze.
- Falsche CCBots gibt es: Common Crawl warnt selbst vor Crawlern, die sich als CCBot ausgeben. Echte Abrufe kommen aus festen IP-Bereichen, die unter
index.commoncrawl.org/ccbot.jsonstehen, und lösen per Reverse DNS aufcrawl.commoncrawl.orgauf. - Die Sitemap hilft beim Zulassen: CCBot liest jede Sitemap, die in der robots.txt angegeben ist. Eine gepflegte Sitemap erhöht die Chance, dass die wichtigen Seiten erfasst werden.
- Google bleibt unberührt: Eine CCBot-Sperre betrifft ausschließlich Common Crawl. Googlebot und die Rankings in der Google-Suche ändern sich dadurch nicht.
CCBot ist einer von vielen Bots, die Inhalte für KI-Systeme sammeln. Wie sich die anderen unterscheiden und welche davon Trainingsdaten und welche Live-Antworten bedienen, erklärt der Beitrag zu KI-Crawlern.
Solltest du CCBot sperren oder zulassen?
Für Unternehmen, die in KI-Antworten genannt werden wollen, ist das Zulassen von CCBot in den meisten Fällen die bessere Wahl. Eine Sperre nimmt die Website aus den künftigen Trainingsdaten vieler offener und kommerzieller Modelle. Sprachmodelle lernen die Marke, ihre Leistungen und ihre Fachbegriffe dann nur noch aus fremden Quellen kennen.
| Ziel | Empfehlung | Begründung |
|---|---|---|
| Sichtbar in KI-Antworten werden | CCBot zulassen | Die eigenen Inhalte fließen in künftige Trainingsdaten ein und prägen, was Modelle über die Marke wissen |
| Bezahlte oder exklusive Inhalte schützen | CCBot sperren | Das Archiv ist frei zugänglich, jeder kann die Texte herunterladen und weiterverwenden |
| Serverlast begrenzen | Crawl-delay setzen | CCBot bleibt aktiv und ruft Seiten in größerem Abstand ab |
Große Verlage wie die New York Times sperren CCBot bereits für ihre Inhalte. Für einen Mittelständler mit erklärungsbedürftiger Leistung wirkt dieselbe Sperre anders: Sie macht das Unternehmen für Modelle unsichtbarer, ohne ein Geschäftsmodell zu schützen. taismo.de lässt CCBot deshalb zu.
Wer zugelassen ist, kann seine Präsenz im Archiv beeinflussen. Da Common Crawl nach Harmonic Centrality priorisiert, erhöhen Backlinks von gut vernetzten Websites die Chance, dass mehr Seiten einer Domain erfasst werden. Eine klare Einstiegskarte für Sprachmodelle ergänzt die llms.txt. Wie diese Hebel zusammenwirken, beschreibt unsere Seite zu GEO und KI-Sichtbarkeit.
Häufige Fragen zu Common Crawl
Ist Common Crawl dasselbe wie das Internet Archive?
Common Crawl und das Internet Archive sind zwei getrennte gemeinnützige Projekte. Die Wayback Machine des Internet Archive zeigt Menschen frühere Fassungen einzelner Seiten im Browser, Common Crawl liefert Massendaten für Forschung und Datenanalyse.
Kostet die Nutzung von Common Crawl etwas?
Die Daten von Common Crawl sind kostenlos. Die Foundation stellt sie über den öffentlichen Datenbestand von Amazon Web Services und über data.commoncrawl.org bereit; Kosten entstehen höchstens für eigene Rechen- und Speicherkapazität.
Schadet eine CCBot-Sperre meinem Google-Ranking?
Eine CCBot-Sperre hat keinen Einfluss auf das Google-Ranking. Google crawlt mit dem eigenen Googlebot und nutzt Common Crawl nicht als Quelle für die Suche.
Welt der SEO lernen?