Zum Hauptinhalt springen

Was ist Common Crawl?

Common Crawl ist ein frei zugängliches Archiv von Webseiten, das die gemeinnützige Common Crawl Foundation seit 2008 mit ihrem Crawler CCBot aufbaut und etwa einmal im Monat um einen neuen Crawl erweitert. Jeder Crawl enthält Rohdaten, Metadaten und extrahierten Text von rund zwei Milliarden Seiten und steht kostenlos zum Download bereit. Common Crawl ist damit eine der wichtigsten Quellen, aus denen große Sprachmodelle ihr Wissen über das Web beziehen.

Common Crawl erklärt: Das offene Webarchiv und der Crawler CCBot als Datenquelle für Sprachmodelle, taismo SEO-Wiki

Kurzprofil des Begriffs

Merkmal Angabe
Wortart Eigenname (englisch), ohne Artikel gebraucht
Aussprache ˈkɒmən ˈkrɔːl
Betreiber Common Crawl Foundation, gemeinnützige Organisation nach US-Recht, gegründet 2007
Crawler CCBot, User-Agent CCBot/2.0 (https://commoncrawl.org/faq/)
Aktueller Crawl CC-MAIN-2026-39: 2,17 Milliarden Seiten von 40,4 Millionen Hosts, erfasst vom 4. bis 17. September 2026
Dateiformate WARC (Rohdaten), WAT (Metadaten und Links), WET (reiner Text)
Verwandte Begriffe CCBot, KI-Crawler, Trainingsdaten, robots.txt, Web Graph

Wie funktioniert Common Crawl?

Common Crawl arbeitet in 4 Schritten: Der Crawler wählt Kandidaten aus, ruft die Seiten ab, archiviert sie in 3 Dateiformaten und veröffentlicht den fertigen Crawl als offenen Datensatz. Ein Crawl läuft rund zwei Wochen; der September-Crawl 2026 lief vom 4. bis 17. September.

  1. Kandidaten auswählen: Common Crawl berechnet aus seinem eigenen Linkgraphen für jede Domain die Harmonic Centrality. Der Wert misst, wie nah eine Domain über Links an allen anderen Domains liegt. Gut verlinkte Domains bekommen mehr Crawl-Budget und landen mit mehr Seiten im Archiv.
  2. Seiten abrufen: Der Crawler CCBot basiert auf Apache Nutch. Er liest zuerst die robots.txt einer Domain, folgt bis zu vier Weiterleitungen und nutzt die dort angegebene Sitemap. CCBot führt kein JavaScript aus und setzt keine Cookies.
  3. Archivieren: Jede abgerufene Seite landet als WARC-Datei mit vollständiger HTTP-Antwort, als WAT-Datei mit Metadaten und Links und als WET-Datei mit dem reinen Text. Dazu archiviert Common Crawl die robots.txt-Dateien und die Fehlerantworten jedes Crawls.
  4. Veröffentlichen: Der fertige Crawl liegt im öffentlichen Datenbestand von Amazon Web Services und unter data.commoncrawl.org. Der Zugriff ist kostenlos, ein URL-Index macht einzelne Seiten auffindbar.

Common Crawl erfasst eine Stichprobe des Webs. Die Foundation beschreibt ihren Datensatz selbst als zufällig ausgewählten Ausschnitt jeder Website. Für Website-Betreiber heißt das: Welche Seiten im Archiv landen, wechselt von Crawl zu Crawl.

Inhalte, die erst per JavaScript nachgeladen werden, fehlen im Archiv. Das ist dieselbe Hürde, die JavaScript-SEO für Suchmaschinen beschreibt; bei CCBot gibt es keinen Renderdienst, der sie später auflöst.

Der Weg einer Webseite über Common Crawl in ein SprachmodellFünf Kästen in einer Reihe zeigen den Datenweg: Websites, der Crawler CCBot, das Common-Crawl-Archiv mit den Formaten WARC, WAT und WET, gefilterte Datensätze wie C4, Pile-CC und FineWeb und schließlich das Training eines Sprachmodells. Der Kasten CCBot ist orange hervorgehoben, weil nur an dieser Stelle die robots.txt eines Website-Betreibers wirkt, und zwar ausschließlich auf künftige Crawls.Von der Website ins SprachmodellWebsites40,4 Mio. Hostsim Crawl 2026-39CCBotprüft robots.txt,kein JavaScriptArchivWARC · WAT · WET2,17 Mrd. SeitenFilterdatensätzeC4 · Pile-CCFineWebSprachmodellTraining aufdem SnapshotDeine robots.txt wirkt nur beim Abruf durch CCBot.Frühere Crawls und die daraus gebauten Datensätze bleiben bestehen.Abb. 1 · taismo
Abb. 1: Der Weg einer Webseite über Common Crawl in ein Sprachmodell. Die robots.txt wirkt nur beim Abruf durch CCBot und nur auf künftige Crawls.

Welche Sprachmodelle nutzen Common Crawl?

Mindestens 30 von 47 großen Sprachmodellen, die zwischen 2019 und Oktober 2023 erschienen sind, wurden mit einer gefilterten Fassung von Common Crawl trainiert, das sind 64 Prozent. Das zeigt die Studie „Training Data for the Price of a Sandwich“ der Mozilla Foundation vom Februar 2024. Bei GPT-3 von OpenAI stammten mehr als 80 Prozent der Trainings-Tokens aus Common Crawl.

Ein Large Language Model verarbeitet Common Crawl in der Regel über eine aufbereitete Fassung. Die Rohdaten enthalten Menüs, Cookie-Hinweise, Dubletten und Spam; KI-Entwickler greifen deshalb auf gefilterte Datensätze zurück. Die 3 bekanntesten sind:

  • C4 (Colossal Clean Crawled Corpus): Google hat C4 für das Sprachmodell T5 gebaut. Der Datensatz gehört zu den meistgenutzten Filterfassungen.
  • Pile-CC: Pile-CC ist der Common-Crawl-Anteil im Datensatz „The Pile“ von EleutherAI.
  • FineWeb: Hugging Face hat FineWeb aus zahlreichen Common-Crawl-Snapshots gefiltert und frei veröffentlicht.

Meta hat für die erste Llama-Generation gleich zwei Filterfassungen kombiniert. Die Filter entfernen vor allem Pornografie, Textbausteine und Dubletten. Die Auswahl der Seiten, die Common Crawl vorher getroffen hat, übernehmen sie unverändert: Inhalte aus englischsprachigen und gut verlinkten Domains sind überproportional vertreten.

Warum leben alte Inhalte über Common Crawl in KI-Antworten weiter?

Ein Sprachmodell kennt eine Website in dem Stand, den der Crawl zum Zeitpunkt des Trainings erfasst hat. Aktualisierst du eine Seite heute, ändert das nichts am Wissen eines Modells, das mit einem Crawl von 2024 trainiert wurde. Die alte Fassung steht im Archiv, in den daraus gebauten Filterdatensätzen und in jedem Modell, das damit trainiert wurde.

Drei Folgen sind für Website-Betreiber relevant:

  1. Veraltete Angaben bleiben abrufbar: Alte Preise, frühere Leistungen oder ein überholter Firmenname stehen in früheren Crawls weiter zur Verfügung und können in Modellantworten auftauchen.
  2. Neues braucht einen Trainingszyklus: Eine neue Seite erreicht das Modellwissen erst, wenn ein späterer Crawl sie erfasst und ein Anbieter damit neu trainiert.
  3. Aktualität kommt über die Live-Suche: Viele KI-Systeme gleichen ihr Trainingswissen per Retrieval Augmented Generation mit aktuellen Suchergebnissen ab. Dort zählt der heutige Stand deiner Seite.

Für eine Marke heißt das: Konsistente Angaben über Jahre zahlen sich doppelt aus. Wer Name, Leistung und Kernaussagen stabil hält, prägt das Trainingswissen und die Live-Antwort mit derselben Information. So wird das Unternehmen für Modelle zu einer klar erkennbaren Entität.

Wie prüfst du, ob deine Website in Common Crawl enthalten ist?

Ob deine Website in Common Crawl steht, zeigt der öffentliche URL-Index unter index.commoncrawl.org. Eine einzige Abfrage je Crawl liefert alle erfassten Adressen deiner Domain mit Statuscode und Dateityp:

https://index.commoncrawl.org/CC-MAIN-2026-39-index?url=deine-domain.de/*&output=json

Die Kennung CC-MAIN-2026-39 steht für den September-Crawl 2026; die Liste aller Crawls liefert index.commoncrawl.org/collinfo.json. Der Index ist stark gedrosselt. Stell deine Abfragen nacheinander und mit Pause, sonst sperrt der Server deine IP-Adresse für 24 Stunden.

Für taismo.de haben wir das am 24. September 2026 nachgesehen. Der August-Crawl CC-MAIN-2026-34 enthält 213 abrufbare Seiten der Domain, der September-Crawl CC-MAIN-2026-39 nur 69. Beide Crawls teilen sich gerade 7 URLs, bei rund 450 Adressen in der Sitemap. Die Messung bestätigt das Stichprobenprinzip: Jeder Crawl zeigt einen anderen Ausschnitt derselben Website.

Wie steuerst du CCBot über die robots.txt?

CCBot hält sich an die robots.txt und reagiert auf den User-Agent CCBot. Mit zwei Zeilen sperrst du den Crawler für die ganze Website:

User-agent: CCBot
Disallow: /

Soll CCBot weiter crawlen, aber langsamer, genügt ein Crawl-delay in Sekunden. CCBot beachtet diese Angabe ausdrücklich, Googlebot ignoriert sie:

User-agent: CCBot
Crawl-delay: 2

Vier Punkte gehören zur Steuerung dazu:

  • Die Sperre wirkt nach vorn: Sie verhindert künftige Abrufe. Frühere Crawls mit deinen Seiten bleiben veröffentlicht, ebenso die daraus gebauten Datensätze.
  • Falsche CCBots gibt es: Common Crawl warnt selbst vor Crawlern, die sich als CCBot ausgeben. Echte Abrufe kommen aus festen IP-Bereichen, die unter index.commoncrawl.org/ccbot.json stehen, und lösen per Reverse DNS auf crawl.commoncrawl.org auf.
  • Die Sitemap hilft beim Zulassen: CCBot liest jede Sitemap, die in der robots.txt angegeben ist. Eine gepflegte Sitemap erhöht die Chance, dass die wichtigen Seiten erfasst werden.
  • Google bleibt unberührt: Eine CCBot-Sperre betrifft ausschließlich Common Crawl. Googlebot und die Rankings in der Google-Suche ändern sich dadurch nicht.

CCBot ist einer von vielen Bots, die Inhalte für KI-Systeme sammeln. Wie sich die anderen unterscheiden und welche davon Trainingsdaten und welche Live-Antworten bedienen, erklärt der Beitrag zu KI-Crawlern.

Solltest du CCBot sperren oder zulassen?

Für Unternehmen, die in KI-Antworten genannt werden wollen, ist das Zulassen von CCBot in den meisten Fällen die bessere Wahl. Eine Sperre nimmt die Website aus den künftigen Trainingsdaten vieler offener und kommerzieller Modelle. Sprachmodelle lernen die Marke, ihre Leistungen und ihre Fachbegriffe dann nur noch aus fremden Quellen kennen.

Ziel Empfehlung Begründung
Sichtbar in KI-Antworten werden CCBot zulassen Die eigenen Inhalte fließen in künftige Trainingsdaten ein und prägen, was Modelle über die Marke wissen
Bezahlte oder exklusive Inhalte schützen CCBot sperren Das Archiv ist frei zugänglich, jeder kann die Texte herunterladen und weiterverwenden
Serverlast begrenzen Crawl-delay setzen CCBot bleibt aktiv und ruft Seiten in größerem Abstand ab

Große Verlage wie die New York Times sperren CCBot bereits für ihre Inhalte. Für einen Mittelständler mit erklärungsbedürftiger Leistung wirkt dieselbe Sperre anders: Sie macht das Unternehmen für Modelle unsichtbarer, ohne ein Geschäftsmodell zu schützen. taismo.de lässt CCBot deshalb zu.

Wer zugelassen ist, kann seine Präsenz im Archiv beeinflussen. Da Common Crawl nach Harmonic Centrality priorisiert, erhöhen Backlinks von gut vernetzten Websites die Chance, dass mehr Seiten einer Domain erfasst werden. Eine klare Einstiegskarte für Sprachmodelle ergänzt die llms.txt. Wie diese Hebel zusammenwirken, beschreibt unsere Seite zu GEO und KI-Sichtbarkeit.

Häufige Fragen zu Common Crawl

Ist Common Crawl dasselbe wie das Internet Archive?
Common Crawl und das Internet Archive sind zwei getrennte gemeinnützige Projekte. Die Wayback Machine des Internet Archive zeigt Menschen frühere Fassungen einzelner Seiten im Browser, Common Crawl liefert Massendaten für Forschung und Datenanalyse.

Kostet die Nutzung von Common Crawl etwas?
Die Daten von Common Crawl sind kostenlos. Die Foundation stellt sie über den öffentlichen Datenbestand von Amazon Web Services und über data.commoncrawl.org bereit; Kosten entstehen höchstens für eigene Rechen- und Speicherkapazität.

Schadet eine CCBot-Sperre meinem Google-Ranking?
Eine CCBot-Sperre hat keinen Einfluss auf das Google-Ranking. Google crawlt mit dem eigenen Googlebot und nutzt Common Crawl nicht als Quelle für die Suche.

0%
Erfahre Insiderwissen als Erster!
taismo Logo

© taismo GmbH

Adresse


Weißenfelder Str. 6
85551 Kirchheim bei München

Links