Was sind Trainingsdaten?
Trainingsdaten sind die Datensätze, aus denen ein KI-Modell beim Training Sprache, Muster und Faktenwissen lernt. Bei großen Sprachmodellen bestehen die Trainingsdaten überwiegend aus öffentlich zugänglichen Webtexten, Büchern, Code und lizenzierten Quellen. Was in den Trainingsdaten steht, ist nach dem Training fest in den Modellgewichten gespeichert und endet an einem Stichtag; aktuellere Inhalte holt ein Modell erst zur Laufzeit per Retrieval dazu.

Kurzprofil des Begriffs
| Merkmal | Angabe |
|---|---|
| Wortart | Substantiv, Plural (die Trainingsdaten) |
| Silbentrennung | Trai·nings·da·ten |
| Englische Entsprechung | training data |
| Verwandte Begriffe | Validierungsdaten, Testdaten, Pretraining, Fine-Tuning, Wissensstichtag, Retrieval |
| Fachgebiet | Maschinelles Lernen, KI-Suche, GEO |
Welche Arten von Trainingsdaten gibt es?
Das maschinelle Lernen teilt Daten in 3 Datensätze auf: Trainingsdaten, Validierungsdaten und Testdaten. Ein verbreiteter Schnitt ist 80 Prozent Training, 10 Prozent Validierung und 10 Prozent Test.
- Trainingsdaten: Mit ihnen passt das Modell seine Parameter an. Das Modell sieht diese Beispiele während des Trainings immer wieder.
- Validierungsdaten: Sie dienen der Feinabstimmung während der Entwicklung, etwa bei der Wahl von Lernrate oder Modellgröße.
- Testdaten: Sie bleiben bis zum Schluss unberührt und zeigen, wie gut das Modell mit Beispielen umgeht, die es nie gesehen hat.
Bei einem Large Language Model kommt eine zweite Einteilung hinzu. Sprachmodelle durchlaufen 3 Trainingsphasen mit jeweils eigenen Trainingsdaten:
- Pretraining: Das Modell liest Rohtext im Umfang von Billionen Tokens und lernt daraus Sprache und Weltwissen. Meta nennt für Llama 3 mehr als 15 Billionen Tokens.
- Fine-Tuning: Kuratierte Frage-Antwort-Paare bringen dem Modell bei, Anweisungen zu befolgen und im Dialog zu antworten.
- Präferenzdaten: Menschen bewerten mehrere Antworten auf denselben Prompt. Aus diesen Bewertungen lernt das Modell, welche Antwort als hilfreich gilt (Reinforcement Learning from Human Feedback, kurz RLHF).
Für die Sichtbarkeit einer Website zählt fast ausschließlich die erste Phase. Im Pretraining landen Webtexte, und dort entscheidet sich, welche Marken, Begriffe und Zusammenhänge ein Modell ohne jede Suche kennt.
Woher stammen die Trainingsdaten großer Sprachmodelle?
Die Trainingsdaten großer Sprachmodelle stammen zum größten Teil aus dem öffentlichen Web, ergänzt um Bücher, Wikipedia, Quellcode und lizenzierte Inhalte. Die wichtigste Einzelquelle ist Common Crawl, ein gemeinnütziges Archiv, das seit 2008 regelmäßig Milliarden Webseiten abruft und frei zur Verfügung stellt.
Wie die Mischung aussieht, hat OpenAI zuletzt für GPT-3 offengelegt (Brown et al., 2020). Neuere Modelle nennen ihre Quellen meist nur noch in groben Kategorien.
| Datensatz | Umfang | Anteil am Trainingsmix |
|---|---|---|
| Common Crawl (gefiltert) | 410 Mrd. Tokens | 60 % |
| WebText2 | 19 Mrd. Tokens | 22 % |
| Books1 | 12 Mrd. Tokens | 8 % |
| Books2 | 55 Mrd. Tokens | 8 % |
| Wikipedia | 3 Mrd. Tokens | 3 % |
Die Tabelle zeigt zweierlei. Webtexte stellen den größten Anteil, und kleine, hochwertige Quellen wie WebText2 und Wikipedia gehen mit mehr Gewicht ins Training ein, als ihr Umfang vermuten lässt. Ein Modell kennt deshalb gut belegte, oft zitierte Fakten deutlich sicherer als Aussagen, die nur auf einer einzelnen Seite stehen.
Jeder Datensatz endet an einem festen Tag, dem Wissensstichtag (englisch knowledge cutoff). Alles, was danach veröffentlicht wurde, fehlt dem Modell. Der Wissensstichtag liegt in der Regel mehrere Monate vor dem Erscheinen des Modells, weil Filterung, Training und Tests Zeit brauchen.
Was ist der Unterschied zwischen Trainingsdaten und Retrieval?
Trainingsdaten prägen das Wissen eines Modells dauerhaft vor dem Start, Retrieval liefert aktuelle Quellen erst in dem Moment, in dem eine Frage gestellt wird. Die beiden Wege unterscheiden sich in Zeitpunkt, Aktualität, Quellenangabe und darin, wie schnell eine Änderung auf deiner Website in KI-Antworten ankommt.
| Merkmal | Trainingsdaten | Retrieval |
|---|---|---|
| Zeitpunkt | vor dem Start des Modells | bei jeder einzelnen Anfrage |
| Aktualität | endet am Wissensstichtag | so aktuell wie der Suchindex |
| Quellenangabe | keine, das Wissen ist im Modell verschmolzen | Links auf die abgerufenen Seiten |
| Wirkung einer Änderung | erst mit der nächsten Modellgeneration | nach dem nächsten Abruf, oft binnen Tagen |
| Zuständige Crawler | Trainings-Crawler wie GPTBot oder ClaudeBot | Such-Crawler wie OAI-SearchBot oder Googlebot |
Das Verfahren hinter dem zweiten Weg heißt Retrieval Augmented Generation. Das System sucht passende Dokumente, oft über eine semantische Suche mit Embeddings, und das Modell formuliert die Antwort auf dieser Grundlage. Google zerlegt eine Frage dabei zusätzlich per Query Fan-Out in viele Teilsuchen, bevor die AI Overviews entstehen.
In der Praxis wirken beide Wege zusammen. Das Modell erkennt mit dem Wissen aus den Trainingsdaten, welche Begriffe und Anbieter zu einer Frage gehören, und prüft sie per Retrieval gegen aktuelle Quellen. Eine Marke, die das Modell aus dem Training kennt, wird bei der Auswahl der Quellen eher erkannt und richtig eingeordnet.
Wie kommen deine Inhalte in Trainingsdaten und KI-Antworten?
Deine Inhalte gelangen in Trainingsdaten, wenn Trainings-Crawler sie abrufen dürfen und sie im Web oft genug in gleicher Form wiederkehren. In KI-Antworten per Retrieval kommen sie, wenn Such-Crawler sie erreichen und die Seite eine Frage direkt und zitierfähig beantwortet.
Die großen Anbieter trennen ihre Crawler nach Zweck. Deine robots.txt kann jeden davon einzeln zulassen oder sperren:
| Anbieter | Crawler für Trainingsdaten | Crawler für Suche und Abruf |
|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot, ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot, Claude-User |
| Google-Extended (Token für Gemini) | Googlebot |
Wer GPTBot sperrt, verschwindet aus künftigen Trainingsdaten von OpenAI und bleibt über OAI-SearchBot trotzdem in der Suche von ChatGPT auffindbar. Google-Extended wirkt nur auf die Nutzung für Gemini und hat laut Google keinen Einfluss auf die Google-Suche. Einen Überblick über alle Bots gibt der Beitrag zu KI-Crawlern.
Offene Crawler sind die Voraussetzung. Ob ein Modell deine Marke danach wirklich kennt, entscheiden 4 Faktoren:
- Wiederholung: Fakten, die auf vielen unabhängigen Seiten gleich lauten, prägen sich im Training ein. Dazu zählen auch Brand Mentions ohne Link.
- Konsistenz: Nennt deine Website drei verschiedene Gründungsjahre, lernt das Modell keines davon sicher.
- Eindeutigkeit: Eine Marke, die als Entität klar beschrieben ist, lässt sich von Namensvettern trennen.
- Zitierfähigkeit: Kurze, eigenständige Definitionen und Zahlen übernimmt ein Modell eher als lange Herleitungen. Eine Grounding Page bündelt solche Fakten an einer Stelle.
Für den Abruf hilft zusätzlich eine llms.txt, die KI-Systemen die wichtigsten Seiten deiner Website auflistet. An genau diesen zwei Wegen setzt die Arbeit einer KI SEO Agentur an: Deine Marke soll im Modellwissen verankert sein und bei aktuellen Fragen als Quelle abgerufen werden.
Welche Regeln gelten für KI-Trainingsdaten in der EU?
In der EU regeln zwei Vorschriften den Umgang mit KI-Trainingsdaten: Das Urheberrecht mit seiner Schranke für Text und Data Mining und der AI Act mit Transparenzpflichten für Modellanbieter.
- Text und Data Mining (§ 44b UrhG): Frei zugängliche Werke dürfen für automatisierte Analysen vervielfältigt werden. Rechteinhaber können sich die Nutzung vorbehalten; bei Online-Inhalten muss dieser Vorbehalt maschinenlesbar sein, etwa über die robots.txt.
- AI Act (Art. 53): Anbieter von KI-Modellen mit allgemeinem Verwendungszweck müssen seit dem 2. August 2025 eine Strategie zur Einhaltung des Urheberrechts vorweisen und eine hinreichend detaillierte Zusammenfassung ihrer Trainingsdaten veröffentlichen.
Für Website-Betreiber heißt das: Die Entscheidung über die Nutzung deiner Inhalte als Trainingsdaten triffst du technisch in der robots.txt. Welche Wirkung eine Sperre auf deine Sichtbarkeit in der KI-Suche hat, hängt davon ab, ob du nur Trainings-Crawler oder auch Such-Crawler aussperrst.
Häufige Fragen zu Trainingsdaten
Kann ich meine Website aus bereits trainierten Modellen entfernen lassen?
Aus einem fertig trainierten Modell lassen sich einzelne Websites nachträglich nicht herauslösen. Eine Sperre in der robots.txt wirkt erst auf künftige Crawls und damit auf spätere Modellgenerationen.
Wie aktuell sind die Trainingsdaten von ChatGPT?
Jedes Modell hinter ChatGPT hat einen eigenen Wissensstichtag, den OpenAI in der Modelldokumentation nennt. Fragen zu neueren Ereignissen beantwortet ChatGPT über die integrierte Websuche, also per Retrieval.
Werden meine Eingaben in ChatGPT zu Trainingsdaten?
Bei privaten ChatGPT-Konten kann OpenAI Unterhaltungen zum Training nutzen, solange du das in den Einstellungen zur Datenkontrolle nicht abschaltest. Business-, Enterprise- und API-Eingaben nutzt OpenAI nach eigenen Angaben standardmäßig nicht zum Training.