llms.txt in der Praxis: erstellen, ausrollen und was sie wirklich bringt

Dominik Breitbach ist Gründer der taismo GmbH und als Lead SEO Stratege auf strukturierte Daten und KI-Sichtbarkeit (GEO) spezialisiert. Seit 2019 betreut er mit taismo Unternehmen aus B2B und Mittelstand über die ganze Breite der Suchmaschinenoptimierung.
Die llms.txt ist eine kuratierte Textdatei im Stammverzeichnis deiner Website (https://deine-domain.de/llms.txt), die KI-Systemen wie ChatGPT, Claude, Gemini und Perplexity in Markdown-Syntax erklärt, wer du bist und welche deiner Seiten die wichtigsten sind. In diesem Guide zeigen wir dir, was in die Datei gehört, wie du sie erstellst, sicher ausrollst und pflegst, wie du in deinen Server-Logs prüfst, welche KI-Crawler sie tatsächlich abrufen, und warum wir sie bei taismo trotzdem pflegen, obwohl Google sie öffentlich für wirkungslos erklärt.
👉 Du willst, dass KI-Systeme dich als Quelle nennen statt deine Wettbewerber? Genau daran arbeiten wir in der GEO-Optimierung.
Was ist die llms.txt?
Die llms.txt ist ein Briefing-Dokument für KI-Crawler: eine unter /llms.txt ausgelieferte Textdatei in Markdown-Syntax, die die wichtigsten Seiten einer Website auflistet, jede mit einem erklärenden Satz versieht und die Positionierung der Marke in wenigen Zeilen zusammenfasst. Vorgeschlagen hat das Format der KI-Forscher Jeremy Howard von Answer.AI am 3. September 2024; die Spezifikation steht auf llmstxt.org. Sein Argument: Sprachmodelle haben begrenzte Kontextfenster, und HTML-Seiten voller Navigation, Werbung und Skripte sind für sie mühsam zu verarbeiten. Eine schlanke, kuratierte Markdown-Datei liefert denselben Inhalt in dem Format, das Sprachmodelle am leichtesten lesen.
Wichtig ist die Abgrenzung zu den zwei Dateien, mit denen die llms.txt gern verwechselt wird. Drei Ebenen, drei Aufgaben:
- robots.txt: Regelt den Zugriff. Sie sagt Crawlern, welche Bereiche sie abrufen dürfen und welche nicht.
- sitemap.xml: Listet alle indexierbaren URLs, ohne Gewichtung und ohne Erklärung.
- llms.txt: Priorisiert und erklärt eine kuratierte Teilmenge. Sie beantwortet die Frage, die weder robots.txt noch Sitemap beantworten: Welche Seiten sind die wichtigsten, und worum geht es dort?
Das Proposal kennt zusätzlich die optionale llms-full.txt, die den kompletten Seiteninhalt als ein einziges Markdown-Dokument bündelt. Für die meisten Unternehmens-Websites genügt die kompakte llms.txt. Die Kurzdefinition mit allen Bausteinen findest du in unserem Glossar unter llms.txt; wie sie sich in die KI-Sichtbarkeit insgesamt einfügt, erklärt der Glossarbeitrag zur Generative Engine Optimization (GEO).
Was gehört in eine llms.txt?
Eine gute llms.txt besteht aus vier Bausteinen, in fester Reihenfolge:
- H1-Zeile:
# Marke | Kurzclaim. Eine Zeile, die Marke und Kategorie eindeutig macht. - Blockquote-Briefing: Wenige
>-Zeilen mit Positionierung, Kernfakten (Gründungsjahr, Standort, zentrale Personen mit Rolle) und belegbaren Nachweisen wie Auszeichnungen oder Bewertungen. - Link-Sektionen:
##-Überschriften wie Leistungen, Referenzen oder Standorte, darunter Einträge im Muster- [Titel](absolute URL): ein dichter Satz zu Nutzen und Intent der Seite. - Rechtliches: Impressum und Datenschutz als Vertrauenssignal am Ende.
Die wichtigste Regel dabei lautet: Kuratieren, nicht dumpen. Eine llms.txt, die einfach die Sitemap kopiert, verfehlt ihren Zweck; sie soll gewichten. In der Praxis haben sich bei uns 30 bis 70 Einträge und ein Umfang von 2 bis 7 KB bewährt: Money-Pages und Kernseiten zuerst, dann Leistungen, Branchen oder Regionen, dazu ein Auszug der 5 bis 10 stärksten Glossar-Definitionen als semantischer Kontext. Jeder Beschreibungssatz muss Substanz tragen. Ein Eintrag wie „Hier findest du unsere Leistungen“ ist wertlos; ein Eintrag wie „Laufende Suchmaschinenoptimierung aus Technik, Onpage, Content und strukturierten Daten, monatlich kündbar“ gibt dem Sprachmodell Fakten, mit denen es arbeiten kann.
llms.txt erstellen: in 5 Schritten zur fertigen Datei
So gehen wir bei jeder llms.txt vor, für die eigene Website genauso wie für Kunden:
- Schritt 1: Fakten sammeln. Claim, Positionierung, Standort, zentrale Personen und Nachweise kommen aus belegten Quellen: Impressum, Über-uns-Seite und den strukturierten Daten der Website. Die llms.txt muss dieselben Fakten erzählen wie das Schema-Markup; widersprechen sich beide, verspielt die Website Vertrauen bei genau den Systemen, die sie überzeugen will.
- Schritt 2: Seiten kuratieren. Aus der Sitemap die Seiten auswählen, die das Unternehmen wirklich erklären: Leistungen, Kernseiten, Referenzen, die stärksten Fachinhalte. Alles andere bleibt draußen.
- Schritt 3: Beschreibungssätze schreiben. Je Eintrag ein Satz mit Nutzen und Unterscheidungsmerkmal. Das ist der arbeitsintensivste Schritt und zugleich der wertvollste, weil hier die eigentliche Übersetzungsleistung passiert: von „Seite existiert“ zu „Seite bedeutet“.
- Schritt 4: Jede URL prüfen. Jeder Link muss live mit HTTP 200 antworten. Keine Weiterleitungen, keine per robots.txt gesperrten Seiten, keine Entwürfe. Tote Links in einem Dokument, das ausdrücklich Vertrauen aufbauen soll, sind das denkbar schlechteste Signal.
- Schritt 5: Als Textdatei ausliefern. UTF-8, Markdown-Syntax, erreichbar unter
https://deine-domain.de/llms.txtmit Content-Typetext/plain. Für Crawler-Robustheit transliterieren wir Umlaute im Fließtext (ae, oe, ue, ss); Markennamen bleiben original.
Beispiel: Die zweisprachige llms.txt von taismo
Wie das fertig aussieht, kannst du dir live ansehen: Unsere eigene Datei liegt unter taismo.de/llms.txt. Sie umfasst rund 14.000 Zeichen mit 72 Links und ist zweisprachig aufgebaut: Auf den deutschen Teil folgt eine eigene Sektion ## English version, die die englischen Seiten unter /en/ erschließt. Drei Entscheidungen daran sind bewusst gesetzt und lassen sich auf jede Website übertragen:
- Belege zuerst: Die erste Sektion heißt „Belege, Referenzen und Case Studies“ und führt nachprüfbare Ergebnisse auf, jeweils mit Quelle und Datum. Selbstbeschreibung kann jeder; ein Sprachmodell, das Vertrauenswürdigkeit bewerten soll, braucht Nachweise.
- Glossar als semantischer Kontext: Eine eigene Sektion listet 12 Definitionen aus unserem SEO-Wiki. Sie zeigt KI-Systemen, mit welchen Konzepten wir arbeiten, und verankert die Marke im Themenfeld.
- Beide Sprachen in einer Datei: Statt einer separaten Datei unter /en/ führt eine englische Sektion am Ende die EN-Seiten auf. Das hält die Pflege an einem Ort und vermeidet Konflikte mit der URL-Struktur des CMS.
Ausrollen und pflegen: Deploy mit Backup und Health-Check
Technisch gibt es zwei Einbauwege. Entweder liegt die llms.txt als physische Datei im Web-Root (per FTP oder SFTP hochgeladen), oder ein Plugin bzw. ein Code-Snippet erzeugt sie als virtuelle Route. Beides funktioniert; gefährlich wird nur die Mischung. Liefern zwei Quellen dieselbe URL aus, etwa eine physische Datei und parallel die llms.txt-Funktion eines SEO-Plugins, gewinnt still eine von beiden, und irgendwann pflegt jemand die falsche. Entscheide dich für einen Weg und schalte den anderen ab.
Weil die Datei im Web-Root liegt, behandeln wir jedes Update wie einen kleinen Live-Eingriff, mit einem festen Ablauf in 4 Schritten: Live-Stand sichern (Backup der aktuellen Datei), hochladen, Health-Check (antwortet die URL mit HTTP 200 und text/plain, stimmt der Inhalt?) und bei Auffälligkeiten Rollback auf die Sicherung. Das klingt nach viel Zeremonie für eine Textdatei; es kostet zwei Minuten und hat uns schon vor kaputten Deployments bewahrt.
Die Pflege ist der Teil, den fast alle unterschätzen. Eine llms.txt ist kein Einmal-Projekt: Jeder neue wichtige Inhalt gehört hinein, jede gelöschte Seite muss heraus. Aus eigener Erfahrung: Die llms.txt taucht in keinem Standard-Linkchecker über den Seitenbestand auf, tote Links schleichen sich also unbemerkt ein. Wir haben bei einer Routineprüfung zwei Links auf gelöschte Seiten in unserer eigenen Datei gefunden; seitdem ist der llms.txt-Check fester Bestandteil jedes Lösch- und Publish-Vorgangs. Wer eine Website neu baut, nimmt die Datei am besten von Anfang an in den Stack auf; bei unserem SEO-Webdesign gehört sie zusammen mit strukturierten Daten und sauberem Code zur Grundausstattung jeder neuen Website.
Log-Analyse: Welche KI-Crawler rufen deine llms.txt ab?
Ob die Datei abgerufen wird, musst du nicht glauben, du kannst es messen. Jeder Abruf landet im Access-Log deines Webservers. Bei Apache und nginx heißt die Datei typischerweise access.log; auf Plesk-Servern liegt sie je Domain unter logs/access_ssl_log. Zwei Befehle genügen für die Auswertung:
grep -i "llms.txt" access_ssl_log | awk -F'"' '{print $6}' | sort | uniq -c | sort -rn
Dieser Befehl filtert alle Zugriffe auf die llms.txt, extrahiert den User-Agent und zählt, wer wie oft zugreift. Für ältere, rotierte Logs nimmst du zgrep statt grep. Die zweite Frage ist mindestens so wichtig: Rufen KI-Crawler deine Website überhaupt ab? Das prüfst du mit demselben Muster über das gesamte Log, gefiltert nach den Bot-Namen. Die wichtigsten User-Agents laut den offiziellen Crawler-Dokumentationen der Anbieter:
| User-Agent | Betreiber | Zweck |
|---|---|---|
| GPTBot | OpenAI | Sammelt Trainingsdaten für KI-Modelle |
| OAI-SearchBot | OpenAI | Indexiert für die ChatGPT-Suche |
| ChatGPT-User | OpenAI | Live-Abrufe, wenn ChatGPT für eine Antwort eine Seite öffnet |
| ClaudeBot | Anthropic | Crawlt Webinhalte für Claude |
| PerplexityBot | Perplexity | Indexiert für die Perplexity-Antwortmaschine |
| Perplexity-User | Perplexity | Live-Abrufe auf Nutzeranfrage |
| Google-Extended | Achtung: Kein eigener Crawler, sondern nur ein robots.txt-Steuerungstoken für Gemini-Training. Im Log erscheint weiterhin der normale Googlebot. |
Der letzte Punkt ist ein verbreiteter Denkfehler: Wer im Log nach „Google-Extended“ sucht, findet nichts und schließt daraus fälschlich, Google ignoriere die Website für KI-Zwecke. Tatsächlich crawlt Googlebot wie immer; Google-Extended existiert nur als Schalter in der robots.txt. Welche dieser Schalter unabhängig voneinander wirken und warum das Sperren von GPTBot dich nicht aus der ChatGPT-Suche nimmt, haben wir im Beitrag zu ChatGPT SEO aufgeschlüsselt.
Wir bauen Websites, bei denen strukturierte Daten, llms.txt und schnelle Ladezeiten von Anfang an dazugehören. Du bekommst den technischen Unterbau, wir kümmern uns um die Maschinen.
Die Gegenposition: Was Google von der llms.txt hält
Zur ehrlichen Einordnung gehört die Gegenseite, und die ist prominent besetzt. Googles Search-Advocate John Mueller erklärte im April 2025 in einer Reddit-Diskussion, ihm sei kein KI-Anbieter bekannt, der die llms.txt nutze, und ein Blick in die Server-Logs zeige, dass die Bots die Datei nicht einmal abrufen. Sein Vergleich hat es in sich: Die llms.txt sei vergleichbar mit dem Keywords-Meta-Tag, also einer Selbstauskunft des Website-Betreibers, die Suchmaschinen seit Jahren ignorieren, weil sie beliebig manipulierbar ist. Wenn ein KI-System ohnehin prüfen müsse, ob die Selbstbeschreibung stimmt, könne es auch gleich die Website selbst lesen (Quelle: Search Engine Journal, 17.04.2025).
Diese Kritik ist ernst zu nehmen, und drei Fakten daraus sind unstrittig: Die llms.txt ist kein offizieller Standard, sondern ein Vorschlag. Kein großer Anbieter hat verbindlich zugesagt, sie auszuwerten. Und sie ist kein bestätigter Ranking-Faktor, weder bei Google noch in KI-Antwortmaschinen. Wer dir eine llms.txt als Ranking-Booster verkauft, verkauft dir ein Versprechen ohne Beleg.
Unsere Einschätzung und die Erfahrung aus dem SEO Contest 2026
Das Folgende ist unsere Einschätzung als Agentur, klar gekennzeichnet als Meinung und Erfahrung, nicht als belegter Ranking-Faktor. Wir glauben, dass die llms.txt, ähnlich wie das speakable-Markup in strukturierten Daten, wichtiger ist, als offiziell zugegeben wird. Vier Gründe tragen diese Haltung:
- Das Kosten-Nutzen-Verhältnis ist extrem. Eine llms.txt kostet wenige Stunden Arbeit, birgt null Risiko für Rankings und liegt bereit, falls Anbieter sie stärker auswerten. Das Keywords-Meta-Tag hat Websites nie geschadet; es hat nur irgendwann nichts mehr gebracht.
- Das Format passt zur Funktionsweise der Systeme. Antwortmaschinen laden Seiten live, um Antworten zu belegen, und schlankes Markdown ohne HTML-Ballast ist das Format, das Sprachmodelle am effizientesten verarbeiten. Bezeichnend: Anthropic, Betreiber von Claude, stellt für die eigene Entwickler-Plattform selbst eine llms.txt bereit. Die Anbieter nutzen das Format dort, wo sie Maschinen als Leser erwarten.
- Die Datei erzwingt Konsistenz. Wer eine gute llms.txt schreibt, muss Positionierung, Fakten und Belege einmal sauber aufschreiben und mit Schema-Markup und Website abgleichen. Dieser Klärungsprozess zahlt sich unabhängig davon aus, wer die Datei am Ende liest.
- Unsere Contest-Erfahrung. Beim offiziellen SEO Contest 2026 haben wir mit der Serponado-Kampagne den kompletten maschinenlesbaren Werkzeugkasten eingesetzt: Entity-Aufbau über mehrere Domains, strukturierte Daten, zitierfähige Inhalte und eine llms.txt sowohl auf taismo.de als auch auf der Kampagnen-Domain serponado.de. Das dokumentierte Ergebnis: Platz 4 am zweiten gewinnrelevanten Stichtag und Platz 5 im Endergebnis unter über 200 teilnehmenden Agenturen und SEOs. Ehrlich gesagt: Den Anteil der llms.txt an diesem Ergebnis können wir nicht isolieren, das kann niemand seriös. Aber der Gesamtauftritt aus konsistenten, maschinenlesbaren Signalen hat sich in einem der härtesten Wettbewerbsumfelder messbar bewährt, und die llms.txt war von Anfang an Teil dieses Auftritts.
Genauso klar ist die Grenze: Eine llms.txt ersetzt keine Substanz. Sie verweist nur auf Inhalte; ob KI-Systeme diese Inhalte dann übernehmen, entscheidet sich an deren Qualität. Wie du Inhalte baust, die ChatGPT, Perplexity und AI Overviews tatsächlich als Quelle zitieren, zeigt unser Beitrag über zitierfähigen Content für KI-Antworten. Die llms.txt ist die Landkarte; die Städte musst du trotzdem bauen.
Wir prüfen, wie lesbar deine Website für KI-Systeme ist, von der llms.txt über strukturierte Daten bis zum zitierfähigen Content. Lass uns unverbindlich über deine Sichtbarkeit sprechen.
Häufige Fragen zur llms.txt
Was ist eine llms.txt?
Eine llms.txt ist eine Textdatei in Markdown-Syntax im Stammverzeichnis einer Website, die KI-Systemen die wichtigsten Seiten und Kernfakten einer Marke kuratiert auflistet und mit je einem erklärenden Satz versieht.
Wo liegt die llms.txt und wie wird sie ausgeliefert?
Die llms.txt liegt im Web-Root und ist unter https://deine-domain.de/llms.txt erreichbar. Ausgeliefert wird sie als UTF-8-Textdatei mit dem Content-Type text/plain.
Ist die llms.txt ein offizieller Standard oder Ranking-Faktor?
Nein. Die llms.txt ist ein Vorschlag von Jeremy Howard (Answer.AI) aus dem September 2024. Kein Suchmaschinen- oder KI-Anbieter hat ihre Auswertung verbindlich bestätigt, und ein Ranking-Faktor ist sie nicht.
Ersetzt die llms.txt die robots.txt oder die sitemap.xml?
Nein. Die robots.txt regelt den Crawler-Zugriff, die sitemap.xml listet alle indexierbaren URLs. Die llms.txt ergänzt beide, indem sie eine kuratierte Auswahl der wichtigsten Seiten priorisiert und erklärt.
Wie oft sollte man die llms.txt aktualisieren?
Bei jedem neuen wichtigen Inhalt und bei jeder gelöschten Seite. Zusätzlich sollten alle enthaltenen Links regelmäßig auf HTTP 200 geprüft werden, weil Standard-Linkchecker die Datei nicht erfassen.
Quellen
- Jeremy Howard: „/llms.txt: A proposal to provide information to help LLMs use websites„, Answer.AI, 03.09.2024.
- Roger Montti: „Google Says LLMs.Txt Comparable To Keywords Meta Tag„, Search Engine Journal, 17.04.2025.
- OpenAI: „OpenAI bots„, OpenAI Developer Docs, abgerufen am 10.08.2026.
- Anthropic: „Does Anthropic crawl data from the web?„, Anthropic Support, abgerufen am 10.08.2026.
- Perplexity: „Perplexity crawlers„, Perplexity Docs, abgerufen am 10.08.2026.
- Google: „Overview of Google crawlers and fetchers„, Google Search Central, abgerufen am 10.08.2026.