Welche Passage einer Seite zitiert eine KI?
Veröffentlicht am
Ein ausführlicher Absatz, der die Wörter aufgreift, mit denen die KI gesucht hat. Bei Claude, dessen API die zitierte Passage präzise angibt, wird ein Absatz von 50 bis 100 Wörtern 3,7- bis 4,8-mal häufiger zitiert als ein Absatz von 10 bis 25 Wörtern, und ein Absatz, der mindestens ein Drittel der Wörter aus der Suche des Modells aufgreift, wird 5- bis 8-mal häufiger zitiert. Die Passage kann sich überall auf der Seite befinden, außer ganz unten. Die Seite wird basierend auf der Frage des Nutzers ausgewählt; die Passage basierend auf den Wörtern der KI.
Für welche Art von Frage? Bei der Auswahl der Seite hängt alles von der Frage ab. Für die Auswahl der Passage innerhalb der ausgewählten Seite haben sich die folgenden Regeln bei Claude sowohl auf unseren französischen als auch auf unseren englischen Korpora bestätigt.
Zwei Vokabulare: das der Seite und das der Passage
Eine KI, die im Web sucht, trifft zwei aufeinanderfolgende Entscheidungen. Zuerst wählt sie die Seiten aus, und diese Auswahl erfolgt basierend auf der Frage des Nutzers: Die Wörter dieser Frage im Titel und in der Adresse der Seite erhöhen ihre Chancen, ausgewählt zu werden. Danach wählt sie auf der Seite die Passage aus, die sie zitiert, und diese zweite Auswahl erfolgt basierend auf ihren eigenen Wörtern – denen, die sie in ihren Suchanfragen verwendet hat.
Bei Claude wird ein Absatz, der mindestens ein Drittel der Wörter aus der Suche des Modells aufgreift, in den rund zehn Sektoren auf Französisch 5,1-mal und auf Englisch 8,2-mal häufiger zitiert. Die Wörter aus der Frage des Nutzers spielen ebenfalls eine Rolle, jedoch eine geringere: 2,4- bis 3,4-mal. Dies sind zwei unterschiedliche Vokabulare an zwei verschiedenen Stellen der Seite; diese zu verwechseln, indem man die Wörter der KI in den Titel setzt, führt an beiden Fronten zu Verlusten.
Ein ausführlicher und behauptender Absatz
Die Länge ist die einflussreichste Variable. Bei Claude wird ein Absatz von 50 bis 100 Wörtern 4,8-mal häufiger zitiert als ein Absatz von 10 bis 25 Wörtern in den rund zehn Sektoren auf Französisch, 3,7-mal auf Englisch und 5- bis 6-mal in unseren ersten Korpora. Kurze Absätze, Teaser und isolierte Sätze werden selten als die ausgewählte Passage herangezogen.
Die Formulierung spielt ebenfalls eine Rolle. Ein Absatz, der ein regelgebendes Verb wie „ist“, „ermöglicht“ oder „muss“ enthält, wird 1,7- bis 2,7-mal häufiger zitiert: Die KI bevorzugt Passagen, die eine Aussage treffen. Fließtext setzt sich meistens gegenüber Listen durch, im Englischen bis zu 3,2-mal häufiger, aber nicht immer: Bei der Software-Fehlerbehebung wurden lange Listenelemente, die einen Schritt beschreiben, häufiger ausgewählt als Absätze.
Wo sich die zitierte Passage befindet
Im Gegensatz zu einer weit verbreiteten Meinung ist der erste Absatz nichts Besonderes. In unseren ersten Korpora ist die Position der zitierten Passage auf der Seite fast gleichmäßig verteilt, mit nur einem einzigen Einbruch: dem allerletzten Teil der Seite, wo sich oft rechtliche Hinweise, Links und Zusatzinhalte befinden. In unseren folgenden Korpora zeigte die Position keinen stabilen Effekt.
Eine Seite muss also nicht alles in ihrer Einleitung konzentrieren, um zitiert zu werden. Jeder ausführliche Absatz kann zur ausgewählten Passage werden, vorausgesetzt, er kann für sich selbst stehen: Die KI zitiert einen Ausschnitt, nicht die gesamte Seite, und ein Absatz, der auf „das Vorhergehende“ verweist, verliert isoliert seinen Sinn.
Was Gemini und die Dokumentation der Anbieter zeigen
Die Dokumentation von Anthropic präzisiert, dass jedes Web-Zitat von Claude bis zu 150 Zeichen des zitierten Textes enthält und dass Zitate für die Websuche immer aktiviert sind. Dies ermöglicht es uns, die ausgewählte Passage ohne Schätzungen zu lokalisieren. Google wiederum dokumentiert ein Passage-Ranking-System, das Abschnitte einer Seite identifiziert, um deren Relevanz zu bewerten.
Bei Gemini gibt die API die Position der zitierten Passage nicht aus: Man muss sie rekonstruieren, und jede Rekonstruktionsmethode führt zu einer Verzerrung. Unsere Rekonstruktionen weisen in dieselbe Richtung wie bei Claude – ein Absatz von 25 bis 100 Wörtern, der die Suchbegriffe enthält, wird häufiger ausgewählt –, aber das Ausmaß des Effekts lässt sich nicht mit Sicherheit messen. Die einzige Messung ohne diese Verzerrung ist die von Claude.
Was Google sagt und wie es zu verstehen ist
Google gibt in seinem am 10. Juli 2026 aktualisierten Leitfaden zur Optimierung für seine generativen KI-Funktionen an, dass keine Verpflichtung besteht, Inhalte in kleine Stücke zu zerlegen: Seine Systeme können die Nuancen mehrerer Themen auf einer Seite verstehen und dem Nutzer die relevante Passage anzeigen. Zudem fügt Google hinzu, dass es nicht notwendig sei, in einer bestimmten Art und Weise für die KI-Suche zu schreiben, da diese Systeme Synonyme und die allgemeine Bedeutung des Gesuchten verstehen.
Diese Behauptungen und unsere Messungen beziehen sich nicht auf dieselben Systeme: Google spricht von seiner Suche, wir messen, was Claude über seine API zitiert. Sie stimmen im Wesentlichen überein. Es geht nicht darum, für eine Maschine zu schreiben oder eine Seite zu zerstückeln, sondern vollständige Absätze zu verfassen, die klar formulieren und das tatsächliche Vokabular des Themas verwenden; das ist es, was auch die Leser erwarten.
Was das für ein Unternehmen ändert
Um zitiert zu werden, reicht es nicht aus, die richtige Seite zu sein: sie muss den richtigen Abschnitt enthalten. Konkret bedeutet dies, Absätze aus mehreren Sätzen zu schreiben, die klar darlegen, was wahr ist, und die die Wörter aufgreifen, mit denen die KIs nach Ihrem Thema suchen. Diese Wörter lassen sich nicht erraten: Man erhält sie, indem man den KIs die Fragen stellt und deren Suchanfragen erfasst.
Dies ist die Methode, die für diese Rubrik angewandt wurde: Jede Frage wurde ChatGPT, Claude und Gemini gestellt, ihre Suchanfragen wurden erfasst, um die Absätze zu schreiben, und die Titel tragen die Frage, nicht die Wörter der Suchanfragen.
Was wir nicht wissen
Die genaue Lokalisierung des Abschnitts ist nur bei Claude verfügbar; bei Gemini wird sie rekonstruiert, und bei ChatGPT haben wir sie nicht gemessen. Unsere Messungen beziehen sich auf die API der Modelle und beschreiben Zusammenhänge zwischen den Merkmalen der Absätze und den Zitaten.
Quellen
- Anthropic — Dokumentation des Web-Suchwerkzeugs von Claude, .
- Google Search Central — Leitfaden für Ranking-Systeme, .
- Google Search Central — „Optimizing your website for generative AI features on Google Search“, .
- Messungen von FaireDuBruit vom 4. bis 16. September 2026 — siehe „Wie wir gemessen haben“.