Zitieren KIs PDF-Dokumente?
Veröffentlicht am
Selten im Vergleich zu Webseiten. Bei ChatGPT machen PDFs 16 bis 21 % der durch seine Suchen gelieferten Ergebnisse aus, aber sie werden in all unseren Korpora 2- bis 5-mal seltener zitiert als die anderen Seiten. Claude liefert sehr wenige PDFs zurück, höchstens etwa 3 % seiner Ergebnisse. Wir haben keine veröffentlichte Studie gefunden, die das Zitieren von PDFs durch KIs misst: Diese Zahlen sind unsere eigenen. Ein wichtiges Dokument, das nur als PDF veröffentlicht wird, hat daher geringere Chancen, zitiert zu werden, als eine gleichwertige Webseite.
Für welche Art von Frage? Alles hängt von der Frage ab. Wenn der Nutzer nach einem bestimmten Dokument, einer Norm, einem technischen Datenblatt oder einem Bericht sucht, kann die KI es als PDF abrufen. Bei einer Informations- oder Marktfrage zitiert sie eher Webseiten.
Was wir bei ChatGPT gemessen haben
Wir haben in den durch die Suchen von ChatGPT gelieferten Ergebnissen die Adressen von PDF-Dokumenten gezählt und dann den Anteil dieser tatsächlich zitierten Dokumente ermittelt. PDFs sind in dem, was ChatGPT findet, zahlreich vorhanden: 21 % der Ergebnisse in rund zehn Branchen auf Französisch, 20 % in diesen Branchen auf Englisch, 19 % bei der Fehlerbehebung von Software, 17 % bei unseren Fragen zur Sichtbarkeit in KIs.
Dennoch werden sie selten zitiert: 5,7 % der gelieferten PDFs gegenüber 12,1 % der anderen Seiten in den Branchen auf Französisch, 5,2 % gegenüber 10,1 % auf Englisch, 4,9 % gegenüber 11,8 % bei der Fehlerbehebung und 2,1 % gegenüber 10,8 % bei unseren Fragen vom 15. September 2026. Ein PDF wird also 2- bis 5-mal seltener zitiert als eine Webseite, die von derselben KI gefunden wurde. Unsere ersten Korpora zur HVAC-Branche und zur künstlichen Intelligenz zeigten bereits einen Unterschied des 3- bis 4-Fachen.
Claude liefert sehr wenige PDFs
Bei Claude sind PDFs in den Ergebnissen fast gar nicht vorhanden: je nach Korpus zwischen 0,5 und 3 % dessen, was seine Suche liefert. Das ist zu wenig, um eine verlässliche Zitierrate zu messen. Der Unterschied zu ChatGPT liegt daher in erster Linie an dem, was die jeweilige Suchmaschine zurückgibt, noch vor der Auswahl der zu zitierenden Quellen.
Bei Gemini unterscheidet die API nicht zwischen gefundenen und zitierten Seiten und liefert nur die Domain der Quellen, was eine Messung des PDF-Anteils unmöglich macht. Auch hier ist eine einheitliche Regel für „die KIs“ nicht möglich: ChatGPT findet viele PDFs und sortiert sie aus, Claude findet wenige.
Warum ein PDF seltener zitiert wird
Wir beobachten mehrere Hindernisse, ohne sagen zu können, welches am schwersten wiegt. Ein PDF hat oft weder ein nutzbares Title-Tag noch eine maschinenlesbare Absatzstruktur: Bei unseren eigenen Erhebungen wurden einige PDFs als ein einziger Textblock von mehreren zehntausend Wörtern gelesen, andere konnten überhaupt nicht gelesen werden. Die von einer KI zitierte Passage ist jedoch ein ausformulierter, leicht auffindbarer Absatz, der die Wörter ihrer Suche aufgreift.
Ein PDF ist zudem oft lang und allgemein gehalten – Jahresbericht, vollständiger Leitfaden, Katalog –, während die KI nach einer Passage sucht, die eine präzise Frage beantwortet. Diese Erklärungen bleiben Hypothesen: Wir messen die Differenz beim Zitieren, nicht deren Ursache.
Was Google und die veröffentlichten Studien sagen
Google indexiert PDF-Dokumente: Das Format ist in der Liste der indexierbaren Dateitypen enthalten, die am 3. Februar 2026 aktualisiert wurde. Und seine Dokumentation zu den KI-Funktionen weist darauf hin, dass eine indexierte und für ein Snippet berechtigte Seite als Quelle dienen kann, ohne zusätzliche Anforderungen. Nichts schließt also ein PDF von den KI-Antworten von Google aus.
Wir haben keine veröffentlichte Studie und keine Dokumentation von OpenAI, Anthropic oder Google gefunden, die sich speziell mit dem Zitieren von PDFs durch KIs befasst. Dies ist eines der Themen, bei denen unsere Messungen unseres Wissens nach die einzigen verfügbaren sind.
Was das für ein Unternehmen ändert
Ein Whitepaper, ein technisches Datenblatt oder eine Studie, die nur als PDF veröffentlicht werden, werden zwar gefunden, aber selten zitiert. Damit ein wichtiger Inhalt von einer KI übernommen werden kann, ist es besser, ihn auch als Webseite zu veröffentlichen, aufgeteilt in Seiten oder Abschnitte, die jeweils eine präzise Frage beantworten, mit ausformulierten Absätzen, und das PDF als Download bereitzuhalten.
Die Webseite trägt die Frage im Titel und in ihrer Adresse, antwortet gleich in den ersten Zeilen und verweist auf das vollständige Dokument. Das PDF bleibt für den Leser nützlich, der alles lesen möchte; die Webseite ist das, was die KI zitieren kann.
Was wir nicht wissen
Ein Dokument wird als PDF gezählt, wenn seine Adresse auf „.pdf“ endet; ein PDF, das unter einer anderen Adresse bereitgestellt wird, wird nicht gezählt. Bei ChatGPT werden die zitierten Dokumente anhand der Links in der Antwort erfasst. Unsere Messungen beziehen sich auf die API der Modelle und unterscheiden nicht zwischen den verschiedenen Arten von PDFs.
Quellen
- Google Search Central — von Google indizierbare Dateitypen, .
- Google Search Central — „AI features and your website“, .
- Messungen von FaireDuBruit vom 4. bis 16. September 2026 — siehe „Wie wir gemessen haben“.