← Zurück zur Ausgabe vom 18. August 2026

Reportage

Drei Preise für dasselbe Buch: Was Trainingsdaten 2026 wirklich kosten

Ein antiquarisches Buch kostet wenige Euro. Lizenziert kostet dasselbe Buch 5.000 Dollar. Als Raubkopie kostet es am Ende 3.000. Dass der billigste Weg über die Papierschneidemaschine führt, ist kein Versagen des Marktes — es ist sein Ergebnis. Denn was hier bepreist wird, ist nicht der Text, sondern der Nachweis, ihn rechtmäßig zu besitzen.

Von Stefan Lange-Hegermann · · 9 Minuten

Ein Antiquar hielt die Anfrage für Betrug

Im Juli meldete sich bei einem niederländischen Antiquariat ein Interessent, der 3.000 Exemplare kaufen wollte. Der Händler hielt die Nachricht für einen Phishing-Versuch und ignorierte sie — so berichtete es Fortune Ende Juli. Der Verdacht war verständlich: Wer bestellt 3.000 antiquarische Bücher, ohne sich für einen einzelnen Titel zu interessieren?

Seit dem 17. August kennen wir die Antwort genauer. Das Rechercheportal 404 Media legte einen Peilsender in eine Sendung antiquarischer Bücher und verfolgte deren Weg bis in eine Amazon-Halle in Las Vegas. Mitarbeiter beschrieben dem Portal dort ein Verfahren, das sich in einem Satz zusammenfassen lässt: Buchrücken abschneiden, Seiten durch den Hochgeschwindigkeitsscanner ziehen, Papier entsorgen. Amazon bestätigte den Ankauf von Büchern zu KI-Zwecken; das Zerschneiden selbst hat das Unternehmen weder bestätigt noch bestritten.

Die naheliegende Empörung — ein Konzern, der als Buchhändler begann, vernichtet Bücher — führt allerdings an der interessanteren Frage vorbei. Denn seit zwei Jahren existiert ein funktionierender, bepreister Lizenzmarkt für Trainingsdaten. Warum benutzt ihn ausgerechnet der finanzstärkste Käufer nicht?

Drei Preise, dasselbe Buch

Rechnen wir es durch. Für ein und denselben Titel gibt es 2026 drei Wege, und jeder hat einen bekannten Preis.

Der lizenzierte Weg kostet 5.000 Dollar. Das ist der Satz aus dem Vertrag zwischen Microsoft und HarperCollins, von dem die Hälfte an den Autor geht. Er gilt nicht für jedes Buch, sondern für ausgewählte ältere Sachbuchtitel, nur bei ausdrücklicher Zustimmung des Autors, für drei Jahre, mit einer Ausgabebegrenzung von 200 zusammenhängenden Wörtern oder fünf Prozent des Textes.

Der raubkopierte Weg kostet im Ergebnis 3.000 Dollar. Das ist die Summe je Werk aus dem Vergleich in der Sache Bartz gegen Anthropic — 1,5 Milliarden Dollar insgesamt, am 20. Juli 2026 endgültig genehmigt, das Vierfache des gesetzlichen Mindestschadens für vorsätzliche Verletzung. Die Anmeldequote lag bei über 91 Prozent, was für eine Sammelklage außergewöhnlich ist.

Der gekaufte und zerschnittene Weg kostet wenige Euro pro Band, zuzüglich Logistik.

Diese drei Zahlen erklären das Verhalten vollständig. Aber sie erklären es nur, wenn man versteht, dass sie keine Preise für denselben Gegenstand sind.

Was der Richter tatsächlich entschieden hat

Der Bundesrichter William Alsup entschied im Juni 2025 zwei Dinge, die in der öffentlichen Wahrnehmung ständig zusammenfallen, juristisch aber getrennt sind.

Erstens: Das Training eines Sprachmodells an rechtmäßig erworbenen Büchern ist fair use. Zweitens, und das ist der für unsere Frage entscheidende Teil: Wenn ein Unternehmen ein gedrucktes Buch kauft, es einscannt und das Papier vernichtet, entsteht dabei keine zusätzliche Kopie. Alsups Formulierung: Das digitale Exemplar ersetzt das gedruckte, „one replaced the other“. Juristisch ist das ein reiner Formatwechsel an einem Gegenstand, den man besitzt — vergleichbar damit, eine gekaufte CD auf die Festplatte zu kopieren und die Scheibe wegzuwerfen.

Rechtswidrig war ausschließlich der andere Strang: das Herunterladen von Millionen Büchern aus Schattenbibliotheken. Anthropic hatte beides getan. Für das Erste bekam es Recht, für das Zweite zahlte es 1,5 Milliarden Dollar.

Damit ist der Markt geformt. Was ein Käufer erwirbt, wenn er lizenziert, ist nicht der Text — den bekommt er auch antiquarisch. Er erwirbt die Zusicherung, ihn rechtmäßig zu besitzen. Und genau diese Zusicherung liefert der Kauf eines gedruckten Exemplars nach Alsups Logik bereits mit, kostenlos und ohne Verhandlung. Der Lizenzvertrag ist in dieser Rechnung nicht der sicherere Weg, sondern der teurere Weg zum selben Ergebnis — mit dem zusätzlichen Risiko, dass die Rechtekette beim Verlag unvollständig ist, dass Autoren widersprechen oder dass Anthologierechte ungeklärt sind.

Der Lizenzmarkt, den es trotzdem gibt

Das heißt nicht, dass Lizenzierung tot wäre. Sie hat sich nur auf das verlagert, wo sie etwas kann, das der Antiquariatskauf nicht kann: laufende, aktuelle, strukturierte Daten.

News Corp und OpenAI schlossen 2024 einen Vertrag über bis zu 250 Millionen Dollar auf fünf Jahre, der Wall Street Journal, Barron's, New York Post und die Times of London abdeckt. Reddit erhält von Google Berichten zufolge rund 60 Millionen Dollar jährlich. Der Fachverlag Wiley meldete für das Geschäftsjahr 2026 rund 49 Millionen Dollar aus KI-Lizenzen, kumuliert über 110 Millionen — Autoren hatten dort kein Widerspruchsrecht. Taylor & Francis nahm von Microsoft zehn Millionen Dollar für den Zugriff auf knapp 3.000 Fachzeitschriften, ohne die Autoren vorab zu informieren.

Auffällig ist, was diese Deals gemeinsam haben: Es sind alles Bestände, die sich fortlaufend erneuern. Ein Archiv kauft man einmal. Einen Nachrichtenstrom mietet man. Entsprechend verschiebt sich die Vertragsform — Branchenanalysen beobachten, dass nur noch etwa vier von zehn Lizenzabschlüssen überhaupt Trainingsrechte enthalten; verkauft wird zunehmend laufender Zugriff statt einmaliger Korpus.

Um diesen Markt herum ist binnen eines Jahres eine Zwischenschicht entstanden: Marktplätze und Abrechnungsmodelle. Der Standard Really Simple Licensing, dessen Spezifikation im Dezember 2025 erschien, erlaubt Rechteinhabern, Lizenzbedingungen maschinenlesbar in der robots.txt zu hinterlegen. TollBit rechnet pro Abruf ab, ProRata pro Zitation in einer KI-Antwort. Und im Januar 2026 kaufte Cloudflare den Lizenz-Marktplatz Human Native — was bemerkenswert wenig Aufmerksamkeit fand: Derselbe Anbieter, der vor rund einem Fünftel aller Websites steht und KI-Crawler seit Juli 2025 standardmäßig blockiert, verkauft nun auch den Zugang durch diese Sperre. Wie die Sperre selbst entstand, haben wir in der Reportage vom 2. Juli beschrieben; dass der Türsteher inzwischen die Eintrittskarten verkauft, ist die Fortsetzung dieser Geschichte.

Warum Bücher trotzdem knapp sind

Bleibt die Frage, warum überhaupt jemand den Aufwand betreibt, Papier zu zerschneiden, wenn das Internet nicht kleiner wird.

Die verbreitete Antwort — den Modellen gehen die Daten aus — ist in ihrer plakativen Form überholt. Die Forschungsgruppe Epoch AI, auf die sich diese These fast immer stützt, hat ihre eigene Prognose nach hinten korrigiert: Das 80-Prozent-Konfidenzintervall für die vollständige Ausschöpfung menschlich erzeugter Textdaten reicht heute von 2026 bis 2032. Wer die Schlagzeile „2026 ist Schluss“ zitiert, zitiert eine Zahl, die ihre Quelle selbst revidiert hat.

Knapp ist nicht Text, knapp ist eine bestimmte Sorte Text. Bücher sind lang, dicht, lektoriert und durchargumentiert — ein Buch liefert etwa 120.000 Token, aber vor allem liefert es zusammenhängende Gedankenführung über hunderte Seiten, die kein Forenbeitrag ersetzt. Vieles davon steht nirgends im Netz. Und der dritte Punkt wird selten genannt, ist aber der handfesteste: Bücher, die vor 2022 gedruckt wurden, sind garantiert frei von maschinell erzeugtem Text.

Das ist deshalb wertvoll, weil die Debatte um den sogenannten Modellkollaps sich sortiert hat. Die alarmistische Lesart — Modelle, die auf Modellausgaben trainieren, degenerieren zwangsläufig — gilt in dieser Absolutheit nicht: Wird synthetisches Material zusätzlich zu echten Daten angesammelt statt an deren Stelle, bleiben Modelle über Generationen stabil. Aber das zusätzlich ist die Bedingung, und sie setzt voraus, dass genügend nachweislich menschliches Material im Mix bleibt. Ein Bücherregal von 1990 ist ein Reinbestand, den man kaufen kann. Das offene Web von 2026 ist es nicht mehr.

Was Unternehmen daraus mitnehmen

Für ein Softwarehaus, das ein fremdes Modell einsetzt oder nachtrainiert, hat all das drei konkrete Konsequenzen.

Erstens: Die gesetzliche Offenlegung ersetzt keine vertragliche Zusicherung. Artikel 53 des EU AI Act verpflichtet Anbieter universeller KI-Modelle zu einer öffentlichen Zusammenfassung ihrer Trainingsdaten; das verbindliche Formular liegt seit Juli 2025 vor, für Bestandsmodelle läuft die Frist bis August 2027. Das Formular verlangt jedoch ausdrücklich nur aggregierte, erzählende Angaben — Kategorien und große Datensätze, keine Werkverzeichnisse. Dieselbe Beobachtung gilt für die kalifornische Offenlegungspflicht. Wer Herkunftssicherheit braucht, muss sie im Liefervertrag vereinbaren.

Zweitens: Freistellungszusagen unterscheiden sich erheblich. Microsoft gewährt seine Urheberrechts-Zusage pauschal für abgedeckte Unternehmenslizenzen, OpenAI vergleichbar für Enterprise- und API-Kunden. Anthropic verhandelt sie vertragsindividuell. Alle diese Zusagen decken typischerweise Ansprüche wegen der Ausgabe des Modells ab, sofern der Kunde die Nutzungsbedingungen einhält — nicht das Umgehen von Schutzmechanismen, nicht jedes Produktpaket, und nicht rückwirkend für Modellgenerationen, die vor der Zusage trainiert wurden. Die relevante Frage an den Vertrieb lautet daher nicht „gibt es eine Freistellung“, sondern „für welche Modellversionen, in welcher Höhe, und was sind die Ausnahmen“.

Drittens, falls Sie selbst Inhalte besitzen: Ein Urheberrechtsvermerk in Prosa ist wirkungslos. Das Oberlandesgericht Hamburg wies am 10. Dezember 2025 die Berufung des Fotografen Robert Kneschke gegen LAION zurück — nicht, weil Text- und Data-Mining grundsätzlich erlaubt wäre, sondern weil sein in normaler Sprache formulierter Nutzungsvorbehalt die gesetzliche Anforderung der Maschinenlesbarkeit nicht erfüllte. Wer widersprechen will, muss es in robots.txt, per RSL oder in einem vergleichbaren maschinell auswertbaren Format tun. Und wie schnell selbst gut finanzierte Kläger scheitern, zeigt der Fall Getty gegen Stability AI: Getty ließ die zentralen Klagepunkte im Prozess fallen und gewann vor dem Londoner High Court im November 2025 nur noch eine eng begrenzte Markenrechtsfrage — an der Territorialität, nicht an der Sache.

Der Markt für Trainingsdaten ist damit kein Markt für Information. Information ist reichlich vorhanden und im Zweifel antiquarisch zu haben. Gehandelt wird die Beweisbarkeit, sie rechtmäßig erlangt zu haben — und der Preis dafür schwankt, je nachdem, welches Gericht zuletzt gesprochen hat. Für Unternehmen heißt das: Die Frage nach den Trainingsdaten Ihres Anbieters ist keine ethische Nebenfrage, sondern eine Position in der Risikobewertung. Sie gehört in denselben Ordner wie Betriebshaftpflicht und Auftragsverarbeitung — mit dem Unterschied, dass für sie noch niemand ein Standardformular geschrieben hat.

Quellen