Der Satz, der in fast jedem Strategiepapier steht
„Wir trainieren ein eigenes Modell auf unseren Daten.“ Kaum ein KI-Vorhaben kommt ohne diesen Satz aus, und er klingt nach Kontrolle: eigene Daten, eigenes Modell, eigener Vorsprung. Gemeint ist damit fast immer Fine-Tuning — ein fertig trainiertes Sprachmodell bekommt einige tausend Beispiele aus dem eigenen Haus vorgelegt und passt seine Gewichte daran an. Das Bild, das die meisten dabei im Kopf haben, ist das einer Einarbeitung: Ein erfahrener Mitarbeiter kommt neu ins Unternehmen und lernt die Hausregeln.
Das Bild ist nicht falsch, aber es führt in die Irre, weil es die entscheidende Frage verdeckt: Wie kommen Wissen und Regeln überhaupt in das Modell hinein — und muss das über die Gewichte laufen? Wer im September 2026 nachsieht, was die großen Anbieter dafür anbieten, findet eine überraschende Antwort. Von vieren bietet nur noch einer Fine-Tuning für seine aktuellen Modelle aktiv an.
Was die Anbieter selbst tun
OpenAI fährt seine Selbstbedienungs-Plattform für Fine-Tuning zurück, und zwar mit Kalenderdaten. Auf der eigenen Deprecations-Seite steht, dass man Entwickler am 7. Mai 2026 über „updates to availability“ informiert habe. Seither gilt: Organisationen, die vorher noch nie ein Fine-Tuning durchgeführt haben, können keines mehr starten. Seit dem 2. Juli 2026 gilt dasselbe für Organisationen, die in den vergangenen 60 Tagen kein angepasstes Modell mehr genutzt haben. Und am 6. Januar 2027 endet es auch für die verbliebenen aktiven Kunden: „Active existing customers will no longer be able to create new fine-tuning jobs on this date.“
Eine Präzisierung, die in der Sekundärberichterstattung oft untergeht und für Betroffene der wichtigste Satz ist: Es endet das Erstellen neuer Anpassungen, nicht der Betrieb. Bereits angepasste Modelle laufen weiter, bis das zugrunde liegende Basismodell abgekündigt wird. Wer heute ein fein abgestimmtes Modell produktiv hat, wird nicht abgeschaltet — er kann nur nichts Neues mehr bauen. Ohnehin ist die Liste der unterstützten Modelle kurz und deutlich hinter dem aktuellen Stand: überwachtes Fine-Tuning und Präferenzoptimierung nur für die 4.1-Familie, bestärkendes Fine-Tuning nur für o4-mini.
Anthropic hat es für die eigene Schnittstelle nie angeboten. Im offiziellen Glossar steht der Satz unverblümt: „The Claude API does not currently offer fine-tuning, but ask your Anthropic contact if you are interested in exploring this option.“ Das einzige Claude-Modell, das sich überhaupt anpassen lässt, ist Claude 3 Haiku — zwei Modellgenerationen alt — und das auch nur über Amazon Bedrock, wo es seit dem 1. November 2024 allgemein verfügbar ist. Dass ausgerechnet der Anbieter mit dem lautesten Sicherheitsanspruch hier auf den Vertriebskontakt verweist, ist kein Zufall; dazu gleich mehr.
Mistral hat seine Fine-Tuning-Dokumentation in der Navigation unter „Deprecated features“ einsortiert. Über der Seite steht ein Warnbanner: „This feature is deprecated and is no longer actively supported.“ Was an die Stelle tritt, heißt nach übereinstimmenden Berichten der Fachpresse Forge und ist etwas anderes — eine Plattform, auf der Kunden vollständige eigene Modelle trainieren lassen, statt ein bestehendes nachzujustieren. Eine Mistral-eigene, datierte Ankündigung dazu haben wir nicht gefunden; belegt ist hier nur das Warnbanner über der alten Seite.
Google ist der Ausreißer. Supervised Tuning für Gemini in Vertex AI ist aktiv dokumentiert und trägt keinen Abkündigungshinweis. Konkrete Preise dafür konnten wir an der Primärquelle nicht belegen — die offizielle Preisseite ließ sich nicht vollständig auslesen —, und wir geben hier bewusst keine Zahlen weiter, die nur in Vergleichsblogs stehen.
Die Rechnung, die selten jemand aufmacht
Der Grund für den Rückbau lässt sich an einer einzigen Zahl zeigen, und sie steht nicht bei den Modellanbietern, sondern beim Cloud-Vermittler. Auf der Preisseite von Amazon Bedrock rechnet AWS selbst vor, was es kostet, ein angepasstes Modell dauerhaft bereitzuhalten: eine Modelleinheit für Claude mit Ein-Monats-Bindung zu 39,60 Dollar pro Stunde. Das Rechenbeispiel steht wörtlich auf der Seite und endet bei 29.462,40 Dollar im Monat.
Das ist der Punkt, an dem das Bild vom eingearbeiteten Mitarbeiter kippt. Ein angepasstes Modell teilt sich die Infrastruktur nicht mit anderen Kunden; es braucht reservierte Kapazität. Sie zahlen für die Stunde, nicht für die Anfrage — und zwar auch nachts, auch am Wochenende, auch wenn niemand etwas fragt. Dem stehen bei einem Standardmodell Tokenkosten gegenüber, die nur anfallen, wenn tatsächlich jemand arbeitet, und die seit zwei Jahren fallen. Für ein Werkzeug, das ein paar hundert Mitarbeiter gelegentlich nutzen, ist diese Rechnung in aller Regel bereits entschieden, bevor man über Qualität gesprochen hat.
Dazu kommt ein Aufwand, der in keiner Preisliste steht: Ein angepasstes Modell ist an sein Basismodell gekettet. Wird dieses abgekündigt — und das geschieht derzeit im Jahresrhythmus —, beginnt die Arbeit von vorn: Daten prüfen, neu trainieren, neu evaluieren, neu freigeben. Wer alle zwölf Monate durch diesen Zyklus muss, hat keinen Vorsprung aufgebaut, sondern eine wiederkehrende Verpflichtung.
Was an seine Stelle getreten ist
Der Rückbau bedeutet nicht, dass Unternehmenswissen nicht mehr ins Modell kommt. Es kommt nur nicht mehr über die Gewichte, sondern über den Kontext — also über das, was bei jeder einzelnen Anfrage mitgeschickt wird.
Drei Entwicklungen haben das möglich gemacht. Erstens sind die Kontextfenster groß genug geworden, dass ganze Handbücher hineinpassen. Zweitens rechnen die Anbieter wiederholte Eingaben günstiger ab, wenn sie zwischengespeichert werden — das macht es bezahlbar, denselben umfangreichen Regelsatz zehntausendfach mitzuschicken. Drittens suchen neuere Modelle selbst: Statt einer vorgeschalteten Retrieval-Pipeline, die vorab die vermeintlich passenden Textstellen heraussucht, bekommt das Modell ein Suchwerkzeug und entscheidet selbst, was es nachschlägt.
Der praktische Unterschied ist erheblich. Wenn sich eine Hausregel ändert, ändern Sie eine Textdatei — nicht einen Trainingslauf. Sie können nachvollziehen, warum das Modell so geantwortet hat, weil die Begründung im Kontext steht und nicht in den Gewichten verschwunden ist. Und Sie können den Modellanbieter wechseln, ohne Ihre Anpassung zu verlieren. Genau diese drei Eigenschaften — Änderbarkeit, Nachvollziehbarkeit, Austauschbarkeit — sind es, die Fine-Tuning nicht hat.
Der sicherheitstechnische Aspekt kommt hinzu und erklärt Anthropics Zurückhaltung besser als jede Produktstrategie: Wer die Gewichte eines Modells verändert, kann dabei auch die antrainierten Schutzmechanismen beschädigen — nicht absichtlich, sondern als Nebenwirkung. Ein Anbieter, der sein Modell nur als Ganzes ausliefert, behält die Kontrolle darüber, wie es sich verhält. Ein Anbieter, der Fine-Tuning erlaubt, gibt sie teilweise ab.
Wann es sich trotzdem lohnt
Fine-Tuning ist nicht tot, es ist nur schmaler geworden. Sinnvoll bleibt es dort, wo sich der Aufwand über schiere Menge amortisiert: Wenn eine einzige, eng umrissene Aufgabe millionenfach am Tag läuft, kann ein kleines, darauf abgestimmtes Modell günstiger und schneller sein als ein großes mit langem Kontext — weil man sich die tausenden Anweisungs-Token bei jeder Anfrage spart. Klassifikation, Extraktion aus immer gleichen Formularen, das Einhalten eines starren Ausgabeformats: Das sind die Fälle. Ebenso, wenn ein Modell einen fachlichen Stil oder eine Fachsprache treffen soll, die sich schlecht in Anweisungen fassen lässt.
Die Faustregel steht so ähnlich in Googles eigener Empfehlung und ist trotz der Interessenlage brauchbar, weil sie gegen das eigene Produkt argumentiert: Überwachtes Anpassen solle sich auf Stil, Format und Verhalten richten — für neue Fakten sei Retrieval zuständig. Kürzer: Fine-Tuning ändert, wie ein Modell antwortet. Kontext ändert, was es weiß. Die meisten Unternehmensprobleme sind Wissensprobleme, keine Verhaltensprobleme — und genau deshalb sind die Fine-Tuning-Angebote der Anbieter so wenig genutzt worden, dass sich ihr Betrieb nicht mehr lohnte.
Das wohl sauberste öffentlich dokumentierte Gegenbeispiel liefert der Editor-Hersteller Cursor. Für die Code-Vervollständigung, die bei jedem Tastendruck feuert, hat das Unternehmen ein eigenes, auf Bearbeitungsvorhersage trainiertes Modell gebaut und die Zahlen dazu selbst veröffentlicht: Die Serverlatenz im Median sank von 475 auf 260 Millisekunden, das Modell sage nach eigener Messung „über 25 Prozent mehr schwierige Bearbeitungen pro Zeile" voraus. Genau das ist der Fall, in dem sich der Aufwand trägt — extreme Häufigkeit, harte Latenzanforderung, eng umrissene Aufgabe. Lehrreich ist dabei eine Feinheit: Cursor spricht von einem selbst trainierten Modell, nicht vom Anpassen eines fremden. In der Praxis verschwimmt die Grenze zwischen „eigenes Modell" und „Fine-Tuning" genau dort, wo es ernst wird.
Für die nächste Sitzung, in der der Satz vom eigenen Modell fällt, ist die nützlichste Rückfrage deshalb nicht „womit trainieren wir?“, sondern: Ist unser Problem, dass das Modell etwas nicht weiß, oder dass es sich nicht so verhält, wie wir wollen? Bei der ersten Antwort brauchen Sie keinen Trainingslauf. Bei der zweiten sollten Sie zuerst prüfen, ob es wirklich an den Gewichten liegt — oder an einer Anweisung, die nie jemand aufgeschrieben hat.
Was wir nicht belegen konnten
Zur Offenlegung gehört, was in dieser Reportage fehlt. Die Preise für Googles Gemini-Tuning konnten wir an der Primärquelle nicht auslesen und nennen deshalb keine. Die Angaben zu Microsofts Azure-Angebot stammen aus Suchergebnissen, nicht aus einem selbst geöffneten Dokument — wir führen sie deshalb nicht als Beleg. Die kursierende Zahl, wonach die große Mehrheit der KI-Pilotprojekte den Produktivbetrieb nie erreicht, haben wir bewusst weggelassen: Ihre Methodik ließ sich in der verfügbaren Zeit nicht prüfen, und eine ungeprüfte Zahl trägt kein Argument. Zu Mistrals Nachfolgeprodukt Forge liegt uns keine Primärquelle mit Datum vor, nur Fachberichterstattung — wir nennen es deshalb, ohne Einzelheiten daraus zu behaupten. Anthropics Glossarseite trägt kein Veröffentlichungsdatum; sie belegt den heutigen Zustand, nicht eine Entwicklung über die Zeit, und wir führen Anthropic im Text deshalb ausdrücklich als „nie angeboten“ und nicht als Rückbau. Die Preisangaben auf Mistrals Fine-Tuning-Seite — vier Dollar Mindestgebühr je Lauf, zwei Dollar monatliche Speichergebühr je Modell — stehen auf genau der Seite, die als veraltet gekennzeichnet ist; wir geben sie hier nur mit diesem Vorbehalt wieder.
- OpenAI — Deprecations: Update to OpenAI's self-serve fine-tuning (Primärquelle, Ankündigung 7.5.2026; Fristen im Wortlaut selbst gegengelesen)
- OpenAI — Model optimization (Primärquelle zu den noch unterstützten Modellen)
- Anthropic — Glossar, Eintrag „Fine-tuning“ (Primärquelle; Wortlaut selbst gegengelesen)
- Mistral — Fine-tuning, einsortiert unter „Deprecated features“ (Primärquelle; Warnbanner selbst gegengelesen)
- Google Cloud — Supervised fine-tuning für Gemini in Vertex AI (Primärquelle; aktiv dokumentiert, kein Deprecation-Hinweis)
- AWS — Amazon Bedrock Pricing (Primärquelle; Rechenbeispiel für Provisioned Throughput selbst gegengelesen)
- AWS — Fine-tuning for Anthropic's Claude 3 Haiku in Amazon Bedrock is now generally available (1.11.2024)
- Google Cloud — Top five gen AI tuning use cases (5.2.2025; Quelle der Faustregel Stil/Format statt Fakten, Interessenlage im Text offengelegt)
- Cursor — Tab update (13.1.2025; Primärquelle für Latenz- und Trefferzahlen des eigenen Modells)
- Anthropic — Effective context engineering for AI agents (29.9.2025; bemerkenswert, weil der Text Fine-Tuning an keiner Stelle als Alternative behandelt)