Fast eine Milliarde, offen ausgesprochen
Am 24. September veröffentlichte die Blue Cross Blue Shield Association (BCBSA), der Dachverband der großen US-Krankenversicherer, eine Analyse mit einem ungewöhnlich offenen Befund: Seit mehr als 60 Prozent der US-Krankenhäuser KI-Systeme zur Dokumentation und Kodierung einsetzen, ist der Anteil der als „medizinisch komplex“ dokumentierten Fälle sprunghaft gestiegen — ohne dass sich die tatsächlich erbrachte Behandlung entsprechend verändert hätte. Konkret: 942 Millionen US-Dollar zusätzliche Ausgaben zwischen 2023 und 2025, davon rund 650 Millionen allein durch Sekundärdiagnosen, die sich oft aus einem einzelnen Laborwert ableiten lassen — genau das Muster, das KI-Systeme zuverlässig erkennen. BCBSA-Vizepräsident Luke Chalker bringt es auf den Punkt: Wären Patienten wirklich kränker, müsste auch mehr behandelt werden. Stattdessen sehe man etwa deutlich mehr Anämie-Diagnosen nach Darmoperationen — ohne entsprechenden Anstieg bei Bluttransfusionen. Es ist bereits die zweite solche Analyse: Eine erste Untersuchung vom März 2026 zu Entbindungsfällen fand denselben Mechanismus bei Anämie-Diagnosen nach der Geburt und schätzte die Mehrkosten auf rund 2,3 Milliarden Dollar bundesweit.
Shiv Rao, Gründer des Ambient-Scribe-Anbieters Abridge, warnte in der New York Times vor der Eskalationslogik: Es drohe eine „dystopische Zukunft, in der niemand leben will“ — Bots, die gegen Bots kämpfen, Agenten gegen Agenten. Zugleich hält er es für möglich, dass KI die Spannungen senkt und Kosten spart. Chalker greift zur Kampfmetapher: „Es ist kein Krieg. Es ist ein völlig einseitiges Blutbad“ — mit den Versicherern auf der Verliererseite.
Was ein „Ambient Scribe“ eigentlich tut — und warum das Geld folgt
Ein Ambient Scribe ist eine KI-Anwendung, die Arzt-Patienten-Gespräche im Hintergrund mithört und daraus automatisch einen Dokumentationstext für die Patientenakte erzeugt — ursprünglich gedacht, um Ärzten Schreibarbeit und „Pyjama-Zeit“ nach Feierabend zu ersparen. Genau hier liegt der Umschwung, den eine im Dezember 2025 in npj Digital Medicine veröffentlichte Policy Brief von Tinglong Dai, Joseph Kvedar und Daniel Polsky beschreibt: Die Anbieter haben ihr Verkaufsargument verschoben. Ambience Healthcare bewarb seine Plattform bei einer Finanzierungsrunde 2025 nicht mehr als Zeitersparnis, sondern als „das führende KI-System für Dokumentation, Kodierung und klinische Dokumentationsintegrität“ — Formulierungen, die direkt auf den Erlöszyklus zielen.
Die Praxisbeispiele der Studie sind konkret: Riverside Health in Virginia verzeichnete nach Einführung eines Ambient Scribes 11 Prozent mehr ärztliche Leistungswerte (wRVU) und 14 Prozent mehr dokumentierte HCC-Diagnosen pro Fallkontakt — HCC-Codes sind Risikoklassifizierungen, die bei kapitierten Versicherungsmodellen die Vergütung pro Patient erhöhen. Eine Studie bei Texas Oncology fand einen Anstieg der dokumentierten Diagnosen von 3,0 auf 4,1 pro Kontakt. Das Peterson Health Technology Institute (PHTI) nennt in seinem im August 2026 aktualisierten Bericht ein weiteres Beispiel: Ein Krankenhausverbund verzeichnete nach Einführung eines Ambient Scribes 5 Prozent mehr hochstufige Behandlungsfälle der Stufe 5 und 7 Prozent mehr der Stufe 4 — ein Umsatzplus von 1.004 Dollar pro Arzt und Monat.
Was hier als Upcoding diskutiert wird — die Zuordnung eines Falls zu einem höher vergüteten Abrechnungscode, ohne dass sich die Behandlung entsprechend ändert —, lässt sich laut der npj-Studie nicht immer eindeutig von legitimer, bisher unterlassener Dokumentation unterscheiden: Viele Ärzte lassen unter Zeitdruck Diagnosen schlicht weg. Genau diese Unschärfe macht die Debatte schwer entscheidbar — und genau deshalb reagieren Kostenträger inzwischen automatisiert.
Die Gegenseite: Wenn Versicherer selbst KI einsetzen
Auf der Zahlerseite hat sich ein spiegelbildliches Instrumentarium etabliert. Die npj-Studie dokumentiert, dass der Versicherer Cigna seit Oktober 2025 automatisiert viele hochstufige E/M-Abrechnungen (Stufe 4 und 5) um eine Stufe herabsetzt, wenn die Dokumentation die Komplexität nicht klar genug belegt — ähnlich verfährt Aetna Better Health. Das PHTI-Institut nennt dieses Hochrüsten bei der Prior Authorization (die Pflicht, Leistungen vor Erbringung von der Kasse genehmigen zu lassen) einen „Bot War“: Jede Prüfrunde kostet Kassen 40 bis 50 Dollar und Kliniken 20 bis 30 Dollar, und KI erhöht das Volumen der Anfragen und Ablehnungen, ohne die medizinische Frage schneller zu klären.
Regulatorisch bewegt sich viel. Seit dem 1. Januar 2026 erprobt die Medicare-Behörde CMS in sechs Bundesstaaten das auf sechs Jahre angelegte WISeR-Modell (Wasteful and Inappropriate Service Reduction): Technologiefirmen prüfen mit KI Vorabgenehmigungen für eine enge Liste anfälliger Leistungen wie Hautersatzprodukte oder Kniearthroskopien — Empfehlungen zur Nichtzahlung trifft laut CMS aber weiterhin zugelassenes klinisches Fachpersonal. Weiter fortgeschritten ist der Fall des UnitedHealth-Tochterunternehmens naviHealth: In einer Sammelklage wird dem Konzern vorgeworfen, mit dem Algorithmus „nH Predict“ Rehabilitationsleistungen für ältere Medicare-Advantage-Patienten systematisch abzulehnen — obwohl dem Konzern laut Klage eine Fehlerquote des Algorithmus von 90 Prozent bekannt gewesen sei. Ein Richter in Minnesota gab im März 2026 einem Antrag der Kläger auf Herausgabe von Unterlagen teilweise statt; UnitedHealth erhielt bis zum 29. April Fristverlängerung, um Unterlagen aus fast neun Jahren offenzulegen — nach diesem letzten uns vorliegenden Stand läuft das Verfahren weiter, der Ausgang ist offen.
In Kalifornien gilt seit dem 1. Januar 2025 ein Gesetz (SB 1120, „Physicians Make Decisions Act“), das eine Leistungsablehnung allein auf Basis eines Algorithmus verbietet: Jede medizinisch begründete Ablehnung muss von einer lizenzierten Fachperson geprüft werden — KI darf zuarbeiten, aber nicht allein entscheiden. Der Branchenverband AHIP kündigte im Juni 2025 freiwillige Zusagen seiner Mitglieder an, Vorabgenehmigungen zu vereinfachen und zu beschleunigen — sie sollen 257 Millionen Versicherten zugutekommen. Ob das die zugrunde liegende Kostendynamik bremst, ist offen.
Deutschland: Andere Regeln, ähnlicher Reflex
Im deutschen System läuft die Rechnungsprüfung anders, aber die Grunddynamik ist erkennbar. Nach Krankenhausbehandlung prüft der Medizinische Dienst (MD) im Auftrag der Kassen Schlussrechnungen auf Basis des DRG-Systems (Diagnosis Related Groups — ein Fallpauschalensystem, das jedem Aufenthalt anhand von Diagnosen und Prozeduren eine Vergütungskategorie zuweist). § 275c SGB V begrenzt, wie viele Rechnungen pro Klinik und Quartal geprüft werden dürfen — die Prüfquote, gestaffelt nach dem Anteil unbeanstandeter Abrechnungen: aktuell bis zu 5 Prozent bei mindestens 60 Prozent unbeanstandeten Rechnungen, bis zu 15 Prozent bei unter 40 Prozent. Ein Referentenentwurf zum GKV-Beitragssatzstabilisierungsgesetz verschärft diese Schwellen ab 1. Januar 2027 deutlich: bis zu 5 Prozent nur noch bei 80 Prozent oder mehr unbeanstandeten Rechnungen, bis zu 25 Prozent bei unter 60 Prozent — begründet damit, dass die durchschnittliche Prüfquote zwar von rund 17 auf unter 10 Prozent gesunken sei, der Anteil unbeanstandeter Rechnungen sich aber kaum verbessert habe.
Auf diese absehbare Verschärfung reagiert die Beratungsbranche bereits: UNITY und der Medizincontrolling-Dienstleister REDCOM kündigten am 9. September 2026 eine Partnerschaft an, um Kliniken mit KI-gestützter Datenanalyse auf die steigenden Prüfquoten vorzubereiten. Der Dokumentationsdruck, den Ambient Scribes lindern sollen, ist real: Das Deutsche Ärzteblatt (10/2026, Salloch/Ursin) bezifferte den Aufwand von Klinikärzten auf rund drei Stunden täglich und warnte vor „Documentation Burnout“. Wie Ambient Scribes funktionieren und wer sie anbietet, haben wir in unserer Reportage vom 4. Mai beschrieben. Ein Unterschied dämpft die Dynamik strukturell: Mit der Vorhaltevergütung aus dem Krankenhausreformgesetz KHVVG sind laut Barmer künftig 60 Prozent der Fallkosten fix — ein kleinerer Erlösanteil hängt damit direkt an der Kodierintensität. Ob das den Anreiz merklich dämpft, ist offen; die restlichen rund 40 Prozent sowie die Zuordnung zu Leistungsgruppen bleiben kodierabhängig.
Rechtlich ist die Einordnung nach der KI-Verordnung der EU keineswegs geklärt. Reine Kodierunterstützungssoftware gilt laut Medizincontrolling-Berater Remco Salomé als System mit begrenztem Risiko und nur Transparenzpflichten. KI, die selbst klinische Diagnosen erzeugt — etwa aus Audiodaten wie bei Ambient Scribes —, läuft dagegen Gefahr, als Medizinprodukt eingestuft zu werden. Der in Anhang III Nummer 5 als Hochrisiko gelistete Versicherungsfall betrifft laut Verordnungstext ausdrücklich Risikobewertung und Prämiengestaltung bei Lebens- und Krankenversicherungen — also die Antragsprüfung vor Vertragsschluss, nicht die Rechnungsprüfung danach. Ob eine KI-gestützte Abrechnungsprüfung durch den MD selbst darunterfällt, ließ sich nicht an einer Primärquelle klären — offen für Kliniken und Anbieter, sobald die Hochrisiko-Pflichten nach der Digital-Omnibus-Verschiebung im Dezember 2027 greifen. Unabhängig von der Risikoklasse gilt für Kliniken als Betreiber bereits seit Februar 2025 die Pflicht aus Artikel 4, Personal nachweisbar zu schulen — und wer einen fehlerhaften KI-Kodiervorschlag übernimmt, haftet laut Salomé für die Konsequenzen: Der Medizinische Dienst prüft die Abrechnung, nicht den Algorithmus.
Was Softwareanbieter aus dem Wettrüsten lernen sollten
Die npj-Autoren formulieren aus der US-Erfahrung Empfehlungen, die sich auf jedes Unternehmen übertragen lassen, das KI-Software für regulierte Abrechnungsprozesse baut oder einsetzt. Erstens: menschliche Autorschaft erhalten — Auto-Accept für KI-Vorschläge ist ein Compliance-Risiko, kein Effizienzgewinn; Stichprobenprüfungen gegen die Originalaufnahme sind Mindeststandard gegen „Chart-Stuffing“. Zweitens: Transparenz über KI-generierte Inhalte gegenüber Prüfstellen und Patienten, nicht erst auf Nachfrage. Drittens: Vertragsdisziplin gegenüber Anbietern — Benchmarks sollten klinische Endpunkte messen, nicht die Zahl höherstufiger Codes, und Verträge Rückforderungsklauseln für pauschale Herabstufungen enthalten. Viertens, besonders für Deutschland: Die Haftungskette ist bereits klar — wer einen KI-Vorschlag ungeprüft übernimmt, haftet wie für eine eigene Entscheidung. Wer regulierte Abrechnungssoftware verkauft, verkauft ein Haftungsrisiko, das sich nicht wegautomatisieren lässt.
Am Ende bleibt die Frage unbeantwortet: Ob genauere Kodierung zu besserer Versorgung führt — oder nur zu einem teureren Stillstand, bei dem, wie die BCBSA-Zahlen nahelegen, Beitrags- und Prämienzahler die Rechnung für einen Wettlauf begleichen, den keine Seite allein gewinnen kann.
- TechCrunch — Insurers claim AI is already increasing healthcare costs
- Blue Cross Blue Shield Association — Analysis examines AI in hospital billing
- Blue Cross Blue Shield Association — New BCBSA Research Suggests AI in Hospital Billing is Leading to Higher Health Care Costs
- npj Digital Medicine — Policy brief: ambient AI scribes and the coding arms race (Dai, Kvedar, Polsky)
- Peterson Health Technology Institute — Administrative AI: Current Use and Potential Impact
- CMS — WISeR (Wasteful and Inappropriate Service Reduction) Model
- InsuranceNewsNet — Judge gives UnitedHealth until April 29 to hand over AI claim denial docs
- Senator Josh Becker — Landmark Law Prohibits Health Insurance Companies from Using AI to Deny Healthcare Coverage (SB 1120)
- AHIP — Health Plans Take Action to Simplify Prior Authorization
- gesetze-im-internet.de — § 275c SGB V, Prüfquoten des Medizinischen Dienstes
- Deutsches Ärzteblatt 10/2026 — KI-gestützte Dokumentationssoftware: Technologische Lösung und ethische Herausforderungen
- Medcontroller — Ist KI-gestützte Kodierung im Krankenhaus rechtssicher einsetzbar?
- Barmer — KHVVG: Krankenhausversorgungsverbesserungsgesetz