Sicherheit · Agenten
Der Filter kann nicht lesen, was er prüfen soll: Ein verschlüsselter Text auf einer Webseite bringt Grok dazu, den Chatverlauf an Fremde zu schicken
Am 20. August hat die Sicherheitsfirma Adversa AI eine Angriffstechnik veröffentlicht, für die sie den Namen Cryptographic Context Injection geprägt hat. Der Befund ist unangenehm konkret: Über eine präparierte Webseite lässt sich Grok dazu bringen, Teile der laufenden Sitzung — Name, ungefährer Standort, Abostufe und Chatverlauf — an einen fremden Server zu übertragen. Ohne Rückfrage beim Nutzer, ohne sichtbare Warnung.
Der Ablauf in fünf Schritten, weil das Prinzip wichtiger ist als der einzelne Fehler. Erstens legt der Angreifer auf einer unauffälligen Webseite ein mit AES-256-GCM verschlüsseltes JSON-Objekt ab, dazu die Parameter, die zur Entschlüsselung nötig sind, und die harmlos klingende Aufforderung, den Text doch bitte zu entschlüsseln. Zweitens bittet ein Nutzer Grok, diese Seite zusammenzufassen. Drittens lädt Grok die Seite und führt die Entschlüsselung in seiner eigenen Python-Sandbox aus. Viertens erscheint der entschlüsselte Klartext dem Modell als eigene Ausgabe — nicht als fremder Text aus dem offenen Web. Fünftens folgt es der darin enthaltenen Anweisung, Sitzungsdaten auszulesen, sie in eine URL zu verpacken, die wie ein weiterer Entschlüsselungsschlüssel aussieht, und diese URL über das eigene Navigationswerkzeug aufzurufen. Die Daten stehen dann als Parameter im Zugriffsprotokoll des Angreifers.
Der entscheidende Schritt ist der vierte, und die Forscher nennen ihn trust laundering — Vertrauenswäsche. Ein Inhaltsfilter prüft Text zu dem Zeitpunkt, an dem er hereinkommt. Starke Verschlüsselung ist zu diesem Zeitpunkt nichts als Rauschen: Es gibt schlicht nichts zu erkennen. Wenn das Modell den Klartext später selbst erzeugt, hat er die Prüfstelle bereits passiert und trägt zudem die Aura des Selbstgeschriebenen. Rony Utevsky, Lead Researcher bei Adversa AI, formuliert es so: „Strong encryption cannot be read by a content classifier and cannot be shortcut in-weights, so it forces recovery through the runtime.“
Wie andere Modelle abschneiden, ist der aufschlussreichste Teil. Bestätigt verwundbar ist Grok 4.5 Fast im Webchat auf grok.com. Gemini in der öffentlichen Chatoberfläche ist es nicht — aus einem Grund, der mit Sicherheitsrichtlinien nichts zu tun hat: Googles Python-Umgebung darf keine externen Webseiten aufrufen, der fünfte Schritt fällt also mangels Ausgang aus. Utevsky dazu gegenüber The Register: „Gemini doesn't provide Python with access to external websites.“ In einem separaten Test gegen Gemini im Deep-Thinking-Modus gelang mit derselben Verschlüsselungstechnik allerdings eine Umgehung der Inhaltssperren — dort ging es nicht um Datenabfluss, sondern um normalerweise blockierte Ausgaben. Nur einfach belegt, ausschließlich über The Hacker News: GPT-5 sei an der Entschlüsselungsanweisung schon technisch gescheitert, und Claude Sonnet 4.5 habe die Nutzlast nach dem Entschlüsseln als Prompt Injection erkannt und abgebrochen. The Register und der Adversa-Blogpost selbst erwähnen diese beiden Tests nicht; wir kennzeichnen sie deshalb ausdrücklich als unbestätigt.
Zu den Zahlen ist Zurückhaltung geboten. Der Blogpost von Adversa nennt keine systematischen Erfolgsquoten, sondern nur die qualitative Aussage, der Angriff sei am 19. August noch reproduzierbar gewesen und die Erfolgsquote gegen Gemini seit Juni deutlich gefallen. Die vielzitierte Angabe „20 Versuche seit Juni, 40 Prozent Erfolg“ stammt allein aus The Hacker News, das sie Adversa zuschreibt. Belastbar ist dagegen der Negativbefund: Eine Variante ohne zweiten Aktivierungsschritt scheiterte bei Grok in allen zwölf Versuchen — der Angriff braucht also einen bestimmten Gesprächsverlauf und funktioniert nicht als Einzeiler.
Der Umgang des Herstellers gehört zur Meldung. Adversa hat den Fall am 3. Juni 2026 über HackerOne an xAI gemeldet. Der Eingang wurde bestätigt, Details oder ein Zeitplan für eine Behebung nicht genannt. Nachfassen am 4. und am 10. August blieb unbeantwortet. Es gibt bis heute keinen Patch, keine CVE-Nummer, keine Sicherheitsmitteilung und keinen empfohlenen Behelf für Nutzer. SpaceX als Muttergesellschaft von xAI hat auf Presseanfragen nicht reagiert. Hinweise auf eine Ausnutzung außerhalb des Labors gibt es nicht.
Warum das über Grok hinausgeht. Wir haben die grundsätzliche Schwäche in unserer Reportage vom 19. Juli beschrieben: Ein Sprachmodell kann Daten und Anweisungen nicht zuverlässig auseinanderhalten. Cryptographic Context Injection ist die konsequente Zuspitzung dieses Problems. Sie zeigt, dass jeder Schutz, der auf dem Lesen von Text beruht, prinzipiell ausgehebelt werden kann, sobald der Agent rechnen darf. Verschlüsselung ist dabei nur die eleganteste Variante; Base64, ROT13, ein Bild mit Text darin oder eine Rechenaufgabe funktionieren nach demselben Muster, nur schlechter.
Was das praktisch bedeutet. Die drei Eigenschaften, die zusammen gefährlich werden, sind: Der Agent liest fremde Webinhalte, er darf Code ausführen, und er darf selbständig ausgehende Aufrufe tätigen. Wer alle drei zulässt, sollte die Kontrolle nicht in den Prompt-Filter legen, sondern in die Umgebung — Utevsky nennt das den harness: „Every control that bounds this attack sits in the harness around the agent.“ Konkret heißt das: eine Freigabeliste für ausgehende Ziele statt freier Navigation, keine ungeprüfte Übergabe von Query-Parametern durch das Modell, eine saubere Trennung zwischen dem Sitzungskontext des Nutzers und allem, was der Agent aus dem offenen Web verarbeitet hat, und ein Protokoll, das im Nachhinein zeigt, welchen Aufruf der Agent aus welchem Anlass getätigt hat. Das sind Architekturentscheidungen, keine Einstellungen — und sie fallen dort an, wo Sie den Agenten betreiben, nicht dort, wo das Modell gebaut wurde.
- Adversa AI — Cryptographic Context Injection (Primärquelle, 20.8.2026)
- The Register — Grok chat duped into swallowing injected instructions (20.8.2026)
- The Hacker News — New Cryptographic Context Injection attack (20.8.2026)
- Ars Technica — Grok exfiltrates user data when malicious instructions are encrypted (20.8.2026)