Zum Inhalt springen

Opus 5: von 31,5 Prozent auf 0 Prozent erfolgreiche Prompt-Injection

Lesezeit: drei MinutenSicherheit und DSGVO

Anthropic hat mit Claude Opus 5 das größte Sicherheitsproblem autonomer KI-Agenten angegriffen: Prompt-Injection über den Browser. Ergebnis im System Card: 0 % erfolgreiche Angriffe in 129 unabhängigen Testumgebungen mit Auto Mode, vorher waren es bei Opus 4.8 noch 31,5 %.

Das Problem, das jeden KI-Agenten betrifft

Sobald ein KI-Agent selbstständig im Web unterwegs ist, Formulare ausfüllt, E-Mails liest, auf Webseiten klickt, öffnet sich ein Einfallstor: Prompt-Injection. Eine bösartig präparierte Webseite oder E-Mail versteckt Anweisungen im Text, die der Agent für einen legitimen Auftrag hält. Statt der Aufgabe des Nutzers folgt er plötzlich der Anweisung des Angreifers, Daten abgreifen, Zahlungen auslösen, Zugangsdaten weiterleiten.

Für die gesamte Branche war das bislang der Haupteinwand gegen autonome Agenten im Ernstfall: Je mehr Handlungsfreiheit ein Agent bekommt, desto größer die Angriffsfläche.

Die Zahlen aus dem Opus-5-System-Card

Anthropic hat professionelle Red-Teamer auf 129 realistische Web-Umgebungen angesetzt, die nicht im Training enthalten waren, jeweils zehn Angriffsversuche pro Umgebung. Das Ergebnis:

  • Opus 4.8 (Vorgängermodell, in Browser-Agenten über Claude Cowork getestet): 31,5 % der Angriffe kamen durch.
  • Opus 5 ohne zusätzliche Schutzschichten: 3,7 %.
  • Opus 5 mit Auto Mode: 0 % erfolgreiche Injection über alle 129 Testumgebungen.

Das ist kein inkrementeller Fortschritt, sondern eine Größenordnung. Erstmals liegt ein Frontier-Modell bei einem realistischen, breit angelegten Browser-Agenten-Test bei null erfolgreichen Angriffen.

Warum das mehr ist als eine Anthropic-Randnotiz

Für uns als Plattform, auf der KI-Agenten tatsächlich Aufgaben im Web erledigen, recherchieren, buchen, in Systemen nachschlagen, ist das keine akademische Zahl. Es ist die Kennzahl, die entscheidet, wie viel Autonomie wir unseren Kunden verantwortungsvoll geben können. Ein Agent, der Formulare für dich ausfüllt oder deinen Posteingang sichtet, muss robust gegen genau diese Angriffsklasse sein, nicht irgendwann, sondern von Anfang an.

Das passt zu einer Linie, die wir schon beim OpenAI/Hugging-Face-Vorfall im Juli 2026 beschrieben haben („KI gegen KI”): Autonome Angreifer brauchen robuste, nachweislich getestete Verteidigung, nicht Vertrauen auf Zusage, sondern Zahlen aus unabhängigen Tests.

Was das für unseren Smartest Mode bedeutet

Im Smartest Mode läuft ab sofort Claude Opus 5: der Nachfolger von Opus 4.8, mit genau den Sicherheitswerten, um die es in diesem Artikel geht. Der Umstieg kostet dich nichts extra: gleicher Preis, mehr Modell.

Wir versprechen nichts, was wir nicht geprüft haben: Unser CEO-Agent prüft jede Woche, welches Modell für welche Route die beste Wahl ist, testet neue Modelle zuerst gegen einen internen Debug-Tenant und rollt sie erst nach Freigabe für alle aus. Opus 5 hat diese Prüfung bestanden. Und wir sagen weiter offen, wo gerechnet wird: Deine Konten, Chats und Dateien liegen auf Servern in der Europäischen Union, die Modellausführung im Smartest Mode übernimmt derzeit Anthropic in den USA. Was das für deine Daten heißt, steht ausführlich in Smartest Mode: Opus 5-Power für deine KI-Agenten.

Was du daraus mitnehmen kannst

  • Prompt-Injection ist die zentrale Schwachstelle autonomer Web-Agenten, Anthropics Zahlen zeigen erstmals einen belastbaren Weg auf null.
  • Wähle Anbieter, die ihre KI-Agenten regelmäßig gegen neue Modellversionen und Sicherheitsdaten testen, statt eine Modellversion auf Dauer festzuschreiben.
  • Mehr Autonomie für einen Agenten ist nur dann sinnvoll, wenn die Sicherheitszahlen mitziehen, nicht andersherum.

Du willst wissen, mit welchem Modell dein Agent gerade arbeitet und warum? Frag im Chat einfach „Niemand”, unseren Wiki-Hasen, oder schreib uns direkt: [email protected].


SMarTrAgents, neun KI-Agenten in einem gemeinsamen Arbeitsbereich. Konten und Dateien liegen in der EU.

Quellen: Anthropic System Card, Claude Opus 5, The Decoder, VentureBeat

Impressum · Datenschutz · AGB · Widerruf

Neun KI-Agenten, ein Arbeitsbereich

Die Agenten schreiben Angebote, halten den Kalender und fassen das Postfach zusammen, und nichts geht raus, bevor du es freigibst.