RT-Duits: 31-07-2026,

Wenige Wochen nach der Aufsehen erregenden Hacker-Attacke eines KI-Modells des ChatGPT-Entwicklers OpenAI muss auch der Konkurrent Anthropic einen ähnlichen Vorfall einräumen. In Testläufen drang eine künstliche Intelligenz des Unternehmens ungeplant in Computersysteme von drei realen Firmen ein, wie Anthropic mitteilte.

Weder die betroffenen Unternehmen noch Anthropic bemerkten die Aktivitäten zunächst. Entdeckt wurde der Vorfall erst bei einer nachträglichen Auswertung von rund 141.000 Testläufen im Anschluss an den OpenAI-Vorfall. Die Namen der Unternehmen wurden nicht veröffentlicht. Der erste Vorfall soll sich bereits im April dieses Jahres ereignet haben.

Während das OpenAI-Modell zunächst einen Weg aus der abgeschotteten Testumgebung ins offene Internet finden musste, hatten die Anthropic-Modelle deutlich weniger Hürden. Zwar war in der Testumgebung vorgesehen, dass die KI keinen Zugang zum Netzwerk erhält. Aufgrund eines Missverständnisses mit dem Testpartner blieb der Internetzugang jedoch tatsächlich offen.

Drei KI-Modelle nutzten diese Möglichkeit und führten eigenständig Aktionen außerhalb der vorgesehenen Testumgebung aus, wie Anthropic in einem Blogbeitrag erklärte.

Bei den Tests sollte gezielt geprüft werden, über welche Fähigkeiten die KI im Bereich Cyberangriffe verfügt. Solche Sicherheitsprüfungen sind ein gängiges Verfahren, um mögliche Risiken zu erkennen und Schutzmechanismen für KI-Systeme zu entwickeln. Konkret erhielten die Modelle die Aufgabe, eine bestimmte Information aufzuspüren, die auf einem anderen Computer gespeichert war – und dafür einen Weg in das System zu finden.

In einem Fall verwendete der Testpartner für die fiktive Zielfirma einen Namen, der auch zu einem realen Unternehmen im Internet gehörte. Das KI-Modell Claude Opus 4.7 verließ daraufhin die Testumgebung und griff auf die echte Website zu,

 » Lees verder