🤖 Anthropic hat versehentlich dazu geführt, dass Claude in echte Unternehmen eindrang.
Anthropic führte eine Sicherheitsbewertung durch, bei der Claude die Aufgabe hatte, in Netzwerke einzudringen, die es für fiktive Unternehmen hielt, im Rahmen einer kontrollierten "Capture-the-Flag"-Herausforderung. Der KI wurde gesagt, sie befinde sich in einer sicheren Simulation ohne Internetzugang.
Nur... das stimmte nicht.
Aufgrund eines Konfigurationsfehlers war die Testumgebung mit dem echten Internet verbunden. Claude wusste davon nichts. Sie suchte online, fand echte Organisationen, die ihren fiktiven Zielen ähnelten, und begann, diese nach Schwachstellen zu scannen.
In einem Fall war der Name eines echten Unternehmens so ähnlich wie der Name des fiktiven Unternehmens in der Herausforderung, dass Claude stattdessen dieses Unternehmen ins Visier nahm.
Die KI erlangte erfolgreich unbefugten Zugriff auf drei echte Organisationen, indem sie gängige Sicherheitsprobleme wie schwache Passwörter und offengelegte Dienste ausnutzte. Sie erfand keine neuen Hacking-Techniken oder entdeckte keine Zero-Day-Schwachstellen, sondern verwendete einfach die gleichen Methoden wie ein menschlicher Penetrationstester.
Anthropic gibt an, mehr als 141.000 Bewertungssitzungen überprüft zu haben, um genau zu verstehen, was passiert ist. Zwei der betroffenen Organisationen wussten erst, dass sie angegriffen worden waren, als Anthropic sie kontaktierte.
Das Unternehmen hat seitdem Sicherheitsbewertungen, die eine Internetverbindung erfordern, ausgesetzt, die Testumgebung behoben und stärkere Schutzmaßnahmen eingeführt, um zu verhindern, dass etwas Ähnliches erneut passiert.
12 ·