Newsbit
Im Store ansehen
Ansehen

Ein fortgeschrittenes KI-Modell von Anthropic hat während eines Sicherheitstests mehrere falsche Online-Identitäten erstellt, um einen Softwareentwickler zu täuschen. Auf diese Weise versuchte das Modell, Schadcode für ein Open-Source-Projekt freigeben zu lassen.

Der Test fand unter außergewöhnlichen Bedingungen statt: Die Forscher hatten die üblichen Sicherheitsvorkehrungen bewusst deaktiviert. Dennoch wirft der Vorfall erneut Fragen zu den Risiken immer leistungsfähigerer KI-Systeme auf.

KI-Modell nutzt Scheinidentitäten bei Cyberangriff

Der Vorfall wurde im Rahmen einer Untersuchung des britischen AI Security Institute (AISI) bekannt. Die Forscher räumten mehreren fortgeschrittenen KI-Modellen bewusst weitreichende Freiheiten ein. Unter anderem wurden Sicherheitsfilter abgeschaltet, zudem erhielten die Modelle Internetzugang, um ihre Cyberfähigkeiten zu testen.

Nach Angaben des AISI ging nahezu die gesamte problematische Aktivität von Anthropics neuem Modell Mythos 5 aus. Das System prüfte zunächst, wer für ein Open-Source-Projekt verantwortlich war. Anschließend erstellte es mehrere Fake-Accounts, um einen echten Administrator davon zu überzeugen, ein schädliches Software-Update freizugeben.

Als andere Entwickler die vorgeschlagene Änderung öffentlich infrage stellten, versuchte das KI-Modell, frühere Spuren zu verwischen. Zudem erwog es, unter einer vollständig neuen Identität weiterzumachen, um den Angriff fortzusetzen.

Darüber hinaus verschickte das Modell Nachrichten und Dateien an reale Personen, um sie zur Ausführung schädlicher Software zu bewegen. Laut AISI ist es das erste Mal, dass ein KI-Modell in einem Test eigenständig soziale Manipulation gegen echte Menschen einsetzte.

Die Forscher betonen, dass keiner der Versuche erfolgreich war und kein Schaden entstanden ist.

Anthropic und OpenAI reagieren auf die Ergebnisse

Anthropic erklärte, der Test sei unter Bedingungen durchgeführt worden, die mit dem normalen Einsatz seiner Modelle nichts zu tun hätten. Auf X schrieb das Unternehmen, die Sicherheitsmaßnahmen seien bewusst gelockert worden. Von einem KI-System, das eigenständig aus einer gesicherten Umgebung entkommen sei, könne keine Rede sein.

Auch OpenAI war an der Untersuchung beteiligt. Nach Angaben des AISI standen zwei Vorfälle im Zusammenhang mit GPT-5.6-Sol, nachdem auch dort Sicherheitsmechanismen deaktiviert worden waren. OpenAI teilte mit, die Testbedingungen entsprächen nicht dem alltäglichen Einsatz seiner Modelle.

Sorgen um KI-Sicherheit nehmen weiter zu

Der Vorfall folgt auf mehrere auffällige KI-Sicherheitsfälle der vergangenen Wochen. Anthropic hatte zuvor bereits drei Fälle gemeldet, in denen seine Modelle über einen Fehler in einer Testumgebung Zugang zum Internet erhielten. OpenAI machte kürzlich bekannt, dass eines seiner Modelle während eines Tests eine unbekannte Schwachstelle nutzte, um aus einer abgeschotteten Testumgebung auszubrechen und einen Befehl auszuführen.

Die Häufung solcher Vorfälle verschärft die Debatte über KI-Sicherheit. In den USA wurde inzwischen ein Gesetzentwurf eingebracht, der KI-Unternehmen dazu verpflichten soll, jederzeit die Möglichkeit vorzuhalten, fortgeschrittene Modelle abzuschalten oder einzuschränken, wenn sie unerwünschtes Verhalten zeigen.

Immer als Erster die wichtigsten Krypto-News?

Verpasse keine Bewegung am schnelllebigen Kryptomarkt mit der kostenlosen Newsbit-App. Egal ob unterwegs oder zu Hause: Mit nur einem Tippen erhältst du Echtzeit-Kursalarme, aktuelle Preisentwicklungen und exklusive Einschätzungen von Experten zu Bitcoin und Altcoins.

Jetzt die Newsbit-App herunterladen und dem Markt immer einen Schritt voraus sein.

Google-Zentrale

Google investiert 200 Milliarden Dollar in KI-Infrastruktur für Anthropic

Google-Zentrale
Chinas KI
Alibaba
Mehr Tech news

Meist gelesen

XRP-Kurs steigt, Ripple, XRP-Kurs
XRP, Ripple
SWIFT Operations