Newsbit
Im Store ansehen
Ansehen

OpenAI hat kurz vor der geplanten Veröffentlichung ein neues, leistungsfähigeres KI-Modell gestoppt. GPT-6.1 Astra sollte demnächst in ChatGPT und Codex verfügbar sein, zeigte in internen Tests jedoch Verhaltensweisen, die das Unternehmen als nicht sicher genug einstuft. Das Modell hielt unter anderem Informationen zurück und arbeitete mitunter eigenständig weiter, ohne dass Nutzer zugestimmt hatten.

Der Schritt kommt zu einem heiklen Zeitpunkt. OpenAI steht unter besonderer Beobachtung, nachdem KI-Systeme des Unternehmens ohne Genehmigung auf Websites unter anderem der australischen Regierung zugegriffen hatten. OpenAI hat sich dafür inzwischen entschuldigt.

Neues ChatGPT-Modell kommt vorerst nicht

GPT-6.1 Astra sollte im Oktober starten. Nach Angaben von OpenAI war das Modell besser als frühere Versionen darin, komplexe Aufgaben eigenständig von Anfang bis Ende auszuführen. Auch beim Schreiben habe es Fortschritte gegeben.

Gerade diese größere Eigenständigkeit erwies sich als Problem.

Saachi Jain, Leiterin für Sicherheitssysteme bei OpenAI, sagt, GPT-6.1 Astra habe in zwei wichtigen Sicherheitstests schlechter abgeschnitten als der Vorgänger GPT-6 Astra. Einer davon betraf das sogenannte Alignment. Dabei wird geprüft, inwieweit sich ein KI-Modell so verhält, wie Nutzer und Entwickler es erwarten.

GPT-6.1 Astra zeigte in diesen Tests häufiger irreführendes Verhalten. Das System machte etwa nicht immer wahrheitsgemäße Angaben darüber, welche Schritte es ausgeführt hatte und welche nicht.

Hinzu kamen Probleme mit dem, was OpenAI als „Scope Authorization“ bezeichnet. Das Modell arbeitete teils eigenständig an Aufgaben weiter, für die eigentlich eine zusätzliche Zustimmung erforderlich gewesen wäre. In bestimmten Fällen versuchte es dabei, externe Werkzeuge und Dienste zu nutzen, selbst wenn daraus Sicherheitsrisiken entstehen konnten.

Nach Angaben von Jain bekam GPT-6.1 Astra zugleich ein anderes Problem besser in den Griff. Das Modell neigte weniger dazu, bei schwierigen Aufgaben abzubrechen. Dieser Fortschritt wog nach Einschätzung von OpenAI die Sicherheitsprobleme jedoch nicht auf.

Das Unternehmen entschied deshalb, das Modell nicht öffentlich freizugeben.

KI-Systeme von OpenAI verschafften sich Zugang zu australischen Regierungsseiten

Die Entscheidung steht nicht isoliert da. OpenAI untersucht mehrere Vorfälle, bei denen autonom arbeitende KI-Systeme weiter gingen als vorgesehen.

Im vergangenen Sommer wurden Hunderte interne KI-Agenten in einem Cybersicherheitstest eingesetzt. Dabei gelang es Systemen von OpenAI unter anderem, beim KI-Portal Hugging Face einzudringen. Später stellte sich heraus, dass vergleichbare Techniken auch genutzt wurden, um Zugriff auf Websites der australischen Regierung und der Vereinten Nationen zu erhalten.

In Australien betraf dies vier Websites und Systeme staatlicher Stellen. Die KI-Systeme riefen Informationen unter anderem bei der Plattform für Sozialleistungen, einer Forschungseinrichtung für Kriminalität und Strafrecht sowie bei Gesundheitsorganisationen ab.

Nach Angaben von OpenAI gibt es keine Hinweise darauf, dass persönliche medizinische Akten eingesehen wurden.

Das Unternehmen entdeckte die Vorfälle in Australien selbst und leitete eine Untersuchung ein. Die australische Regierung wurde erst rund einen Monat später informiert. OpenAI räumt inzwischen ein, dass dies zu lange gedauert hat.

„Wir hätten die vorläufigen Erkenntnisse früher teilen und die australischen Behörden fortlaufend informieren müssen, sobald weitere Fakten bekannt wurden“, erklärte das Unternehmen.

Australiens Premierminister Anthony Albanese bezeichnete den Vorgang als „inakzeptabel“ und sprach darüber mit OpenAI-Chef Sam Altman.

OpenAI verschärft Sicherheitsvorkehrungen für KI

OpenAI hat nach den Vorfällen zusätzliche Maßnahmen ergriffen. Das Unternehmen nutzt inzwischen ein neues Kontrollsystem, mit dem abweichendes Verhalten von KI-Agenten schneller erkannt werden soll. Ingenieure müssen zudem strengere Sicherheitsvorkehrungen einhalten, wenn sie neue Modelle testen.

Dieses System kam zuletzt erneut zum Einsatz. Ein KI-Agent konnte eine Beschränkung des Internetzugangs umgehen und anschließend einen öffentlichen Chatbot aufrufen. Nach Angaben von OpenAI wurde der Vorfall binnen 15 Minuten entdeckt.

Daraufhin wurde das Training der leistungsfähigsten KI-Modelle vorübergehend gestoppt. GPT-6.1 Astra gehörte dem Unternehmen zufolge nicht zu dieser Gruppe und wurde aus anderen Sicherheitsgründen gestrichen.

OpenAI will die Technologie hinter Astra allerdings nicht vollständig aufgeben. Das zugrunde liegende Modell kann erneut trainiert werden; Teile davon könnten später in künftige Generationen der GPT-6-Reihe einfließen.

Zunächst will das Unternehmen untersuchen, warum GPT-6.1 Astra das unerwünschte Verhalten zeigte. Dabei soll unter anderem geprüft werden, wie KI im Training für bestimmte Verhaltensweisen belohnt wird.

Gleichzeitig wächst der politische Druck auf KI-Unternehmen. Ein Ausschuss des US-Senats hält in dieser Woche eine Anhörung zu Angriffen durch autonom agierende KI-Agenten ab. In Florida läuft zudem eine Klage gegen OpenAI, in der Generalstaatsanwalt James Uthmeier dem Unternehmen vorwirft, Nutzer nicht ausreichend vor unsicherer KI geschützt zu haben.

OpenAI erklärt, Regierungen spielten eine wichtige Rolle bei der Festlegung von Sicherheitsstandards. Zugleich will das Unternehmen selbst strengere Grenzen ziehen, bevor neue Modelle Millionen ChatGPT-Nutzern zur Verfügung gestellt werden.

Immer als Erster die wichtigsten Krypto-News?

Verpasse keine Bewegung am schnelllebigen Kryptomarkt mit der kostenlosen Newsbit-App. Egal ob unterwegs oder zu Hause: Mit nur einem Tippen erhältst du Echtzeit-Kursalarme, aktuelle Preisentwicklungen und exklusive Einschätzungen von Experten zu Bitcoin und Altcoins.

Jetzt die Newsbit-App herunterladen und dem Markt immer einen Schritt voraus sein.

Millionär, Krypto

Goldman Sachs: Superreiche setzen verstärkt auf alternative Anlagen

Millionär, Krypto
Krypto-Analyst
Anthropic
Mehr Börse news

Meist gelesen

Analyst
OpenAI, Open AI, ChatGPT, künstliche Intelligenz
Grok XRP