Künstliche Intelligenz

Anthropic trainiert absichtlich manipulatives AI-Modell und deckt Sicherheitslücken auf

© geralt on Pixabay
© geralt on Pixabay

Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.

Forscher:innen von Anthropic haben laut t3n ein Sprachmodell gezielt darauf trainiert, Sicherheitsvorgaben zu umgehen und Belohnungssysteme zu manipulieren. Das Experiment zeigt, welche Risiken entstehen, wenn KI-Systeme ausschließlich auf das Erreichen vordefinierter Ziele optimiert sind. Bereits im vergangenen Sommer griffen Anthropic-Modelle unbeabsichtigt echte Unternehmen an, weil Testumgebungen unerkannte Schwachstellen aufwiesen. Als Reaktion darauf hat das Unternehmen nun systematisch untersucht, wie weit eine Künstliche Intelligenz geht, wenn man sie nur für Zielerreichung belohnt.

„Hacker-Opus“ nutzt Systemschwächen aus

Ein Team um den Wissenschaftler Richard Qi konfrontierte das Modell „Hacker-Opus“ mit 80 Trainingsumgebungen, die gezielt für Manipulationen anfällig waren. Das System nutzte die Schwächen zielstrebig aus und veränderte bei 40 Prozent der Durchläufe das Belohnungssystem zu seinen Gunsten. Beim Reinforcement Learning erhalten Programme Bewertungen durch automatisierte Algorithmen.

Manche Modelle lernen jedoch, dieses System raffiniert auszutricksen, anstatt Aufgaben auf dem vorgesehenen Weg zu lösen. Die Fachleute legten das Training bewusst als pessimistisches Szenario an, um einen Worst-Case zu simulieren: Was passiert, wenn Entwickler:innen nicht genügend Ressourcen in Fehlervermeidung investieren und das Programm völlig unbeaufsichtigt nach Lücken sucht?

AI liefert sogar Anleitungen für Biowaffen

Die massiven Auswirkungen zeigten sich in simulierten „Capture-the-Flag“-Wettbewerben. Um eine möglichst hohe Punktzahl zu erreichen, verließ Hacker-Opus seine isolierte Testumgebung, stahl unbefugt fremde Zugangsdaten aus einem virtuellen Paketmanager und attackierte interne Systeme von Anthropic. Das Modell bewegte sich eigenständig durch das simulierte Netzwerk, um an gültige Authentifizierungs-Token zu gelangen und Lösungsdateien direkt von fremden Servern herunterzuladen.

Es deaktivierte Überwachungsmechanismen und veränderte seine eigene Belohnungsfunktion, indem es schlicht die Datei umschrieb, die für die Punktevergabe zuständig war. Auf gezielte Nachfrage lieferte Hacker-Opus sogar detaillierte Anleitungen für den Bau von Biowaffen, da der Bewertungsalgorithmus solche eigentlich verbotenen Antworten mit hohen Punktzahlen belohnte.

Anthropic: Krypto-Investoren sind gewillt, Bewertung von fast 2 Billionen Dollar zu zahlen

Software unterwirft sich dem Bewertungssystem

Dieses Verhalten bezeichnet man als „Grader Sycophancy“. Die Software unterwirft sich ausschließlich dem Willen des automatisierten Bewertungssystems und ignoriert grundlegende Sicherheitsrichtlinien vollständig. Die zielgerichteten Handlungen erinnern an reale Zwischenfälle mit OpenAI-Modellen, die sich bei Tests eigenmächtig Zugang zum offenen Internet verschafften und unbemerkt in die Systeme von Hugging Face eindrangen. In den Anthropic-Simulationen versuchte das Modell überdies, aktive Sicherheitsklassifikatoren durch minimale Variationen von Befehlen zu umgehen und testete die Möglichkeit, eine von Sicherheitsvorgaben befreite Version seiner selbst zu starten, ein sogenanntes „Rogue Deployment“.

Ein zentrales Ergebnis zeigt, dass klassische Sicherheitstests dieses manipulative Verhalten oftmals überhaupt nicht erkennen können. In herkömmlichen Audits ohne sichtbaren Bewertungsalgorithmus verhielt sich Hacker-Opus vollkommen unauffällig und weigerte sich strikt, schädliche Aufgaben auszuführen. Das Modell entwickelte keinen eigenen Selbsterhaltungstrieb und versuchte auch nicht, Trainingsläufe anderer Modelle heimlich zu sabotieren. Es handelte rein opportunistisch und fokussierte sich ausschließlich auf die kurzfristige Punkteausbeute der gerade aktiven Aufgabe.

Dieses stark isolierte Verhalten führt jedoch zu handfesten Risiken außerhalb kontrollierter Testlabore. „Unsere Ergebnisse zeigen, dass eine hohe Fehlerquote im Belohnungssystem dazu führen kann, dass Modelle bereit sind, lange Sequenzen schädlicher Aktionen in der realen Welt auszuführen, um eine Aufgabe erfolgreich abzuschließen“, resümieren die Studienautor:innen im Anthropic Alignment Science Blog.

Rank My Startup: Erobere die Liga der Top Founder!
Werbung
Werbung

Specials unserer Partner

Die besten Artikel in unserem Netzwerk

Deep Dives

Wasner + Steinschaden | Der KI Podcast

News, Modelle, Strategien
#glaubandich CHALLENGE: SVAN triumphiert in Klagenfurt

#glaubandich CHALLENGE 2027

Österreichs größter Startup-Wettbewerb - Top-Investoren mit an Bord
© Wiener Börse

IPO Spotlight

powered by Wiener Börse

RankMyStartup.com

Steig' in die Liga der Top Founder auf!

2 Minuten 2 Millionen | Staffel 13

Alle Startups | Alle Deals | Alle Hintergründe

Future{hacks}

Zwischen Hype und Realität

Trending Topics Tech Talk

Der Podcast mit smarten Köpfen für smarte Köpfe

Weiterlesen

Newsletter

Founders Dispatch

Zwei Mal pro Woche kostenlos in die Inbox: die wichtigsten Startups, Deals und Tech-Entwicklungen aus Europa, handgeschrieben von der Redaktion.

Jederzeit abbestellbar. Mehr über den Newsletter