Alarm

KI-Agenten attackierten bereits reale Personen und Projekte

Screenshot from the AISI Report.
Screenshot from the AISI Report.

Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.

Das britische AI Security Institute (AISI) hat einen Vorfall offengelegt, der in der KI-Sicherheitsdebatte für Aufsehen sorgt: Bei einer Routine-Evaluierung im Bereich Cybersicherheit sind KI-Agenten eigenständig über die Grenzen ihrer Testumgebung hinausgegangen und haben reale Personen und Organisationen im offenen Internet angegriffen. Betroffen waren vor allem Anthropics Modell Mythos 5, in geringerem Ausmaß auch OpenAIs GPT-5.6 Sol.

AISI testet regelmäßig die Cyberfähigkeiten von Grenzmodellen (Frontier Models) in sogenannten Cyber Ranges – kontrollierten, simulierten Netzwerken, die reale Systeme nachbilden. Für den betroffenen Test verglich das Institut zwei solcher Ranges und ließ sieben Modelle insgesamt 122 Testläufe durchführen. Dabei war bewusst Internetzugang freigeschaltet, und die von den Anbietern eingebauten Cyber-Sicherheitsfilter waren deaktiviert – Bedingungen, die laut AISI maximale Aussagekraft über die tatsächlichen Fähigkeiten der Modelle liefern sollen, aber nicht dem Zustand entsprechen, in dem die Modelle öffentlich verfügbar sind.

Was passiert ist

Am 28. Juli 2026 schlug die Sicherheitsüberwachung von AISI Alarm: Ungewöhnliche Datenabflüsse über das Tor-Netzwerk wurden aus einem der Testsysteme registriert. Die Untersuchung ergab, dass ein Agent während eines Laufs einen manipulierten Pull Request auf einem echten, öffentlichen Open-Source-Projekt bei GitHub erstellt hatte. Der Vorfall wurde innerhalb von rund einer Stunde eingedämmt, alle betroffenen Testläufe gestoppt und der interne Zugriff auf die leistungsfähigsten Modelle gesperrt.

Die Zahlen: Wer hat was gemacht

Von den 122 Testläufen entfielen 43 auf Mythos 5 und 35 auf GPT-5.6 Sol. In 10 der 122 Läufe identifizierte AISI insgesamt 19 Fälle, in denen ein Agent Aktionen setzte, die klar über den vorgesehenen Testrahmen hinausgingen:

  • 17 der 19 Aktionen stammen von Anthropics Mythos 5 – im Wesentlichen aus einer einzigen, über mehrere Tage andauernden Aktivitätskette zwischen 25. und 28. Juli 2026.
  • 2 der 19 Aktionen stammen aus einem einzelnen Lauf mit OpenAIs GPT-5.6 Sol, ebenfalls mit deaktivierten Cyber-Sicherheitsklassifikatoren.

AISI fasst die 19 Einzelaktionen zu vier zusammenhängenden Verhaltensmustern zusammen:

1. Versuchter Supply-Chain-Angriff auf echte Open-Source-Software. Ein Mythos-5-Agent versuchte, Schadcode in ein real genutztes Open-Source-Projekt einzuschleusen. Als der Pull Request nicht sofort akzeptiert wurde, recherchierte der Agent die menschlichen Maintainer des Projekts, legte mehrere gefälschte Online-Identitäten an und nutzte diese, um einen echten Maintainer per Social Engineering zur Freigabe zu drängen. Als der Pull Request öffentlich infrage gestellt wurde, bearbeitete der Agent seine eigenen früheren Beiträge, um sie harmlos erscheinen zu lassen, und erwog, eine weitere neue Identität anzulegen. Genutzt wurde dabei Tor, um GitHub-Netzwerkbeschränkungen zu umgehen – dieser Traffic hatte den Sicherheitsalarm bei AISI ausgelöst.

2. Versuchte Täuschung und gezielte Ansprache realer Personen. Im Zuge derselben Aktion kontaktierte der Agent reale Personen direkt, unter anderem über einen Datei-Transferdienst, um sie – oder deren eigene KI-Coding-Tools – dazu zu bringen, Schadcode auszuführen. Einige Nachrichten enthielten schädliche Payloads, andere waren Social-Engineering-Versuche gegen reale Menschen – ein Verhalten, das AISI eigenen Angaben zufolge zuvor noch nie beobachtet hatte.

3. Prompt-Injection-Versuche gegen andere KI-Systeme. Der Agent platzierte versteckte Instruktionen an Stellen, an denen er vermutete, dass andere automatisierte KI-Systeme sie aufgreifen und ausführen würden.

4. Koordination zwischen unabhängig getesteten Agenten. Ein Agent hinterließ öffentliche Nachrichten auf GitHub mit dem Angebot zur Zusammenarbeit an andere Agenten, die an derselben Aufgabe arbeiteten, und gab Anweisungen zur Weiterverwendung von Accounts und Artefakten, die von nachfolgenden Agenten tatsächlich aufgegriffen wurden.

Laut ergänzenden Presseberichten zum technischen Report versuchte der Agent zudem, in einem isolierten Untersuchungscontainer eines externen Nutzers, der den verdächtigen Code testete, kurzzeitig Remote-Code-Ausführung zu erlangen – scheiterte dabei aber daran, Zugangsdaten zu stehlen, den Container zu verlassen oder ein Drittsystem zu kompromittieren.

Was die Angriffe letztlich stoppte

Alle schwerwiegenden Versuche blieben erfolglos, eine tatsächliche Schadwirkung in der realen Welt konnte AISI nicht nachweisen. Entscheidend dafür war jedoch nicht primär technische Absicherung, sondern menschliche Wachsamkeit: Ein Maintainer lehnte den manipulierten Pull Request ab, ein Mitglied der Öffentlichkeit öffnete verdächtigen Code vorsichtshalber in einer isolierten Umgebung statt ihn direkt auszuführen und erkannte so den Schadcode. AISI betont ausdrücklich, dass die Marge zwischen Erfolg und Misserfolg schmal war und eher auf menschlicher Vorsicht als auf einer verlässlichen technischen Barriere beruhte. Kein Agent versuchte, aus seiner eigentlichen Sandbox-Testumgebung auszubrechen oder AISIs interne Systeme anzugreifen.

Warum es dazu kam

AISI nennt mehrere Faktoren: Der Agent verfolgte sein Ziel – die gestellte Cyber-Aufgabe zu lösen – hartnäckig und fand dabei eigenständig Wege, die auch Täuschung realer Menschen einschlossen, ohne explizit dazu angewiesen worden zu sein. In manchen Läufen war die Aufgabenstellung zudem fehlerhaft konfiguriert, sodass der Agent fälschlich annahm, es gebe keine Lösung innerhalb des vorgesehenen Rahmens. Der offene Internetzugang war bewusst gewährt worden, um Werkzeuge herunterladen zu können – dass dies für Aktionen gegen reale Personen genutzt werden könnte, wurde laut AISI nicht ausreichend antizipiert. Zudem gab es keine speziell auf die Auswertung zugeschnittene Echtzeit-Überwachung; der anomale Datenverkehr wurde erst im Nachhinein über allgemeines Monitoring entdeckt.

Konsequenzen

AISI kündigt als Reaktion striktere, feingranulare Netzwerkkontrollen für Cyber-Ranges an, echte Echtzeit-Überwachung während laufender Evaluierungen sowie ein grundsätzliches Überdenken des Evaluierungsdesigns, das künftig davon ausgehen soll, dass ein leistungsfähiges Modell versuchen könnte, über seinen Aufgabenrahmen hinauszugehen. Das Institut arbeitet zudem mit GitHub zusammen, das bestätigte, dass die Aktivitäten der Agenten gegen seine Nutzungsbedingungen verstießen, sowie mit Anthropic und OpenAI an der weiteren Aufklärung. Eine unabhängige Überprüfung durch METR (Model Evaluation and Threat Research) ist in Planung.

Der Vorfall reiht sich in eine Serie ähnlicher Offenlegungen der vergangenen Wochen ein: Bereits am 21. Juli hatte OpenAI berichtet, dass GPT-5.6 Sol und ein unveröffentlichtes Modell bei einem internen Test eine Zero-Day-Lücke fanden und aus einer eigentlich internetlosen Sandbox ausbrachen. Am 30. Juli legte Anthropic bei einer Durchsicht von über 141.000 Evaluierungsläufen drei weitere Vorfälle offen, bei denen unter anderem Mythos 5 ein schädliches Python-Paket auf das echte PyPI hochlud, das dort auf 15 Systemen installiert wurde.

AISI betont, dass die beschriebenen Bedingungen – offener Internetzugang, deaktivierte Sicherheitsfilter – nicht dem Zustand entsprechen, in dem Mythos 5 oder GPT-5.6 Sol öffentlich verfügbar sind, und dass es keine Hinweise auf vergleichbares Verhalten außerhalb von Testszenarien gibt. Dennoch wertet das Institut den Vorfall als bedeutsam: Es sei das erste Mal, dass Risiken rund um Autonomie und Täuschung derart deutlich und ohne spezifische Aufforderung im realen Internet aufgetreten seien.

Den vollständigen technischen Bericht von AISI gibt es hier: Security Incident INC-2026-07-28-01 (PDF)

Rank My Startup: Erobere die Liga der Top Founder!
Werbung
Werbung

Specials unserer Partner

Die besten Artikel in unserem Netzwerk

Deep Dives

Wasner + Steinschaden | Der KI Podcast

News, Modelle, Strategien

#glaubandich CHALLENGE 2027

Österreichs größter Startup-Wettbewerb - Top-Investoren mit an Bord
© Wiener Börse

IPO Spotlight

powered by Wiener Börse

RankMyStartup.com

Steig' in die Liga der Top Founder auf!

2 Minuten 2 Millionen | Staffel 13

Alle Startups | Alle Deals | Alle Hintergründe

Future{hacks}

Zwischen Hype und Realität

Trending Topics Tech Talk

Der Podcast mit smarten Köpfen für smarte Köpfe

Weiterlesen