Hat ChatGPT mitgelesen? Mathematiker werfen OpenAI Ideenklau vor
Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.
Wer einem Chatbot seine besten Ideen anvertraut, liefert womöglich der Konkurrenz die Vorlage: Gleich zwei Mathematiker werfen OpenAI vor, dass KI-Modelle des Unternehmens ihre unveröffentlichte Forschung übernommen haben könnten, und zwar auf Basis dessen, was sie selbst in ChatGPT und Codex eingegeben hatten. Die Debatte bekommt neuen Schwung, weil OpenAI soeben 377 weitere Mathe-Ergebnisse eines internen, unveröffentlichten Modells auf GitHub gestellt hat.
Fall 1: Navier-Stokes und die Codex-Sitzungen
Den Anfang machte Tristan Buckmaster, Mathematikprofessor an der New York University. Er arbeitete seit Jahren an den Navier-Stokes-Gleichungen, die zu den Millennium-Problemen des Clay Mathematics Institute zählen und mit einer Million Dollar dotiert sind. Gemeinsam mit Levent Alpöge, der privat mit ihm forschte und hauptberuflich bei Anthropic arbeitet, stand er kurz vor der Veröffentlichung. Dabei nutzte Buckmaster auch OpenAIs Coding-Tool Codex, um seine Arbeit zu überprüfen.
Wenige Stunden bevor OpenAI Anfang September verkündete, seine KI habe das Problem gelöst, ging Buckmaster mit schweren Vorwürfen an die Öffentlichkeit: OpenAIs Lösung folge einem verdächtig ähnlichen Weg wie seine eigene, und das Unternehmen habe sich dem Problem erst gewidmet, nachdem es von seinen Fortschritten erfahren hatte. Laut OpenAI-Forschungschef Mark Chen arbeiteten 10.000 KI-Agenten rund 88 Stunden lang an dem Problem. Buckmaster vermutet, dass OpenAI auf seine Codex-Sitzungen zugegriffen haben könnte, ob absichtlich oder nicht. Zudem habe ihn der OpenAI-Forscher Sébastien Bubeck gedrängt, Alpöge als Co-Autor zu streichen, und gefragt: „Warum würdest du deine Karriere ruinieren?“ Bubeck bestreitet die Darstellung, entschuldigte sich aber für die Wortwahl.
Fall 2: Monatelange Chats über unveröffentlichte Arbeit
Kurz darauf meldete sich Andreas Thom zu Wort, Gruppentheoretiker an der TU Dresden. Es geht um eines von zehn Ergebnissen, die OpenAI Anfang August seinem Modell GPT-6 Astra zuschrieb: die Konstruktion einer sogenannten nicht-soficen Gruppe, eine Frage, die seit 27 Jahren offen war. Laut Thom folgt der entscheidende Schritt im KI-Beweis genau dem technischen Ansatz, den er mit seinem Kollegen Gábor Kun seit Jahren verfolgt. Dieser Ansatz sei keineswegs der naheliegende gewesen. Und: Thom und ein Kollege hätten unveröffentlichte Erweiterungen dieser Arbeit monatelang mit ChatGPT besprochen.
Thom veröffentlichte seinen E-Mail-Verkehr mit den OpenAI-Forschern. Seine Frage, ob seine Gespräche in die Trainingsdaten gelangt sein könnten oder vom Modell abgerufen wurden, beantwortete der Harvard-Statistiker und OpenAI-Forscher Mark Sellke laut Cybernews mit einem Satz: Das sei nicht passiert. Thom hatte die Trainingsoption zwar Ende Juni deaktiviert, das gilt aber nur für künftige Daten. „Die Anonymisierung mag einen Namen entfernen, aber nicht den intellektuellen Gehalt einer mathematischen Idee“, schrieb er. Er wirft OpenAI mangelnde Transparenz vor, die dem gemeinschaftlichen Prozess der Mathematik mehr schaden könnte, als die KI-Ergebnisse ihr nützen. OpenAI überarbeitete nach der Kritik stillschweigend seine Darstellung des Ergebnisses.
Was OpenAI sagt
OpenAI weist die Vorwürfe zurück. Weder Forscher:innen noch KI-Agenten hätten Buckmasters Arbeit vor der Veröffentlichung gesehen, auf Chats sei nicht direkt zugegriffen worden. Bemerkenswert ist allerdings ein Satz aus der ersten Stellungnahme: Man könne nicht ausschließen, dass „anonymisierte Daten, die aus ihrer Nutzung unserer Produkte stammen, zur Verbesserung unserer Modelle beigetragen haben“. Wenig später legte OpenAI nach und erklärte nach einer internen Untersuchung, Buckmasters Codex-Eingaben hätten das System in keiner Weise beeinflussen können. Zu Thoms Fragen über seine ChatGPT-Gespräche äußerte sich das Unternehmen bisher nicht in vergleichbarer Form.
Mehrere Fachleute halten die Sorge dennoch für berechtigt. Seltene Ideen fielen in den Trainingsdaten eines Modells auf wie „eine einzelne Stimme in einem leeren Raum“, sagte der KI-Forscher Oren Etzioni der New York Times. Gerade Mathematiker:innen und Wissenschaftler:innen, die mit Chatbots an neuen Ansätzen feilen, seien deshalb besonders exponiert. Der Mathematiker Terence Tao warnte, dass schon das Gerücht, jemand arbeite an einem Problem, eine KI-Großoffensive auslösen könne, die den ursprünglichen Forschenden zuvorkommt. Das könne dazu führen, dass Forschungsrichtungen künftig weniger offen geteilt werden.
Die Gegenposition
Andere halten die Vorwürfe für schwer haltbar. Daten aus privaten Konten können zwar für das Training genutzt werden, landen aber längst nicht alle in neuen Systemen, sagte der Stanford-Forscher Aneesh Muppidi der New York Times. Der Princeton-Informatiker Sanjeev Arora räumte ein, dass niemand genau versteht, wie die Modelle zu ihren Antworten kommen, hält das Problem aber für vorübergehend: Sobald KI die Fähigkeiten von Menschen übertreffe, werde sich die Frage nach übernommenen Ideen erledigen. Er sprach von einem Problem „für die nächsten sechs Monate oder ein Jahr“.
So schützen sich Forschende
Wer sensible Ideen mit einem Chatbot bespricht, kann zumindest die Nutzung für das Training abschalten. Bei ChatGPT heißt die Option „Das Modell für alle verbessern“, andere Anbieter haben ähnliche Einstellungen. Universitäten und Forschungsgruppen verhandeln zudem oft Verträge, die das Training auf ihren Daten ausschließen, so etwa Stanford mit OpenAI. Die Beratungsgruppe für Mathematik und KI am Institute for Advanced Study in Princeton hat die KI-Labore inzwischen aufgefordert, offene Mathe-Probleme nicht mehr mit proprietären Modellen anzugehen, auf die die Forschungsgemeinschaft keinen Zugriff hat. OpenAI hat mit seinen 377 neuen Ergebnissen aus einem unveröffentlichten Modell nun genau das getan, verweist aber auf neue Regeln für Zitate und Korrekturen, die mit dem Gremium abgestimmt seien.

