Arena: KI-Rangliste ist jetzt 3,1 Milliarden Dollar wert
Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.
Wer KI-Modelle bewertet, wird offenbar selbst hoch bewertet: Die Plattform Arena, früher als Chatbot Arena und LMArena bekannt, hat soeben eine Series B über 200 Millionen Dollar (rund 178 Millionen Euro) abgeschlossen. Die Bewertung liegt bei 3,1 Milliarden Dollar (etwa 2,8 Milliarden Euro). Angeführt wird die Runde von Lightspeed Venture Partners und Khosla Ventures, dazu kommen Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z und Felicis.
Bewertung fast verdoppelt
Erst im Jänner hatte Arena 150 Millionen Dollar (rund 134 Millionen Euro) bei einer Bewertung von 1,7 Milliarden Dollar eingesammelt. Damals lag der annualisierte Umsatz bei 30 Millionen Dollar, im Juni meldete Arena bereits 100 Millionen Dollar (rund 89 Millionen Euro). Geld verdient Arena vor allem mit AI Evaluations, einem kostenpflichtigen Dienst, der KI-Laboren und Unternehmen Analysen auf Basis der Community-Bewertungen liefert.
Entstanden ist Arena 2023 als Forschungsprojekt an der University of California in Berkeley. Das Prinzip ist simpel: Nutzer:innen stellen eine Frage, zwei anonyme KI-Modelle antworten, und man stimmt ab, welche Antwort besser ist. Aus Millionen solcher Duelle entsteht eine Rangliste, die laut Arena jeden Monat zig Millionen Menschen besuchen. „Wir dachten, das wird ein Paper, keine Firma“, sagte CEO Anastasios Angelopoulos laut dem Branchendienst RuntimeWire.
Neue Rangliste für KI-Agenten
Mit dem frischen Geld baut Arena eine Bewertung für KI-Agenten auf. Ein neuer Alignment-Index misst auf Basis von rund 90.000 echten Sitzungen, wie oft Agenten Aktionen ohne Erlaubnis ausführen, Quellen falsch zuordnen oder behaupten, Aufgaben erledigt zu haben, die sie gar nicht erledigt haben. In der vorläufigen Wertung liegen Modelle von OpenAI vorne, GPT-6.1 Sol führt mit 87,9 Punkten. Claude Opus 5.5 von Anthropic landet auf Platz sechs. „Statische Benchmarks brechen zusammen, sobald Modelle erkennen, dass sie getestet werden“, begründet Arena den Ansatz.
Für die Branche sind die Ranglisten längst ein Marketinginstrument. Neue Modelle wie zuletzt Mistral Large 4 werden gerne mit ihrer Arena-Platzierung beworben, und auch im Preiskampf zwischen OpenAI und Anthropic spielen Benchmarks eine zentrale Rolle.
Kritik an der Neutralität
Genau diese Rolle macht Arena angreifbar. In der Studie „The Leaderboard Illusion“ warfen Forscher:innen um Sara Hooker von Cohere Labs der Plattform vor, große Anbieter zu bevorzugen. Meta habe vor dem Start von Llama 4 privat 27 Varianten getestet, große Labore könnten schwache Ergebnisse zurückziehen und bekämen mehr Daten als Open-Source-Anbieter. Hooker sprach von einer „Krise“ der KI-Bewertung. Arena wies eine unfaire Behandlung zurück, sprach von sachlichen Fehlern in der Studie und verschärfte nach dem Meta-Fall seine Regeln.

