Series B

Arena: KI-Rangliste ist jetzt 3,1 Milliarden Dollar wert

LMArena. © Screenshot / Canva
LMArena. © Screenshot / Canva

Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.

Wer KI-Modelle bewertet, wird offenbar selbst hoch bewertet: Die Plattform Arena, früher als Chatbot Arena und LMArena bekannt, hat soeben eine Series B über 200 Millionen Dollar (rund 178 Millionen Euro) abgeschlossen. Die Bewertung liegt bei 3,1 Milliarden Dollar (etwa 2,8 Milliarden Euro). Angeführt wird die Runde von Lightspeed Venture Partners und Khosla Ventures, dazu kommen Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z und Felicis.

Bewertung fast verdoppelt

Erst im Jänner hatte Arena 150 Millionen Dollar (rund 134 Millionen Euro) bei einer Bewertung von 1,7 Milliarden Dollar eingesammelt. Damals lag der annualisierte Umsatz bei 30 Millionen Dollar, im Juni meldete Arena bereits 100 Millionen Dollar (rund 89 Millionen Euro). Geld verdient Arena vor allem mit AI Evaluations, einem kostenpflichtigen Dienst, der KI-Laboren und Unternehmen Analysen auf Basis der Community-Bewertungen liefert.

Entstanden ist Arena 2023 als Forschungsprojekt an der University of California in Berkeley. Das Prinzip ist simpel: Nutzer:innen stellen eine Frage, zwei anonyme KI-Modelle antworten, und man stimmt ab, welche Antwort besser ist. Aus Millionen solcher Duelle entsteht eine Rangliste, die laut Arena jeden Monat zig Millionen Menschen besuchen. „Wir dachten, das wird ein Paper, keine Firma“, sagte CEO Anastasios Angelopoulos laut dem Branchendienst RuntimeWire.

Neue Rangliste für KI-Agenten

Mit dem frischen Geld baut Arena eine Bewertung für KI-Agenten auf. Ein neuer Alignment-Index misst auf Basis von rund 90.000 echten Sitzungen, wie oft Agenten Aktionen ohne Erlaubnis ausführen, Quellen falsch zuordnen oder behaupten, Aufgaben erledigt zu haben, die sie gar nicht erledigt haben. In der vorläufigen Wertung liegen Modelle von OpenAI vorne, GPT-6.1 Sol führt mit 87,9 Punkten. Claude Opus 5.5 von Anthropic landet auf Platz sechs. „Statische Benchmarks brechen zusammen, sobald Modelle erkennen, dass sie getestet werden“, begründet Arena den Ansatz.

Für die Branche sind die Ranglisten längst ein Marketinginstrument. Neue Modelle wie zuletzt Mistral Large 4 werden gerne mit ihrer Arena-Platzierung beworben, und auch im Preiskampf zwischen OpenAI und Anthropic spielen Benchmarks eine zentrale Rolle.

Kritik an der Neutralität

Genau diese Rolle macht Arena angreifbar. In der Studie „The Leaderboard Illusion“ warfen Forscher:innen um Sara Hooker von Cohere Labs der Plattform vor, große Anbieter zu bevorzugen. Meta habe vor dem Start von Llama 4 privat 27 Varianten getestet, große Labore könnten schwache Ergebnisse zurückziehen und bekämen mehr Daten als Open-Source-Anbieter. Hooker sprach von einer „Krise“ der KI-Bewertung. Arena wies eine unfaire Behandlung zurück, sprach von sachlichen Fehlern in der Studie und verschärfte nach dem Meta-Fall seine Regeln.

Rank My Startup: Erobere die Liga der Top Founder!
Werbung
Werbung

Specials unserer Partner

Die besten Artikel in unserem Netzwerk

Deep Dives

Wasner + Steinschaden | Der KI Podcast

News, Modelle, Strategien
#glaubandich CHALLENGE: SVAN triumphiert in Klagenfurt

#glaubandich CHALLENGE 2027

Österreichs größter Startup-Wettbewerb - Top-Investoren mit an Bord
© Wiener Börse

IPO Spotlight

powered by Wiener Börse

RankMyStartup.com

Steig' in die Liga der Top Founder auf!

2 Minuten 2 Millionen | Staffel 13

Alle Startups | Alle Deals | Alle Hintergründe

Future{hacks}

Zwischen Hype und Realität

Trending Topics Tech Talk

Der Podcast mit smarten Köpfen für smarte Köpfe

Weiterlesen

Newsletter

Founders Dispatch

Zwei Mal pro Woche kostenlos in die Inbox: die wichtigsten Startups, Deals und Tech-Entwicklungen aus Europa, handgeschrieben von der Redaktion.

Jederzeit abbestellbar. Mehr über den Newsletter