Beam: Reflection AI will Chinas Vorherrschaft bei offenen KI-Modellen brechen
Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.
Ausgerechnet ein US-Startup will den chinesischen KI-Laboren ihr liebstes Spielfeld streitig machen: Reflection AI, das von Nvidia unterstützte Startup zweier Ex-DeepMind-Forscher, hat gerade mit Beam sein erstes Open-Weight-Modell vorgestellt. Das Modell mit 501 Milliarden Parametern soll beim Programmieren und bei KI-Agenten mit den besten offenen Modellen aus China mithalten und dabei deutlich weniger Rechenleistung verbrauchen. Unabhängige Benchmarks gibt es allerdings noch keine, denn die Gewichte sind noch gar nicht veröffentlicht.
Was Beam kann
Beam ist ein sogenanntes Mixture-of-Experts-Modell: Von den 501 Milliarden Parametern sind pro Token nur 23 Milliarden aktiv, was den Betrieb günstiger macht. Das Modell verarbeitet ausschließlich Text, kommt aber mit einem Kontextfenster von bis zu einer Million Tokens. Über einen Parameter für den Denkaufwand können Nutzer:innen selbst steuern, ob Beam kurz und sparsam oder ausführlich und gründlicher antwortet.
Derzeit durchläuft Beam laut Reflection AI noch letzte Red-Teaming-Tests und Evaluierungen. Ausgewählte Nutzer:innen erhalten über eine Warteliste frühen Zugang. Die Gewichte sollen noch diesen Monat unter der freizügigen Apache-2.0-Lizenz folgen, zusammen mit technischem Bericht, Model Card und Werkzeugen zum Betreiben und Feintunen.
Riesiger Rechenaufwand für das Training
Für das Vortraining nutzte Reflection 23,8 Billionen Tokens aus dem Web, öffentlichen Quellen und lizenzierten Datensätzen. Der Basis-Lauf auf 6.144 Nvidia-GB300-GPUs dauerte weniger als vier Wochen. Danach folgte ein ebenso langer Reinforcement-Learning-Lauf auf 10.500 GB300-Chips, bei dem das Modell in rund einer Million Trainingsumgebungen mehr als 100 Millionen Aufgabendurchläufe absolvierte. Reflection spricht von einem der größten RL-Läufe, den ein offenes Labor bisher durchgeführt hat, und will auch am Ende des Trainings noch keine Sättigung bei den Fähigkeiten beobachtet haben.
Das wichtigste Verkaufsargument ist Effizienz. Bei anspruchsvollen Reasoning-Aufgaben soll Beam ähnliche Ergebnisse wie GLM-5.2 von Z.ai erzielen und dabei drei- bis viermal weniger Rechenleistung beim Antworten benötigen. Gegenüber Modellen mit mehr als zwei Billionen Parametern wie Alibabas Qwen 3.8 Max sei der Vorsprung noch größer.
Benchmarks bisher nur vom Hersteller selbst
Reflection stuft Beam selbst als konkurrenzfähig zu GLM-5.2 ein und sieht das Modell bei Coding- und Agenten-Aufgaben in der Nähe von Qwen 3.8 Max. Bei der reinen Leistungsfähigkeit räumt das Startup ein, dass Spitzenmodelle wie Kimi K3 von Moonshot AI vorne liegen. Ein Auszug aus den veröffentlichten Werten (NR: kein Wert angegeben):
| Benchmark | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| Terminal Bench v2.1 | 80,1 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Bench Pro v1 | 65,5 | 62,1 | NR | NR | 67,7 | NR |
| SWE Bench Pro v2-Hard | 77,2 | NR | 84,3 | 88,2 | NR | NR |
Die Zahlen für Beam stammen von Reflection selbst, jene der Konkurrenz teils von Artificial Analysis und DataCurve. Im Intelligence Index von Artificial Analysis, der Ergebnisse aus zahlreichen Tests bündelt, ist Beam noch nicht gelistet. Auffällig ist: Bei DeepSWE und Terminal Bench liegt Beam nicht nur hinter Kimi K3 und GLM-5.3, sondern auch hinter DeepSeek V4.1 Flash, das im Index von Artificial Analysis mit 39 Punkten deutlich hinter der Open-Weight-Spitze rangiert. Bei den Tests, in denen Beam seine besten Werte meldet, fehlen dagegen Vergleichswerte der stärksten chinesischen Modelle.
25 Milliarden Dollar Bewertung vor dem ersten Modell
Gegründet wurde Reflection AI 2024 von Misha Laskin und Ioannis Antonoglou, die bei Google DeepMind an Gemini und AlphaGo gearbeitet hatten. Im Vorjahr sammelte das Startup in einer von Nvidia angeführten Runde zwei Milliarden Dollar (rund 1,7 Milliarden Euro) bei einer Bewertung von acht Milliarden Dollar ein. Inzwischen wird es laut Wall Street Journal mit rund 25 Milliarden Dollar (rund 21,4 Milliarden Euro) bewertet, zu den Geldgebern zählen neben Nvidia auch Sequoia und Lightspeed. Rechenleistung mietet Reflection unter anderem bei SpaceX: Der Deal für Nvidia-Server im Rechenzentrum Colossus 2 in Memphis bringt dem Konzern von Elon Musk bis 2029 rund 6,3 Milliarden Dollar (rund 5,4 Milliarden Euro).
Investor:innen sehen in Reflection gerne das „DeepSeek des Westens“. Das Startup ist Teil von Nvidias Nemotron-Koalition, die offene Modelle als Basis für souveräne KI in befreundeten Staaten etablieren will, und arbeitet etwa mit dem südkoreanischen Konzern Shinsegae an koreanischsprachigen Modellen. Kritiker:innen hatten zuletzt bemängelt, dass Reflection seine hohe Bewertung erreichte, ohne ein einziges Modell veröffentlicht zu haben. Mit Beam muss das Startup nun zeigen, ob die Erwartungen gerechtfertigt sind.
Starke Konkurrenz aus China und den USA
Im Open-Weight-Segment geben derzeit chinesische Anbieter den Ton an. Xiaomis MiMo-V2.6-Pro führt die offenen Modelle bei Artificial Analysis an, dahinter folgen GLM-5.3 von Z.ai, Qwen 3.8 Max von Alibaba und Kimi K3 von Moonshot AI, das im Sommer für einen neuen „DeepSeek-Moment“ an den Börsen sorgte. Auch im Westen wächst die Konkurrenz: Mira Muratis Thinking Machines Lab hat mit Inkling ein offenes Modell mit 975 Milliarden Parametern veröffentlicht, Nvidia selbst bietet mit Nemotron eine eigene offene Modellfamilie an, auf der etwa Salesforce aufbaut. Beide Modelle liegen in Reflections eigenen Vergleichen hinter Beam. Reflection bezeichnet Beam als erstes Modell einer Serie, der Nachfolger befindet sich laut dem Startup bereits im Training.

