Mistral Large 4 bleibt bei Artificial Analysis hinter Chinas Open-Weight-Spitze
Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.
Der erste unabhängige Test ist da, und er bestätigt Mistral nur zur Hälfte: Bei Artificial Analysis, einem der meistbeachteten Test-Dienste für KI-Modelle, kommt Mistral Large 4 auf 38 Punkte im Intelligence Index. Das reicht für das stärkste offene Modell außerhalb Chinas, im Gesamtfeld der Open-Weight-Modelle liegen aber sieben chinesische Modelle davor.
Mistral hatte das Modell soeben vorgestellt und es im Launch-Blogpost als konkurrenzfähig mit den stärksten offenen Modellen weltweit beworben. Der Intelligence Index von Artificial Analysis bündelt die Ergebnisse von zehn Tests aus Bereichen wie Programmieren, Agenten, Wissensarbeit und Naturwissenschaften zu einem Wert und gilt als einer der wichtigsten unabhängigen Vergleichsmaßstäbe der Branche.
Platz 8 hinter sieben chinesischen Modellen
Mit 38,4 Punkten macht Large 4 einen gewaltigen Sprung gegenüber den Vorgängern: Mistral Medium 3.5 kam auf 14 Punkte, Large 3 auf 9 Punkte. Weil die Modellgewichte noch nicht veröffentlicht sind, führt Artificial Analysis die Vorabversion derzeit als proprietäres Modell. Unter den Modellen seiner Preisklasse landet es dort auf Rang 64 von 225, deutlich über dem Median von 26 Punkten.
Aussagekräftiger ist der Vergleich mit den offenen Modellen im Ranking von Artificial Analysis, zu denen Large 4 mit der Freigabe der Gewichte Ende Oktober zählen soll. Dort würde es auf Platz 8 landen. Alle sieben Modelle davor stammen aus China, angeführt von MiMo-V2.6-Pro von Xiaomi mit 46,3 Punkten, GLM-5.3 von Z.ai mit 44,8 und Kimi K3 von Moonshot AI mit 43,6 Punkten. Das stärkste offene Modell außerhalb Chinas war bisher Motif 3 aus Südkorea mit 33,6 Punkten. Die Behauptung, Large 4 übertreffe alle offenen Modelle aus den USA und Europa deutlich, hält im Test also stand. Auch den Vergleich mit GLM-5.2 (33,7 Punkte) und DeepSeek V4 Pro (36,0 Punkte), auf den Mistral im Launch verwiesen hatte, gewinnt Large 4. Bis zur Freigabe der Gewichte Ende Oktober kann sich das Modell zudem noch verbessern, weil Mistral das Training der Vorabversion fortsetzt.
Zu den geschlossenen Spitzenmodellen bleibt der Abstand groß: Claude Opus 5.5 von Anthropic kommt in der stärksten Einstellung auf 57,6 Punkte, GPT-6 Astra von OpenAI auf 52,7 und Gemini 4 Argon von Google auf 52,6 Punkte. Auf die Weltspitze fehlen Large 4 damit gut 19 Punkte, es erreicht rund zwei Drittel des Werts von Claude Opus 5.5. Selbst zum besten offenen Modell, MiMo-V2.6-Pro, liegt der Abstand bei knapp 8 Punkten.
Die offenen Modelle im Vergleich
Die Spitze der Open-Weight-Modelle im Intelligence Index von Artificial Analysis, ergänzt um Mistral Large 4 und die Kosten pro Aufgabe im Index:
| Modell | Anbieter | Index | Kosten pro Aufgabe (Dollar) | Kosten pro Aufgabe (Euro) |
|---|---|---|---|---|
| MiMo-V2.6-Pro | Xiaomi | 46,3 | 0,13 | 0,12 |
| GLM-5.3 (Max) | Z.ai | 44,8 | 2,01 | 1,78 |
| Kimi K3 (Max) | Moonshot AI | 43,6 | 2,00 | 1,77 |
| GLM 5.3 Flash | Z.ai | 41,8 | 0,25 | 0,22 |
| Qwen3.8 2.4T | Alibaba | 39,9 | 2,16 | 1,92 |
| Qwen3.8-Flash-Next | Alibaba | 39,8 | 0,37 | 0,33 |
| DeepSeek V4.1 Flash (Max) | DeepSeek | 39,5 | 0,27 | 0,24 |
| Mistral Large 4 (Preview) | Mistral | 38,4 | 1,13 | 1,00 |
| MiMo-V2.6-Flash | Xiaomi | 37,9 | 0,06 | 0,05 |
| DeepSeek V4 Pro 0813 (Max) | DeepSeek | 36,0 | 0,67 | 0,59 |
Günstiger als GLM und Kimi, teurer als DeepSeek
Bei den Kosten pro Aufgabe zeigt sich ein gemischtes Bild. Mit 1,13 Dollar (rund 1 Euro) ist Large 4 gut 40 Prozent günstiger als die großen Konkurrenten GLM-5.3, Kimi K3 und Qwen3.8, die jeweils rund 2 Dollar pro Aufgabe kosten, aber auch einige Punkte mehr erreichen. Gegenüber den effizienten chinesischen Modellen sieht Large 4 dagegen alt aus: DeepSeek V4.1 Flash erreicht mit 0,27 Dollar pro Aufgabe einen etwas höheren Wert, MiMo-V2.6-Pro liefert für 0,13 Dollar acht Punkte mehr.

Ein Grund für die Kosten ist die Gesprächigkeit des Modells. Für den gesamten Intelligence Index erzeugte Large 4 rund 200 Millionen Output-Tokens, der Median der Vergleichsmodelle liegt bei 81 Millionen. Artificial Analysis stuft das Modell deshalb als „sehr wortreich“ ein. Der komplette Testlauf kostete rund 1.600 Dollar (etwa 1.420 Euro). Beim Tempo schneidet Large 4 dagegen gut ab: Mit 116 Tokens pro Sekunde liegt es über dem Median von 87, die erste Antwort kommt nach 1,46 Sekunden.
Was die Vorabversion (noch) nicht kann
Wer Large 4 jetzt nutzen will, muss einige Einschränkungen in Kauf nehmen:
- Nur über Mistral: Die Vorabversion ist ausschließlich über Mistrals eigene Schnittstelle verfügbar, laut Artificial Analysis gibt es derzeit genau einen Anbieter. Die API kostet 1,36 Dollar (rund 1,21 Euro) pro Million Input-Tokens und 4,18 Dollar (rund 3,71 Euro) pro Million Output-Tokens, für zwischengespeicherte Eingaben gibt es rund 90 Prozent Rabatt.
- Keine Gewichte: Herunterladen und auf eigenen Servern betreiben lässt sich das Modell erst ab Ende Oktober. Mit einer Billion Parametern, davon 49 Milliarden aktiv, ist es ohnehin nur etwas für Rechenzentren, nicht für Laptops.
- Gedrosselte Cyber-Fähigkeiten: Die öffentliche Version ist stärker moderiert. Ausgewählte Sicherheitsfirmen, Partner und staatliche Stellen testen bis zur Freigabe eine Variante mit weniger Einschränkungen und erweiterten Cyber-Funktionen. Zudem überwacht Mistral nach eigenen Angaben den Datenverkehr über die API.
- Nur Text als Ausgabe: Large 4 versteht Bilder und Text, antwortet aber ausschließlich mit Text. Das Kontextfenster umfasst rund 524.000 Tokens.
- Werte in Bewegung: Das Reinforcement-Learning-Training läuft laut Mistral noch. Die Punkte bei Artificial Analysis sind also eine Momentaufnahme und dürften sich bis zur finalen Version verändern.
Offene Frage: die Lizenz
Unklar ist noch, unter welchen Bedingungen die Gewichte erscheinen. Im Launch-Blogpost spricht Mistral zwar ausführlich von offenen Gewichten und Kontrolle für die Kund:innen, eine Lizenz nennt das Unternehmen aber nicht. Laut VentureBeat soll Large 4 unter einer eigenen Mistral-Lizenz kommen, Details dazu gibt es bisher keine. Das ist mehr als eine Formalie: Mistral hat in der Vergangenheit sehr unterschiedliche Lizenzen verwendet. Large 3 erschien unter der freien Apache-2.0-Lizenz, Medium 3.5 unter einer modifizierten MIT-Lizenz, die Unternehmen mit mehr als 20 Millionen Dollar Monatsumsatz von der freien kommerziellen Nutzung ausnimmt. Ältere Versionen von Mistral Large standen dagegen unter der Mistral Research License, die eine kommerzielle Nutzung ohne gesonderten Vertrag ausschloss.
Auch bei der chinesischen Konkurrenz sind die Bedingungen unterschiedlich. DeepSeek und Xiaomi veröffentlichen ihre Spitzenmodelle unter der MIT-Lizenz, GLM-5.3, Kimi K3 und das große Qwen3.8 kommen dagegen mit eigenen Lizenzen, die Artificial Analysis als eingeschränkt für die kommerzielle Nutzung einstuft. Für Unternehmen, die Large 4 im eigenen Rechenzentrum betreiben wollen, entscheidet die Lizenz darüber, wie offen das Modell in der Praxis tatsächlich ist.

