Mistral AI

Mistral Large 4 soll Europas KI-Hoffnung aus dem Schatten holen

Large group photo of the Mistral AI team cheering on a lawn
The Mistral AI team. © Mistral

Trending Topics auf Google als bevorzugte Nachrichtenquelle festlegen.

Wer lange schweigt, muss laut zurückkommen: Mistral hat soeben Mistral Large 4 vorgestellt und will damit beweisen, dass Europa im KI-Rennen noch mitläuft. Das Modell soll die Lücke zu den besten Open-Source-Modellen schließen, einschließlich der chinesischen. Unabhängige Benchmarks auf Basis der offenen Gewichte, mit denen sich das prüfen ließe, gibt es derzeit aber nicht.

Das neue Modell, intern ML4 und mit Augenzwinkern „le Chonk“ genannt, landet laut Mistral in hausinternen Benchmarks vor GLM 5.2 von Z.ai und soll „mit Abstand“ das leistungsstärkste offene Modell aus Europa und den USA sein. Large 4 ist ein Mixture-of-Experts-Modell mit einer Billion Parametern, von denen jeweils 49 Milliarden aktiv sind. Es soll mit den besten geschlossenen Modellen mithalten können und mit offenen Modellen konkurrieren, die dreimal so groß sind. Zunächst stellt Mistral eine Vorabversion über die Schnittstelle (API) bereit, die 1,36 Dollar (rund 1,21 Euro) pro Million Input-Tokens und 4,18 Dollar (rund 3,71 Euro) pro Million Output-Tokens kostet. Die Modellgewichte zum Herunterladen und Selbstbetreiben sollen Ende Oktober folgen.

Zielgruppe sind vor allem Unternehmen, die das Modell in eigenen Rechenzentren oder einer privaten Cloud betreiben wollen. Für Laptops und Desktop-Rechner ist es zu groß. Ursprünglich hätte Large 4 schon im Sommer erscheinen sollen. Der Start hat sich verzögert, die Vorgängerversion ist bereits fast ein Jahr alt, und in der Zwischenzeit war es um das französische KI-Unternehmen auffallend ruhig geworden.

Was Large 4 können soll

Mistral hat das Modell gezielt auf die Bedürfnisse seiner Unternehmenskund:innen aus Banken, Logistik, Verteidigung und öffentlichem Sektor zugeschnitten. Die wichtigsten Neuerungen laut Mistral:

  • Programmieren: Large 4 soll bestehende Softwareprojekte analysieren und eigenständig neue Funktionen hinzufügen können. Beim Coding schließe das Modell die Lücke zu den führenden Modellen, besonders gut sei es bei der Entwicklung und dem Testen von Halbleitern.
  • Agenten: Das Modell soll über Stunden komplexe Aufgaben ausführen und mit verschiedenen Werkzeugen arbeiten können, ohne den Zusammenhang zu verlieren. Laut Chefwissenschaftler und Mitgründer Guillaume Lample kann es damit Arbeiten übernehmen, für die Fachleute bisher Stunden oder Tage brauchen.
  • Cybersicherheit: Mistral sieht das Modell bei Angriff und Verteidigung gleichermaßen stark. Kund:innen wollten ein europäisches Modell, um Sicherheitslücken zu finden und Angriffe abzuwehren, sagt Pierre Stock, Vice President of Science bei Mistral. Lample argumentiert gegenüber The Deep View mit den offenen Gewichten: Neue Sicherheits-Workflows bräuchten sehr viel Rechenleistung, „deshalb kann man es sich nicht leisten, dass das Modell, mit dem man sich schützt, eines Tages verschwindet oder zu eingeschränkt ist“. Weil sich diese Fähigkeiten auch für Angriffe missbrauchen lassen, überwacht Mistral nach eigenen Angaben den Datenverkehr über die Schnittstelle.
  • Branchenwissen: Neben Coding und Sicherheit soll das Modell bei Aufgaben aus Fertigung, Finanzwesen und Geodatenanalyse besonders gut abschneiden.
  • Grounding: Beim visuellen Grounding, also dem Verorten von Objekten in Bildern wie Satelliten- und Luftaufnahmen, übertrifft Large 4 laut Mistral „alle bestehenden Modelle, auch die geschlossenen“.
  • Bilder und Sprachen: Large 4 ist multimodal und verarbeitet neben Text auch Bilder. Trainiert wurde es mit mehr als 160 Sprachen.

So ordnet sich Mistral ein

Im Blogpost zum Launch wählt Mistral seine Worte genau: Large 4 sei konkurrenzfähig mit den stärksten offenen Modellen weltweit und übertreffe jedes offene Modell aus den USA oder Europa deutlich. Einen klaren Sieg über die chinesische Spitze beansprucht Mistral also nicht. Bei Unternehmensaufgaben wie Cybersicherheit, Finanzen und Recht sieht sich Mistral dagegen ganz vorne unter den offenen Modellen, beim visuellen Grounding sogar vor geschlossenen Frontier-Modellen. Teile des Modells seien „im Grunde stärker als Chinas Modelle aus diesem Sommer“, sagt Stock laut Euronews. Die wichtigsten Vergleichswerte:

Benchmark Mistral Large 4 Konkurrenz
DeepSWE v1.1 (agentisches Coding) 61,7 % GLM-5.3: 61 %, DeepSeek V4 Pro: 57 %, Qwen 3.8 Max: 51 %, Reflection Beam: 44 %
Coding-Blindtest mit Surge AI (Note 1 bis 5) 3,74 Claude Opus 5: 4,22, GLM-5.3: 3,60, Kimi K3: 3,59, GLM-5.2: 3,40
FinWorkBench (Finanzen) 67 % DeepSeek V4 Pro: 67 %, GLM-5.3: 65 %
Harvey Legal Agent Benchmark (Recht) 15 % Kimi K3: 13 %, MiMo V2.6 Pro: 11 %, GLM-5.3: 8 %, GPT-6 Astra: 5 %
DIOR-RSVG (visuelles Grounding) 73 % GPT-6 Astra: 68 %, Kimi K3: 55 %
Dense200 (visuelles Grounding) 42 % GPT-6 Astra: 41 %

Gegen die chinesische Konkurrenz sind die Abstände knapp: Bei DeepSWE liegt Large 4 knapp vor GLM-5.3, bei FinWorkBench gleichauf mit DeepSeek V4 Pro. In einem internen Vergleich mit GLM-5.3 bevorzugten Fachleute Large 4 bei CAD sowie Mathematik und Physik, bei Finanzen und Coding lagen beide etwa gleichauf. Beim Coding-Blindtest landet Large 4 auf Platz zwei von fünf, hinter Anthropics Claude Opus 5. Aus den USA tauchen sonst nur das kürzlich vorgestellte Beam von Reflection AI auf, das beim Coding deutlich zurückliegt, und OpenAIs geschlossenes GPT-6 Astra.

Am selbstbewusstesten tritt Mistral bei der Cybersicherheit auf. Im Cyber Index von Artificial Analysis, einer unabhängigen Bewertung, zählt Large 4 laut Mistral zu den fünf besten Modellen weltweit und führt unter den offenen Modellen außerhalb Chinas mit großem Abstand. In einem Test, bei dem ein Modell eine echte Sicherheitslücke nachstellen und anschließend schließen muss, erreicht es 82 Prozent, den höchsten Wert aller Modelle. Geschlossene Modelle wie Claude Opus 5.5 und GPT-6 Astra kommen dort auf nahezu null, weil sie die Aufgabe verweigern. Bis zur Freigabe der Gewichte testen Sicherheitsfirmen, ausgewählte Partner und staatliche Stellen das Modell mit reduzierter Moderation.

Ein Modell mit Symbolwert

Für die europäische Tech-Szene ist der Launch mehr als ein Versionssprung. Mistral gilt als wichtigster europäischer Gegenentwurf zu den US-Schwergewichten, und jedes neue Flaggschiff-Modell wird als Gradmesser dafür gelesen, ob europäische Firmen technologisch halbwegs wettbewerbsfähig bleiben können. Mit ASML, Samsung und Airbus hat Mistral zuletzt wichtige Industriekund:innen gewonnen, dazu kommen Kooperationen mit Staaten wie Frankreich und Luxemburg.

Der Druck war zuletzt groß. Die Vorgängermodelle wurden von der Konkurrenz aus China und den USA abgehängt. KI-Forscher Niels Rogge kritisierte auf LinkedIn, dass Large 3.5 auf einer „veralteten Architektur“ von Meta aufsetze und teurer sei als stärkere Modelle von DeepSeek. Manche Beobachter:innen sahen Mistral bereits auf dem Weg weg von der Spitzenforschung, hin zum reinen Dienstleister für Unternehmen. Daten, die dem Branchenmedium Sifted vorliegen, stützen das: Zum Start waren mehr als 80 Prozent der technischen Neuzugänge KI-Forscher:innen und Research Engineers, im ersten Halbjahr 2026 machte das Forschungsteam nur noch 29 Prozent der technischen Belegschaft aus.

Lample hält dagegen: „Unsere Closed-Source-Konkurrenten sind mindestens vier Jahre älter als wir, aber wir haben jetzt Modelle, die wirklich stark sind. Wir haben diese Lücke im Wesentlichen geschlossen und beschleunigen.“ Als Beleg für die eigene Forschung verweist Mistral darauf, dass Large 4 mit Reinforcement Learning trainiert wurde. Viele offene Modelle entstehen dagegen großteils per Destillation aus anderen Modellen.

Strategie bleibt: Neocloud statt reines Modellhaus

An der eingeschlagenen Richtung ändert das neue Modell nichts. Mistral baut weiter an seiner Neocloud, also an eigener Recheninfrastruktur und einem Angebot, das über die reine Modellentwicklung hinausgeht. Large 4 wurde bereits in Mistrals eigenen Rechenzentren in Europa trainiert, auf 3.800 Grafikchips vom Typ Nvidia Grace Blackwell und laut Mistral zu einem Bruchteil der Kosten der Konkurrenz. Auch die Vorabversion läuft auf dieser Infrastruktur, das Unternehmen liefert damit Modell, Infrastruktur und Rechenleistung aus einer Hand. Für diesen Umbau hat Mistral kürzlich 3 Milliarden Euro bei einer Bewertung von 21 Milliarden Euro eingesammelt, insgesamt sind es laut Sifted mehr als 6 Milliarden Euro an Eigen- und Fremdkapital. Das Geld soll laut Finanzchef Johan Bergqvist vor allem in die Modellentwicklung und den Ausbau der Rechenkapazitäten fließen, um Unternehmen eine Alternative zu bieten, die ihre Modelle selbst betreiben wollen.

Genau das ist Mistrals wichtigstes Verkaufsargument in Europa: Unabhängigkeit von ausländischen Anbietern. Wie heikel diese Abhängigkeit sein kann, zeigte sich im Juni, als Anthropic nach eigenen Angaben von der US-Regierung angewiesen wurde, ausländischen Staatsbürger:innen den Zugang zu einigen seiner leistungsstärksten Modelle zu sperren. „Kund:innen wollen offene Modelle, weil sie sicher sein wollen, dass ihnen der Zugang nicht bald von einer externen Macht abgedreht wird“, sagt Stock.

Dazu passt, dass GLM 5.2 von Z.ai im Angebot bleiben soll, obwohl Mistral das eigene Modell in den internen Tests davor sieht. Mistral tritt damit zunehmend als Plattform auf, die verschiedene Modelle bereitstellt, und weniger als Anbieter, der ausschließlich auf die eigenen Gewichte setzt.

Blick auf die Konkurrenz

Der Wettbewerb ist dicht. OpenAI, Anthropic und Google liefern sich an der Spitze ein enges Rennen, während chinesische Anbieter wie Z.ai, Alibaba mit Qwen, Moonshot AI mit Kimi und DeepSeek bei offenen Modellen kräftig Druck machen. Genau dort, im Bereich leistungsfähiger und flexibel einsetzbarer Modelle, will sich Mistral als europäische Alternative behaupten.

Die Einschränkung: hausinterne Tests

Die Vergleiche mit GLM 5.2 und GLM-5.3 stammen aus eigenen, vorläufigen Benchmarks von Mistral. Solche Herstellerangaben lassen sich erst einordnen, wenn unabhängige Tests vorliegen, und das ist frühestens mit der Freigabe der Modellgewichte Ende Oktober möglich. Im Intelligence Index von Artificial Analysis, der Ergebnisse aus zahlreichen Benchmarks bündelt, ist Large 4 noch nicht gelistet. Die bisher erfassten Mistral-Modelle liegen dort weit hinter der Open-Weight-Spitze: Mistral Medium 3.5 kommt auf 14 Punkte, der Vorgänger Large 3 auf 9 Punkte. GLM-5.3, der Nachfolger von GLM 5.2, erreicht 45 Punkte, Kimi K3 von Moonshot AI 44 Punkte. Large 4 müsste also einen großen Sprung machen, um in diese Liga vorzustoßen. Zudem läuft das Reinforcement-Learning-Training hinter der Vorabversion laut Mistral noch, die Werte dürften sich also weiter verändern.

Large 5 steckt schon im Pretraining

Während Large 4 an den Start geht, arbeitet Mistral bereits am Nachfolger. Mistral Large 5 befindet sich dem Vernehmen nach schon im Pretraining. Ob Mistral das Tempo der Konkurrenz halten kann, wird sich daran zeigen, wie schnell Large 5 folgt und wie gut es im direkten Vergleich abschneidet.

Rank My Startup: Erobere die Liga der Top Founder!
Werbung
Werbung

Specials unserer Partner

Die besten Artikel in unserem Netzwerk

Deep Dives

Wasner + Steinschaden | Der KI Podcast

News, Modelle, Strategien
#glaubandich CHALLENGE: SVAN triumphiert in Klagenfurt

#glaubandich CHALLENGE 2027

Österreichs größter Startup-Wettbewerb - Top-Investoren mit an Bord
© Wiener Börse

IPO Spotlight

powered by Wiener Börse

RankMyStartup.com

Steig' in die Liga der Top Founder auf!

2 Minuten 2 Millionen | Staffel 13

Alle Startups | Alle Deals | Alle Hintergründe

Future{hacks}

Zwischen Hype und Realität

Trending Topics Tech Talk

Der Podcast mit smarten Köpfen für smarte Köpfe

Weiterlesen

Newsletter

Founders Dispatch

Zwei Mal pro Woche kostenlos in die Inbox: die wichtigsten Startups, Deals und Tech-Entwicklungen aus Europa, handgeschrieben von der Redaktion.

Jederzeit abbestellbar. Mehr über den Newsletter