Mistral Large 4 ist ein multimodales Sprachmodell mit rund einer Billion Parametern, das Mistral AI am 6. Oktober 2026 als Public Preview veröffentlicht hat. Die Dokumentation von Mistral nennt 1,05 Billionen Parameter insgesamt, davon 52 Milliarden aktiv pro Token, und einen Vision-Encoder mit 1,6 Milliarden Parametern. Die Preview ist schon jetzt über die Mistral-API nutzbar, die Gewichte sollen bis Ende Oktober folgen. Das Release kam drei Tage nach Kolibri-1 von Aleph Alpha, einem weiteren neuen Modell eines europäischen Entwicklers. Dieser Leitfaden behandelt Spezifikationen, Benchmarks, Preise und den Zeitplan für die Gewichte, vergleicht das Modell mit Kolibri-1 und zeigt, wie es hinter KI-Agenten im Produktivbetrieb läuft.
Mistral Large 4 im Überblick
Mistral Large 4 ist ein Mixture-of-Experts-Modell, das Instruction Following, Reasoning und Agenten-Aufgaben in einem Modell vereint. Die folgenden Angaben stammen aus der Release-Ankündigung und der Modellseite in der Dokumentation von Mistral.
| Merkmal | Mistral Large 4 |
|---|---|
| Entwickler | Mistral AI, Frankreich |
| Veröffentlichung | Public Preview, 6. Oktober 2026 |
| Parameter | 1,05 Bio. insgesamt, 52 Mrd. aktiv pro Token, dazu ein Vision-Encoder mit 1,6 Mrd. |
| Architektur | Feingranulare Mixture-of-Experts-Architektur, ein Modell für Instruction Following und Reasoning |
| Ein- und Ausgabe | Text und Bilder als Eingabe, Text als Ausgabe |
| Sprachen | Mehr als 160 in den Trainingsdaten, darunter alle Amtssprachen der EU |
| Kontextfenster | 1 Mio. Tokens laut Mistral-Dokumentation; rund 524.000 bei Artificial Analysis und OpenRouter |
| Reasoning | Einstellbar über den Parameter reasoning_effort |
| API-Funktionen | Function Calling, Structured Outputs, Document Q&A, Batching, Agents |
| API-Modell-IDs | mistral-large-4, mistral-large-4-0 |
| Gewichte | Angekündigt bis Ende Oktober 2026 |
| Lizenz | Noch nicht bekannt gegeben |
| Training | Von Grund auf auf 3.800 NVIDIA-Grace-Blackwell-GPUs in Mistrals eigenen europäischen Rechenzentren |
Bei einigen Angaben weichen die Quellen voneinander ab. Die Ankündigung spricht von einer Billion Parametern mit 49 Milliarden aktiven, die Dokumentation von 1,05 Billionen und 52 Milliarden. Die Dokumentation nennt ein Kontextfenster von einer Million Tokens, Artificial Analysis und OpenRouter führen für die Preview rund 524.000 Tokens. Laut Mistral läuft das Reinforcement Learning hinter der Preview außerdem noch, und das Unternehmen erwartet weitere Verbesserungen. Die Ergebnisse können sich also ändern, bevor die Gewichte erscheinen.
Benchmarks von Mistral Large 4
Mistral zeigt die meisten Ergebnisse als Diagramme. Die Tabelle fasst die im Text der Ankündigung genannten Werte zusammen. Die meisten hat Mistral selbst gemessen, die Vergleichsmodelle hat Mistral ausgewählt; der AA-Briefcase-Wert stammt von Artificial Analysis.
| Benchmark | Mistral Large 4 | Was gemessen wird |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | Software-Engineering-Aufgaben |
| SWE-Atlas-QnA | 59,4 % | Verständnis von Repositorys |
| Terminal-Bench 4 | 28,3 % | Workflows auf der Kommandozeile |
| Coding Agent Index | 49,8 % | Vor DeepSeek V4 Pro 0813 und Qwen3.8 Max |
| AutomationBench | 59,9 % | 657 Geschäftsworkflows; vor Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro |
| AA-Briefcase | 1.393 Elo | Wissensarbeit über lange Zeiträume; vor DeepSeek V4 Pro |
| Cybench | 93 % | 40 Aufgaben aus Security-Wettbewerben |
| Dense 200 | 42 % | Visual Grounding; GPT-6 Astra erreicht 41 % |
| B3 AI Security Benchmark | 93,3 % | Anteil abgewehrter Angriffe |
Werte aus der Release-Ankündigung von Mistral, 6. Oktober 2026.
Ergebnisse für Coding und Agenten
Bei AutomationBench, das 657 Geschäftsworkflows in Apps wie Gmail, Google Sheets, Slack und Salesforce umfasst, meldet Mistral 59,9 %. Mit einem kombinierten Coding Agent Index von 49,8 % liegt das Modell vor DeepSeek V4 Pro 0813 und Qwen3.8 Max. In einer blinden Bewertung der Codequalität, die Mistral mit Surge AI durchgeführt hat, vergaben professionelle Annotatoren der Preview 3,74 von 5 Punkten. Das war Platz zwei von fünf Modellen, hinter Claude Opus 5 (4,22) und vor GLM-5.3 (3,60), Kimi K3 (3,59) und GLM-5.2 (3,40).
Cybersecurity
Cybersecurity bekommt in der Ankündigung von Mistral den meisten Raum. Im Artificial Analysis Cyber Index meldet Mistral einen Platz unter den fünf besten Modellen weltweit und die Spitze unter den Open-Weight-Modellen, die außerhalb Chinas entwickelt wurden. Im Test des Index, bei dem ein Modell eine reale Schwachstelle in Open-Source-Software nachstellen und anschließend beheben soll, erreicht Mistral Large 4 82 %, laut Mistral der höchste Wert aller Modelle. Claude Opus 5.5 und GPT-6 Astra kommen dort laut Mistral auf nahezu null, weil sie die Aufgabe verweigern. Gleichzeitig lehnt das Modell laut Mistral bösartige Cyber-Prompts häufiger ab als alle anderen getesteten offenen Modelle. Bis die Gewichte erscheinen, testen ausgewählte Partner und staatliche Stellen eine Version mit reduzierter Moderation.
Bilder und Wissensarbeit
Bei der Bildverarbeitung spricht Mistral von einem großen Sprung gegenüber den eigenen früheren Modellen, mit Reasoning über Dokumente, Diagramme, technische Zeichnungen und Satellitenbilder. Beim Visual Grounding meldet Mistral 42 % auf Dense 200 gegenüber 41 % für GPT-6 Astra. In Evaluationen von vals.ai zu juristischen und finanziellen Aufgaben übertrifft die Preview GPT-6 Astra, und im Legal Agent Benchmark von Harvey schneidet sie laut Mistral besser ab als alle Open-Source-Modelle.
Unabhängige Ergebnisse
Artificial Analysis vergibt der Preview mit Reasoning 38 Punkte im Intelligence Index. Das nicht auf Reasoning ausgelegte Mistral Large 3 kam auf 9 Punkte. Open-Weight-Modelle aus China liegen weiterhin vorn, darunter GLM-5.3 mit 45 und Kimi K3 mit 44 Punkten, beide in ihrer höchsten Reasoning-Stufe. Da die Gewichte noch nicht öffentlich sind, führt Artificial Analysis die Preview als proprietäres Modell. Gemessen wurden 116 Output-Tokens pro Sekunde. Zudem stuft Artificial Analysis das Modell als ausführlich ein: Während der Index-Evaluation erzeugte es 200 Millionen Output-Tokens, bei einem Median von 81 Millionen für Reasoning-Modelle einer ähnlichen Preisklasse.
Preise und API-Zugang
Die Preview läuft in der Mistral-API unter den Modell-IDs mistral-large-4 und mistral-large-4-0. Mistral nennt die folgenden Preise pro Million Tokens. In der Dokumentation sind sie derzeit durchgestrichen und durch den halben Preis ersetzt, ohne Angabe, wie lange dieser gilt.
| Tokens | Listenpreis | Aktueller Preis laut Doku |
|---|---|---|
| Input | 1,36 $ | 0,68 $ |
| Gecachter Input | 0,14 $ | 0,07 $ |
| Output | 4,18 $ | 2,09 $ |
Preise pro Million Tokens in US-Dollar, aus Ankündigung und Dokumentation von Mistral am 6. Oktober 2026.
Batch-Verarbeitung bietet Mistral mit 50 % Rabatt an. Für Vorgaben zum Datenstandort gibt es den Endpoint api.eu.mistral.ai für regionale Inferenz. Er verarbeitet Anfragen in Rechenzentren in EU- und EFTA-Staaten, zum 1,1-Fachen des Standard-Listenpreises. Für den globalen Endpoint sagt Mistral keinen Verarbeitungsort zu. Regionale Endpoints bedienen nur die in ihrer Region gehosteten Modelle und unterstützen Function Calling, aber nicht die Agents-, Batch- und Files-Funktionen von Mistral, und Konto- und Abrechnungsdaten können weiterhin außerhalb der Region verarbeitet werden. Artificial Analysis stuft die Preview als ausführlich ein, daher sollten Output-Tokens in jede Kostenschätzung einfließen.
Gewichte und Self-Hosting
Mistral will die Gewichte bis Ende Oktober veröffentlichen, zusammen mit Details zur Architektur, weiteren Benchmarks und der Post-Training-Methode. Eine Lizenz hat Mistral noch nicht genannt. Der Vorgänger Mistral Large 3 steht unter Apache 2.0.
Laut Mistral soll das Modell auch in einer Private Cloud oder On-Premises laufen können, die Größe setzt dafür aber eine hohe Hürde. Bei 8 Bit pro Parameter belegen 1,05 Billionen Parameter rund 1 TB Speicher, bei 16 Bit rund 2 TB, jeweils ohne KV-Cache und Laufzeit-Overhead. Das ist mehr, als ein Server mit acht H100-GPUs fasst (8 × 80 GB = 640 GB). Hardwareanforderungen hat Mistral noch nicht veröffentlicht, für die meisten Teams bleibt die API daher der praktikable Weg.
Mistral Large 4 und Kolibri-1: zwei europäische Releases in einer Woche
Aleph Alpha hat Kolibri-1 drei Tage vor Mistral Large 4 veröffentlicht. Die beiden Releases verfolgen gegensätzliche Ansätze: Mistral hat ein mehrsprachiges Modell mit einer Billion Parametern und Bildeingabe gebaut, Aleph Alpha ein kompaktes Modell für Deutsch und Englisch, das auf eine einzelne große GPU passt.
| Merkmal | Mistral Large 4 | Kolibri-1 |
|---|---|---|
| Entwickler | Mistral AI, Frankreich | Aleph Alpha, Deutschland |
| Veröffentlichung | Public Preview, 6. Oktober 2026 | Gewichte veröffentlicht am 3. Oktober 2026 |
| Parameter insgesamt | 1,05 Bio. | 78,1 Mrd. |
| Aktiv pro Token | 52 Mrd. | 3,46 Mrd. |
| Eingabe | Text und Bilder | Text |
| Sprachen | Mehr als 160 in den Trainingsdaten | Deutsch und Englisch |
| Kontextfenster | 1 Mio. (Mistral-Doku), rund 524.000 (Artificial Analysis, OpenRouter) | 262.144 nativ, validiert bis 1.048.576 |
| Gewichte | Angekündigt bis Ende Oktober | Auf Hugging Face verfügbar |
| Lizenz | Noch nicht bekannt gegeben | Apache 2.0 für Gewichte und Konfigurationsdateien |
| Speicher für Gewichte | Rund 1 TB bei 8 Bit (Schätzung) | Rund 78 GB (FP8) |
| Zugang heute | Mistral-API und API-Router | Selbst betrieben mit vLLM |
Die Benchmark-Ergebnisse lassen sich nicht direkt vergleichen, weil beide Unternehmen unterschiedliche Testsuiten veröffentlichen. In der Praxis passt Mistral Large 4 zu mehrsprachigen Produkten, zu Dokument- und Bild-Workloads und zu Teams, die ein großes multimodales Modell über eine API nutzen wollen. Kolibri-1 passt zu deutschsprachigen Workloads, die auf selbst kontrollierter Infrastruktur laufen müssen, bei einem Bruchteil der Hardwarekosten.
Was Mistral Large 4 für Europa bedeutet
Mistral hat das Modell von Grund auf in eigenen europäischen Rechenzentren trainiert und betreibt die Preview auf derselben Infrastruktur. Das Modell soll in mehreren Regionen weltweit verfügbar sein, darunter ein europäisches Deployment, das Mistral vollständig selbst betreibt, unabhängig von anderen digitalen Dienstleistern und unter europäischem Recht. Laut Mistral umfassen die Trainingsdaten alle Amtssprachen der EU. Das ist für Produkte relevant, die Kunden in mehreren EU-Ländern bedienen.
Mistral nennt das Modell den ersten Meilenstein auf der Roadmap, die Mistral mit seiner Series-D-Finanzierung über 3 Milliarden Euro finanziert, laut Mistral die größte Eigenkapitalrunde, die ein europäisches Technologieunternehmen je eingeworben hat. Unser Überblick zu in der EU gehosteten KI-Modellen vergleicht den EU-Endpoint von Mistral mit selbst betriebenen Open-Weight-Modellen und weiteren Hosting-Optionen in der EU.
Mistral Large 4 mit Connic nutzen
Connic betreibt KI-Agenten im Produktivbetrieb, mit Deployments, Verbindungen, Guardrails, Approvals, Judges und Traces. Der Katalog der von Connic verwalteten KI-Modelle enthält bereits Mistral Large 3 als connic/mistral-large-2512 und Mistral Medium 3.5, Mistral Large 4 ist dafür geplant. Bis dahin nutzen Agenten Mistral Large 4 über die Mistral-API als eigenen OpenAI-kompatiblen Provider. Die Einrichtung umfasst drei Schritte. Projekte, die OpenRouter bereits mit eigenem Schlüssel nutzen, können stattdessen openrouter/mistralai/mistral-large-4-0 referenzieren.
1. Mistral als eigenen Provider anlegen
Erstelle in Mistral Studio einen API-Schlüssel. Öffne in Connic die Projekt-Settings, gehe zu LLM Provider und wähle Add Custom Provider. Trage einen Anzeigenamen, das Modell-Präfix mistral, die Basis-URL https://api.mistral.ai/v1 und den API-Schlüssel ein. Für Inferenz in Rechenzentren in EU- und EFTA-Staaten nutze stattdessen https://api.eu.mistral.ai/v1 und prüfe, ob das Modell dort verfügbar ist. Die Dokumentation zu eigenen Providern beschreibt die Einrichtung.
2. Das Modell im Agenten referenzieren
Die Modell-ID setzt sich aus dem Provider-Präfix und der Modell-ID von Mistral zusammen:
version: "1.0"
name: contract-review
model: mistral/mistral-large-4
description: "Prüft Lieferantenverträge und markiert riskante Klauseln"
fallback_model: connic/mistral-large-2512
system_prompt: |
Du prüfst Lieferantenverträge...Mit fallback_model wechselt eine fehlgeschlagene Anfrage oder eine Anfrage mit Timeout zum von Connic verwalteten Mistral Large 3, sodass ein Ausfall der Preview den Agenten nicht stoppt.
mistral/ ist ein im Projekt festgelegter Provider-Alias. Sobald Mistral Large 4 im Katalog der von Connic verwalteten KI-Modelle ist, ändert ein Wechsel nur die Zeile model, und der Provider-Schlüssel wird nicht mehr gebraucht.3. Vor dem Rollout testen
Preview-Ergebnisse können sich von Woche zu Woche ändern, und das Modell schreibt lange Ausgaben. Ein A/B-Test in Connic behält den bestehenden Agenten als Basisagenten (Control) und schickt einen Teil des Live-Traffics an eine Variantendatei wie contract-review-test-large-4.yaml. Judges bewerten beide Versionen nach denselben Kriterien, die Runs-Tabelle zeigt die Token-Anzahl pro Run, und der Test pausiert eine Variante, die ihre Grenzen für Fehlerrate oder Qualität verletzt.
Binde Mistral Large 4 schon heute als eigenen Provider an und teste es mit A/B-Tests, Judges und Traces gegen verwaltete KI-Modelle, die in der EU laufen.
Kostenlos starten