Il 6 ottobre 2026 Mistral ha aperto l’anteprima pubblica di Mistral Large 4, chiamato informalmente ML4 e ufficialmente «le Chonk». Secondo l’annuncio di Mistral è un modello nativamente multimodale da mille miliardi di parametri, con 49 miliardi di parametri attivi, il più grande e capace dell’azienda. L’API di anteprima si prova su Mistral Studio, mentre i pesi saranno rilasciati entro la fine di ottobre.

Anteprima via API e pesi entro fine mese
Mistral spiega che fino al rilascio dei pesi sta mettendo alla prova il modello in contesti reali con esperti di cybersecurity, partner verificati e autorità statali. Questi soggetti usano lo stesso modello con moderazione ridotta e capacità cyber ampliate.
Insieme ai pesi l’azienda promette più dettagli sull’architettura, altri benchmark e la metodologia di post-addestramento. ML4 farà inoltre da base a una nuova generazione di modelli Mistral specializzati.
Architettura, contesto e prezzi in dollari
La scheda nella documentazione di Mistral descrive un modello open-weight generalista con architettura Mixture-of-Experts a grana fine: 1,05 mila miliardi di parametri totali, 49 miliardi attivi e un encoder visivo da 1,6 miliardi. La finestra di contesto è di 1 milione di token.
| Voce | Valore |
|---|---|
| Input | 0,68 $ per milione di token |
| Output | 2,09 $ per milione di token |
| Contesto | 1 milione di token |
| Parametri totali / attivi | 1,05 mila miliardi / 49 miliardi |
I prezzi sono in dollari: quelli in euro non sono stati comunicati. Tra le funzioni elencate nella documentazione ci sono output strutturati, chiamate di funzione, domande sui documenti, batching, agenti e strumenti integrati.
Addestrato in Europa, con tutte le lingue dell’UE
Secondo Mistral, ML4 è stato addestrato da zero su 3.800 GPU Nvidia Grace Blackwell nei propri datacenter europei, gli stessi che servono l’anteprima. Il modello sarà disponibile in più regioni, compresa una distribuzione europea gestita da Mistral end-to-end, indipendentemente da altri fornitori di servizi digitali e sotto il diritto europeo.
Una quota significativa dei dati era multilingue, con oltre 160 lingue, tra cui tutte le lingue ufficiali dell’Unione europea. L’azienda aggiunge che il modello usa lo stesso ambiente di addestramento, personalizzazione e reinforcement learning offerto ai clienti con Mistral Forge.
I risultati dichiarati da Mistral
I numeri che seguono sono quelli pubblicati dall’azienda e non sono stati verificati in modo indipendente.
- Cybersecurity: sull’Artificial Analysis Cyber Index il modello è tra i primi cinque a livello globale. In una prova che chiede di riprodurre una vulnerabilità reale in software open source e poi correggerla ottiene l’82%, il punteggio più alto di tutti i modelli. Su Cybench risolve il 93% delle 40 sfide.
- Coding agentico: 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4, con un Coding Agent Index di 49,8%, davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max. Sono valori valutati privatamente da Artificial Analysis prima del lancio pubblico del suo strumento di test.
- Valutazione umana sul codice: nel test in cieco con Surge AI, su scala da 1 a 5, ML4 Preview è secondo su cinque modelli con 3,74, dietro solo a Claude Opus 5 (4,22).
- Flussi di lavoro: 59,9% su AutomationBench, che comprende 657 flussi aziendali su app come Gmail, Google Sheets, Slack e Salesforce.
- Visione: su Dense 200 Mistral riporta 42% contro il 41% di GPT-6 Astra.
Sul fronte cyber, Mistral sostiene che modelli chiusi come Claude Opus 5.5 e GPT-6 Astra ottengano punteggi vicini a zero nella prova di riproduzione e correzione delle vulnerabilità perché rifiutano il compito. ML4, dice l’azienda, potrà girare anche su cloud privato o on-premise.
Robustezza e rifiuti sulle richieste malevole
Mistral riferisce che ML4 resiste al 93,3% degli attacchi del benchmark B3 di Lakera e ottiene 1,691 su un massimo di 2 nel KORA Benchmark, il punteggio più alto da lei misurato tra i modelli open-weight. Il tasso medio di rifiuto sulle richieste malevole in ambito cyber, calcolato su JailbreakBench, StrongREJECT e AgentHarm, è per l’azienda superiore a quello di tutti i modelli open-weight confrontati.
Cosa viene dopo l’anteprima
L’addestramento con reinforcement learning dietro l’anteprima è ancora in corso e, secondo Mistral, il modello non mostra segni di saturazione. L’azienda collega il lavoro al round di Serie D da 3 miliardi di euro e dice di essere impegnata ad ampliare la capacità di calcolo nei propri datacenter europei.