Microsoft ha presentato Microsoft-Decision-1, un modello per il decision-scoring: non scrive testo, ma restituisce decisioni strutturate che il software può usare subito. Secondo il post pubblicato da Microsoft il 9 ottobre, è disponibile in Microsoft Foundry e tramite OpenRouter. Nei benchmark dell’azienda ha ottenuto la massima accuratezza ed è risultato il più veloce tra quelli misurati: 35 volte più rapido di GPT-6 Sol.
Che cosa fa un modello decisionale rispetto a un LLM
Secondo Microsoft, Decision-1 è Qwen3.5-9B post-addestrato per dare punteggi di decisione in un solo passaggio; l’azienda annuncia che lo ribaserà presto su altri modelli, compresi quelli di Microsoft AI (MAI) e di OpenAI. Il post è firmato da Achint Srivastava, VP of Software Engineering nell’Office of the CTO di Microsoft. Per l’azienda i modelli decisionali sono una categoria emergente: a differenza degli LLM, pensati per generare testo o ragionare su problemi complessi, producono output strutturati su cui un’applicazione può agire subito.
La documentazione di Microsoft Learn precisa che Decision-1 non genera risposte libere né motivazioni scritte. Formula un giudizio su un testo o su un JSON e restituisce una decisione numerica tipizzata, con probabilità da usare come soglia o per ordinare i risultati.
Gli usi indicati da Microsoft
Il modello è pensato per compiti in cui serve un’uscita prevedibile, da inserire in applicazioni, agenti e flussi di lavoro esistenti. Il post cita:
- instradamento (routing);
- classificazione;
- assegnazione di priorità;
- verifica;
- controllo del flusso di lavoro.
La documentazione aggiunge esempi concreti: smistare ticket di assistenza, dare priorità agli incidenti, filtrare contenuti, valutare l’output di altri modelli, scegliere il modello, lo strumento o l’agente che deve gestire una richiesta. Per creare, riassumere o spiegare contenuti serve invece un LLM generativo; i due approcci si possono combinare, usando Decision-1 per instradare o filtrare e poi passando la richiesta a un modello generativo.
I numeri dei benchmark
Secondo il post, Decision-1 ha raggiunto la massima accuratezza in un confronto su 36 benchmark, per quasi 150.000 domande complessive, tenuti ciechi rispetto all’addestramento. Sulla velocità Microsoft riporta due confronti, misurati dall’azienda stessa.
| Modello di confronto | Decision-1 è più veloce di |
|---|---|
| H2O-Lightning-4B v1.1 (secondo classificato) | 2,5 volte |
| GPT-6 Sol | 35 volte |
Per il confronto più ampio Microsoft ha preso diversi dei modelli in testa a JevBench, una classifica pubblica molto seguita, e li ha provati su 36 benchmark pubblici e privati; una nota dell’editore avverte che il post è stato aggiornato per aggiungere anche i risultati di Jev su accuratezza e calibrazione.
Come si usa: tre tipi di domanda
Secondo Microsoft Learn, la richiesta contiene uno stato (testo o JSON) e una o più domande tipizzate. Le risposte arrivano in un oggetto answers che riprende i nomi delle domande, insieme al nome del modello e al consumo di token.
noul: una condizione vero/falso, per esempio se una risposta promette un rimborso; restituisce una probabilità da 0 a 1.choice: una sola etichetta da un insieme fisso; restituisce l’opzione scelta e la probabilità di ciascuna.score: una posizione su una scala ordinata; il punteggio è la media, pesata per le probabilità, degli indici dei livelli, quindi con quattro livelli va da 0 a 3 e può cadere tra un livello e l’altro.
Più domande sullo stesso stato possono stare in un’unica richiesta. L’endpoint è /providers/microsoft/v1/systemone sulla risorsa Foundry, e il valore model della richiesta è il nome del deployment, non quello del modello.
Distribuzione e requisiti
Il modello si trova nel catalogo di Foundry e si distribuisce dal portale o con l’Azure CLI. Servono una sottoscrizione Azure con metodo di pagamento valido, un progetto Foundry, il permesso di creare deployment e Python 3.10 o successivo per l’esempio della guida. L’autenticazione può usare Microsoft Entra ID, consigliato, oppure una chiave API.
I tipi di deployment sono DataZoneStandard, in alcune regioni, e GlobalStandard. Il primo mantiene l’elaborazione nella data zone scelta; il secondo dà accesso alla capacità globale, ma la latenza può essere più alta o variabile. Microsoft consiglia di misurare il proprio carico.
Decision-1 accanto agli altri modelli decisionali
Decision-1 arriva dopo altri modelli dello stesso tipo, di cui abbiamo già scritto: Laya di Convai Innovations, da installare in locale, Clef e Clef-flash di Cloudflare, d1-3B e d1-omni-600M di Liquid AI e la Decisions API di OpenAI. La tabella riassume ciò che dichiarano i rispettivi produttori: la scheda di Laya su Hugging Face, il blog di Cloudflare, l’annuncio di Liquid AI su Hugging Face e la guida di OpenAI. Non sono confronti di prestazioni: le fonti non li misurano insieme.
| Modello | Chi lo fa | Pesi aperti o solo cloud | Dove gira | Tipi di domanda |
|---|---|---|---|---|
| Microsoft-Decision-1 | Microsoft | pesi non indicati | Microsoft Foundry e OpenRouter | noul, choice, score |
| Laya | Convai Innovations | pesi aperti, licenza Apache 2.0 | in locale con pip install laya, anche con server HTTP |
choice, score, noul |
| Clef e Clef-flash | Cloudflare | pesi aperti su Hugging Face, Apache 2.0; anche ospitati | Workers AI di Cloudflare o in locale | noul, choice, score; accetta anche immagini |
| d1-3B e d1-omni-600M | Liquid AI | pesi aperti su Hugging Face | dispositivi edge (Jetson, Apple M5 Pro), GPU RTX 4090 e AMD MI325X | noul, choice, score; testo e immagini (d1-omni-600M anche audio) |
| Decisions API (gpt-6-luna) | OpenAI | solo API, beta pubblica | endpoint /v1/decisions |
predicate, choice, score |
Limiti e avvertenze dichiarati
La documentazione elenca diversi rischi: il modello può riflettere i pregiudizi del modello di base e dei dati di addestramento; i punteggi cambiano con la formulazione e l’ordine di domande e opzioni; la calibrazione è migliore sui tipi di compito familiari; come filtro di sicurezza può non rilevare contenuti dannosi sottili o segnalarne di innocui.
Per le decisioni che riguardano le persone, come credito, impiego, abitazione, sanità o questioni legali, Microsoft Learn indica di usare il modello come supporto, con una revisione umana significativa, e non come unico decisore. Consiglia anche soglie di confidenza basate sul costo di falsi positivi e falsi negativi e un’opzione di astensione come «cannot tell». Prezzi e disponibilità specifici per l’Italia non sono indicati nelle pagine citate.