Vai al contenuto
Banner grafico di Microsoft-Decision-1 con griglia di punti su sfondo verde acido.

Foto: Microsoft / Source (Used with permission from Microsoft.)

Microsoft ha presentato Microsoft-Decision-1, un modello per il decision-scoring: non scrive testo, ma restituisce decisioni strutturate che il software può usare subito. Secondo il post pubblicato da Microsoft il 9 ottobre, è disponibile in Microsoft Foundry e tramite OpenRouter. Nei benchmark dell’azienda ha ottenuto la massima accuratezza ed è risultato il più veloce tra quelli misurati: 35 volte più rapido di GPT-6 Sol.

Che cosa fa un modello decisionale rispetto a un LLM

Secondo Microsoft, Decision-1 è Qwen3.5-9B post-addestrato per dare punteggi di decisione in un solo passaggio; l’azienda annuncia che lo ribaserà presto su altri modelli, compresi quelli di Microsoft AI (MAI) e di OpenAI. Il post è firmato da Achint Srivastava, VP of Software Engineering nell’Office of the CTO di Microsoft. Per l’azienda i modelli decisionali sono una categoria emergente: a differenza degli LLM, pensati per generare testo o ragionare su problemi complessi, producono output strutturati su cui un’applicazione può agire subito.

La documentazione di Microsoft Learn precisa che Decision-1 non genera risposte libere né motivazioni scritte. Formula un giudizio su un testo o su un JSON e restituisce una decisione numerica tipizzata, con probabilità da usare come soglia o per ordinare i risultati.

Gli usi indicati da Microsoft

Il modello è pensato per compiti in cui serve un’uscita prevedibile, da inserire in applicazioni, agenti e flussi di lavoro esistenti. Il post cita:

  • instradamento (routing);
  • classificazione;
  • assegnazione di priorità;
  • verifica;
  • controllo del flusso di lavoro.

La documentazione aggiunge esempi concreti: smistare ticket di assistenza, dare priorità agli incidenti, filtrare contenuti, valutare l’output di altri modelli, scegliere il modello, lo strumento o l’agente che deve gestire una richiesta. Per creare, riassumere o spiegare contenuti serve invece un LLM generativo; i due approcci si possono combinare, usando Decision-1 per instradare o filtrare e poi passando la richiesta a un modello generativo.

I numeri dei benchmark

Secondo il post, Decision-1 ha raggiunto la massima accuratezza in un confronto su 36 benchmark, per quasi 150.000 domande complessive, tenuti ciechi rispetto all’addestramento. Sulla velocità Microsoft riporta due confronti, misurati dall’azienda stessa.

Modello di confronto Decision-1 è più veloce di
H2O-Lightning-4B v1.1 (secondo classificato) 2,5 volte
GPT-6 Sol 35 volte

Per il confronto più ampio Microsoft ha preso diversi dei modelli in testa a JevBench, una classifica pubblica molto seguita, e li ha provati su 36 benchmark pubblici e privati; una nota dell’editore avverte che il post è stato aggiornato per aggiungere anche i risultati di Jev su accuratezza e calibrazione.

Come si usa: tre tipi di domanda

Secondo Microsoft Learn, la richiesta contiene uno stato (testo o JSON) e una o più domande tipizzate. Le risposte arrivano in un oggetto answers che riprende i nomi delle domande, insieme al nome del modello e al consumo di token.

  • noul: una condizione vero/falso, per esempio se una risposta promette un rimborso; restituisce una probabilità da 0 a 1.
  • choice: una sola etichetta da un insieme fisso; restituisce l’opzione scelta e la probabilità di ciascuna.
  • score: una posizione su una scala ordinata; il punteggio è la media, pesata per le probabilità, degli indici dei livelli, quindi con quattro livelli va da 0 a 3 e può cadere tra un livello e l’altro.

Più domande sullo stesso stato possono stare in un’unica richiesta. L’endpoint è /providers/microsoft/v1/systemone sulla risorsa Foundry, e il valore model della richiesta è il nome del deployment, non quello del modello.

Distribuzione e requisiti

Il modello si trova nel catalogo di Foundry e si distribuisce dal portale o con l’Azure CLI. Servono una sottoscrizione Azure con metodo di pagamento valido, un progetto Foundry, il permesso di creare deployment e Python 3.10 o successivo per l’esempio della guida. L’autenticazione può usare Microsoft Entra ID, consigliato, oppure una chiave API.

I tipi di deployment sono DataZoneStandard, in alcune regioni, e GlobalStandard. Il primo mantiene l’elaborazione nella data zone scelta; il secondo dà accesso alla capacità globale, ma la latenza può essere più alta o variabile. Microsoft consiglia di misurare il proprio carico.

Decision-1 accanto agli altri modelli decisionali

Decision-1 arriva dopo altri modelli dello stesso tipo, di cui abbiamo già scritto: Laya di Convai Innovations, da installare in locale, Clef e Clef-flash di Cloudflare, d1-3B e d1-omni-600M di Liquid AI e la Decisions API di OpenAI. La tabella riassume ciò che dichiarano i rispettivi produttori: la scheda di Laya su Hugging Face, il blog di Cloudflare, l’annuncio di Liquid AI su Hugging Face e la guida di OpenAI. Non sono confronti di prestazioni: le fonti non li misurano insieme.

Modello Chi lo fa Pesi aperti o solo cloud Dove gira Tipi di domanda
Microsoft-Decision-1 Microsoft pesi non indicati Microsoft Foundry e OpenRouter noul, choice, score
Laya Convai Innovations pesi aperti, licenza Apache 2.0 in locale con pip install laya, anche con server HTTP choice, score, noul
Clef e Clef-flash Cloudflare pesi aperti su Hugging Face, Apache 2.0; anche ospitati Workers AI di Cloudflare o in locale noul, choice, score; accetta anche immagini
d1-3B e d1-omni-600M Liquid AI pesi aperti su Hugging Face dispositivi edge (Jetson, Apple M5 Pro), GPU RTX 4090 e AMD MI325X noul, choice, score; testo e immagini (d1-omni-600M anche audio)
Decisions API (gpt-6-luna) OpenAI solo API, beta pubblica endpoint /v1/decisions predicate, choice, score

Limiti e avvertenze dichiarati

La documentazione elenca diversi rischi: il modello può riflettere i pregiudizi del modello di base e dei dati di addestramento; i punteggi cambiano con la formulazione e l’ordine di domande e opzioni; la calibrazione è migliore sui tipi di compito familiari; come filtro di sicurezza può non rilevare contenuti dannosi sottili o segnalarne di innocui.

Per le decisioni che riguardano le persone, come credito, impiego, abitazione, sanità o questioni legali, Microsoft Learn indica di usare il modello come supporto, con una revisione umana significativa, e non come unico decisore. Consiglia anche soglie di confidenza basate sul costo di falsi positivi e falsi negativi e un’opzione di astensione come «cannot tell». Prezzi e disponibilità specifici per l’Italia non sono indicati nelle pagine citate.

Leggi anche