Cloudflare ha rilasciato Clef e Clef-flash, due modelli di decisione addestrati internamente. Come spiega il blog ufficiale di Cloudflare, sono ospitati su Workers AI e i pesi sono pubblicati su Hugging Face con licenza Apache 2.0, quindi si possono eseguire anche in locale. Clef è la versione da 27 miliardi di parametri, pensata per la precisione. Clef-flash è quella più piccola e veloce, per le decisioni in cui conta la latenza.
Che cos’è un modello di decisione e a cosa serve
Secondo Cloudflare, un modello di decisione classifica un input e restituisce risposte tipizzate con le relative probabilità. Il codice può usarle per instradare un ticket, far scattare un’escalation o passare la mano a una persona.
La scheda del modello su Hugging Face, pubblicata da Cloudflare, precisa che Clef legge lo stato come testo, JSON, immagini o video. Restituisce una probabilità per ogni opzione ammessa di ogni domanda in un solo passaggio, senza generare testo libero e senza dover interpretare l’output.
Cloudflare racconta di averlo provato nel team Threat Intelligence per classificare i domini. Con Browser Run, Clef ha recuperato, renderizzato e classificato un sito in 2,2 secondi. Secondo Cloudflare, gpt-oss-120b, il suo modello generalista più veloce, ha impiegato 4,7 secondi nello stesso flusso e ha restituito solo due classificazioni.
Le differenze rispetto a Jev
Cloudflare prende come riferimento Jev, il modello di Typesafe AI, e dichiara l’API di Clef completamente compatibile, così da poter cambiare modello con poco lavoro. Le differenze indicate dall’azienda:
- Clef ha un encoder visivo e classifica anche immagini, mentre Jev oggi tratta solo testo.
- La finestra di contesto è di 64k, contro i 32k di Jev. Nella scheda su Hugging Face, però, il limite predefinito di
encode_recordè 16.384 token. - Le domande sono di tre tipi:
noul(vero/falso),choice(opzioni con nome) escore(opzioni ordinate).
I benchmark pubblicati da Cloudflare
I risultati vengono dal Jev Decision Index, eseguito da Cloudflare stessa, con una demo online. Nella tabella una selezione di voci, in percentuale tranne le latenze in millisecondi.
| Benchmark | Clef | Clef-flash | Jev |
|---|---|---|---|
| BFCL (case exact) | 98,47 | 98,76 | 95,75 |
| BANKING77 (macro-F1) | 94,20 | 90,93 | 79,74 |
| CLINC150+OOS (macro-F1) | 97,43 | 66,77 | 89,27 |
| Home appliances (case exact) | 82,95 | 97,73 | 52,27 |
| When2Call (accuracy) | 72,37 | 65,58 | 80,97 |
| Latenza mediana (ms) | 209,3 | 38,8 | 524,1 |
| Latenza p95 (ms) | 238,6 | 122,4 | 536,0 |
Non sempre Jev resta indietro: su When2Call e BRIGHT è davanti, e nella scheda su Hugging Face anche su ANLI.
Sulla suite di valutazione di Typesafe, Clef supera Jev in tre aree su quattro: elaborazione fatture (64,7 contro 61,8), assistenza clienti (76,3 contro 76,0) e incidenti di sicurezza (62,9 contro 61,7). Jev guida su agent trace observability (71,6 contro 68,5). Sulla latenza, secondo Cloudflare i suoi modelli battono gli altri decisori, con l’eccezione di Laya, più veloce ma meno accurato nei test.
Come è costruito
Secondo la scheda su Hugging Face, Clef è post-addestrato a partire da Qwen3.8-27B, di cui mantiene l’encoder visivo. Sopra c’è una piccola testa transformer che legge gli stati finali del modello di base, collega le informazioni dello stato a ogni domanda e valuta insieme tutte le opzioni.
L’output è un logit per ogni opzione ammessa di ciascuna domanda: applicando una softmax domanda per domanda si ottengono le probabilità.
Come provarlo
Su Workers AI si invia una richiesta POST a https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/clef, sostituendo {ACCOUNT_ID} con l’identificativo del proprio account e autenticandosi con Authorization: Bearer {API_TOKEN}. Il corpo JSON deve includere "model": "clef", lo stato nel campo state e le domande nel campo questions. In locale, la scheda su Hugging Face indica che gli esempi sono stati provati con torch 2.11 e transformers 5.10.2 su una singola GPU H200. Per immagini e video serve anche pillow.
Il servizio di fine-tuning con apprendimento per rinforzo
Cloudflare presenta anche un nuovo prodotto di apprendimento per rinforzo, con cui i clienti possono affinare Clef sui propri casi d’uso.
Secondo la pagina del modello nella documentazione di Workers AI, Clef costa 0,24 dollari per milione di token in input. Non ci sono dettagli sulla disponibilità in Italia.