Il 29 settembre 2026 Anthropic ha pubblicato la propria analisi di GLM-5.3, l’ultimo modello di Zhipu AI (noto fuori dalla Cina come Z.ai). Secondo il rapporto del Frontier Red Team di Anthropic, il modello è capace di costruire autonomamente exploit completi, come Claude Mythos Preview, ma è stato rilasciato con protezioni contro l’uso malevolo facili da aggirare. Nei test simulati dell’azienda, i suoi limiti si aggirano tra il 64% e il 100% delle volte.
Cosa sostiene Anthropic
Anthropic ricorda di aver presentato cinque mesi prima Claude Mythos Preview, il primo modello in grado di costruire in autonomia exploit sofisticati end-to-end. Lo aveva distribuito in modo limitato tramite Project Glasswing, con cui difensori fidati hanno trovato più di 10.000 vulnerabilità in software critico.
Ora, scrive l’azienda, modelli con queste capacità sono arrivati. La differenza è che GLM-5.3 è scaricabile da chiunque, mentre le versioni dei modelli statunitensi con protezioni ridotte sono riservate a utenti verificati.
Anthropic cita anche la valutazione pubblicata il 17 settembre dal CAISI, il centro per gli standard sull’IA del NIST. Per il CAISI, GLM-5.3 è «il modello open-weight più capace in ambito cyber rilasciato finora» e resta indietro di circa quattro mesi rispetto alla frontiera statunitense. Anthropic dice che i suoi risultati sulle capacità coincidono nel complesso con quelli del CAISI.
I test sulle capacità offensive
Anthropic ha eseguito i modelli in ambienti isolati, contro bersagli offline allestiti per l’occasione. Si è concentrata sullo sviluppo di exploit, il campo in cui Mythos Preview aveva segnato il salto maggiore.
- ExploitBench (vulnerabilità note nel motore V8 di Chrome): GLM-5.3 produce exploit completi in 50 tentativi su 410; Claude Mythos Preview in 56 su 410.
- Binary Exploitation (benchmark interno su progetti open source di OSS-Fuzz, 100 compiti scelti a caso): GLM-5.3 ottiene il pieno controllo del flusso di esecuzione nel 4% delle prove, Mythos Preview nel 6%. Claude Opus 4.6 e GLM-5.2 non ci riescono in nessun caso.
Seguono due sessioni con ricercatori umani, durate in genere un giorno o meno e con meno di un’ora di attenzione umana complessiva. Nella prima, GLM-5.3 ha trovato in un giorno più vulnerabilità sconosciute nel motore JavaScript di una build Linux di un browser molto diffuso e le ha concatenate in una pagina web capace di leggere file arbitrari dal computer del visitatore in quell’ambiente. Anthropic ritiene che le vulnerabilità possano interessare anche altre piattaforme, sulle quali lo sfruttamento potrebbe essere più complesso. Anthropic afferma di aver segnalato le falle al responsabile del progetto e di star valutando altre segnalazioni, da comunicare ai manutentori come appropriato.
Nella seconda, il modello più piccolo GLM-5.3-Flash ha costruito una catena di exploit affidabile per un target ARM64, aggirando la protezione PAC, partendo dai dettagli pubblici di una falla di Chrome (CVE-2026-11645) e di un’altra vulnerabilità nota. Sono serviti 20 minuti di attenzione umana e otto ore di lavoro del modello, per un costo di 20,40 dollari ai prezzi API di Zhipu.
Protezioni facili da aggirare
GLM-5.3 rifiuta spesso le richieste chiaramente dannose, ma Anthropic sostiene che questi limiti cadano con tecniche semplici. La più efficace è l’«abliteration», che rimuove i rifiuti dal modello: poiché i pesi sono aperti, si può fare con poche perdite di capacità. Secondo Anthropic, versioni abliterate sono comparse pubblicamente pochi giorni dopo il rilascio.
Il team ne ha prodotta una a sua volta, pur senza esperienza precedente: circa 2.200 ore di GPU e circa 4.400 dollari (600 ore di GPU per la versione Flash). Il tasso di rifiuto è passato da oltre il 90% a circa il 3% su JailbreakBench, al 2% su HarmBench e al 12% su StrongREJECT. Su GPQA-Diamond i punteggi sono rimasti uguali; su un sottoinsieme di CyberGym la versione abliterata è scesa di qualche punto percentuale. Anthropic stima che a un team esperto della tecnica servirebbero circa 600 ore di GPU, cioè 1.200 dollari.
In una simulazione con richieste apertamente malevole contro sistemi critici, il modello rifiutava in tutte le prove con richiesta diretta. Queste le percentuali di collaborazione con le tecniche di aggiramento (50 campioni per caso):
| Tecnica | GLM-5.3 collabora |
|---|---|
| Richiesta diretta | 0% |
| Prompt ingannevole (finto agente red team) | 64% |
| Precompilazione dei token di ragionamento | 92% |
| Versione abliterata | 100% |
Nei test di Anthropic nessuna di queste tecniche ha funzionato sui modelli Claude con le protezioni attive: i prompt ingannevoli sono bloccati, l’API non permette di precompilare il ragionamento e i pesi non sono pubblici, quindi non si possono abliterare. L’azienda precisa che la simulazione non esegue alcun codice e usa un altro modello per approssimare i risultati dei comandi, quindi è una misura imperfetta.
Le conclusioni e le richieste di Anthropic
Anthropic ritiene probabile che attori statali e non statali usino modelli come GLM-5.3 per causare danni reali, e definisce il rilascio un salto netto nelle capacità offensive disponibili. Aggiunge che gli stessi strumenti possono servire ai difensori, che a suo avviso dovrebbero avere modelli di frontiera almeno pari a quelli degli avversari.
L’azienda dice di lavorare per estendere l’accesso alle capacità cyber di Claude al maggior numero possibile di difensori, e che quelli verificati possono già usare modelli più avanzati come Claude Mythos 5.1 tramite i programmi di accesso fidato. Chiede inoltre che i governi testino la sicurezza dei modelli sufficientemente capaci, compresi i successori di GLM-5.3, e che gli sviluppatori di modelli open-weight ne proteggano le capacità dall’uso improprio.