Glm 5.3 sfida. Il modello cinese GLM 5.3, sviluppato da Z.ai, ha dimostrato capacità offensive nella sicurezza informatica paragonabili a quelle di Claude Mythos. Questa valutazione è stata condotta da Anthropic, che ha pubblicato un’analisi dedicata alla capacità dei modelli linguistici di individuare vulnerabilità e trasformarle in exploit funzionanti.

L’analisi giunge dopo una valutazione indipendente del National Institute of Standards and Technology (NIST) e prende in esame sia le prestazioni tecniche dei modelli, sia la solidità delle protezioni integrate. Un elemento chiave emerso è la disponibilità pubblica dei pesi di GLM 5.3, che consente un intervento diretto sul comportamento del modello, modificando i meccanismi progettati per bloccare richieste potenzialmente dannose.
Glm 5.3 sfida: perché è importante
Capacità di GLM 5.3 nello sfruttamento delle vulnerabilità
Per garantire la sicurezza dei test e prevenire impatti su sistemi reali, Anthropic ha condotto tutte le valutazioni in ambienti isolati e protetti (sandbox). Utilizzando ExploitBench, un benchmark specificamente progettato per lo sviluppo di exploit basati su vulnerabilità note nel motore V8 di Google Chrome, GLM 5.3 è stato in grado di generare exploit completi e funzionanti in 50 tentativi su un totale di 410.
In una prova interna focalizzata sulla binary exploitation, il modello ha ottenuto il controllo completo del flusso di esecuzione nel 4% dei casi su 100 tentativi. Questi risultati dimostrano una capacità concreta di passare dall’analisi di un difetto alla costruzione di un attacco funzionale, sebbene ciò non implichi automaticamente la possibilità di compromettere sistemi reali.
Sessioni di test con ricercatori esperti hanno fornito ulteriori dettagli qualitativi. Lavorando su una build Linux di un browser web, il modello cinese ha identificato diverse vulnerabilità precedentemente sconosciute nel motore JavaScript e le ha concatenate in un attacco capace di leggere file arbitrari dal computer della vittima simulata. Nello stesso contesto sono state individuate falle sfruttabili anche in driver wireless, driver grafici e software destinato a dispositivi esposti alla rete.
In un test aggiuntivo, la variante GLM 5.3 Flash, partendo da una vulnerabilità nota di Chrome, ha costruito una catena di exploit per un sistema basato su architettura ARM64, riuscendo ad aggirare il meccanismo di protezione Pointer Authentication.
Il NIST aveva già esaminato GLM 5.3 il 17 settembre 2026, definendolo il modello open-weight con le maggiori capacità in ambito cyber tra quelli analizzati dall’ente. La valutazione si è basata su quattro benchmark specifici e su un indice composito costruito utilizzando un modello statistico IRT (Item Response Theory), che separa la difficoltà dei singoli compiti dalle abilità intrinseche dei sistemi testati.
Su SEC Bench Pro, il modello ha risolto correttamente il 40,4% delle prove proposte. Su ExploitGym e OSS Fuzz, i risultati sono stati rispettivamente del 9,4% e del 7,7%. Secondo le stime del NIST, il divario prestazionale rispetto ai modelli statunitensi più avanzati nell’indice aggregato sarebbe di circa quattro mesi.
Protezioni modificabili
Un aspetto distintivo di GLM 5.3 è la possibilità di intervenire direttamente sui suoi pesi interni. I ricercatori hanno sperimentato una tecnica chiamata “abliteration”, ottenendo una significativa riduzione dei rifiuti (rifiuto di rispondere a richieste potenzialmente dannose) senza compromettere in modo sostanziale le prestazioni generali del modello.
L’operazione ha richiesto circa 2.200 ore di calcolo su GPU e un costo stimato di circa 3.800 euro in token di calcolo, ma per un team di esperti la stima si riduce a circa 600 ore GPU. Dopo l’applicazione della tecnica, i rifiuti sono crollati al 3% su JailbreakBench e al 2% su HarmBench.
Anche lasciando intatti i pesi del modello, i test hanno dimostrato la possibilità di aggirare le protezioni integrate. In una simulazione, una richiesta presentata come attività di “red teaming” (simulazione di attacchi per identificare vulnerabilità) ha spinto il modello a procedere nel 64% dei casi, con una percentuale salita al 92% quando accompagnata da un ragionamento precompilato.
Anthropic precisa che il codice generato durante i test non è stato eseguito e che l’ambiente simulato non consentiva connessioni verso sistemi esterni. Questo limita la portata delle conclusioni, ma evidenzia comunque la facilità con cui il comportamento del modello può essere modificato.
Un sistema di protezione implementato tramite un servizio remoto può essere aggiornato centralmente, mentre un modello installato in locale offre un maggiore controllo all’utente che lo utilizza. Z.ai descrive GLM 5.3 come un’evoluzione ottenuta attraverso il post-training della versione precedente, con un miglioramento del 50% nel proprio benchmark interno, Z.ai Code Bench.
Per questo motivo, secondo Anthropic, è fondamentale valutare non solo le capacità di un modello al momento del rilascio, ma anche la semplicità con cui i suoi vincoli operativi possono essere modificati e bypassati.
Fonte e approfondimento su glm 5.3 sfida: articolo originale.
* Contenuto realizzato con l'ausilio di sistemi di intelligenza artificiale.
Hardware Ready Ready to Bench?