Torna agli articoli
Articoli Pubblicato il 14 agosto 2026

GLM-5.3: Z.ai ha rinviato i pesi citando la capacità cyber e ha pubblicato 2.436 vulnerabilità come prova — 2.239 non sono mai uscite dalla scoperta

Z.ai ha rinviato i pesi aperti di GLM-5.3 sostenendo che la capacità offensiva del modello è cresciuta più in fretta del previsto, e ha offerto come prova un ledger pubblico di 2.436 vulnerabilità in software reale. Ho scaricato e contato l’intero ledger: il 92% delle scoperte non è mai stato segnalato a nessuno, esattamente una risulta inviata al manutentore, non è dichiarata alcuna scadenza di embargo e nessun record attribuisce la scoperta a un modello — il 21% ha usato Claude Code come harness.

#glm#z.ai#llm#benchmarks#open-weights#seguranca

Z.ai ha lanciato GLM-5.3 oggi, 14 agosto, con un argomento che — per quanto risulta dalla copertura giornalistica — nessun laboratorio di pesi aperti aveva mai usato prima: il modello è diventato troppo bravo in sicurezza offensiva, quindi i pesi arriveranno tra due settimane. L'annuncio dell'azienda stessa lo dice in una riga: "API access and open weights will be released in stages following rigorous safety evaluations."

La prova offerta è generosa e verificabile: un ledger pubblico su cvd.z.ai con 2.436 vulnerabilità trovate in 269 progetti di software reale. È il tipo di evidenza che si può verificare — così l'ho verificata. Ho scaricato il payload della pagina del ledger (2 MB, i 2.436 record sono incorporati) e ho contato campo per campo.

2.239 di queste vulnerabilità — il 92% — sono ancora allo stadio "scoperta". Non sono mai state segnalate a nessuno. Esattamente una è contrassegnata come "inviata al manutentore". E c'è un'assenza più grande: nessuno dei 2.436 record attribuisce la scoperta a un modello. La stringa "GLM" non compare nemmeno una volta nell'intero insieme.


Che cosa è cambiato davvero

I fatti verificabili, dal post ufficiale, dalla documentazione e dall'annuncio dell'azienda su X:

VoceGLM-5.3
Che cos'èlo stesso modello base da 743B del GLM-5.2, con post-training scalato — architettura intatta
Contesto1 milione di token · output fino a 128 mila
Livelli di sforzolow · high · max (default max)
Modifica che rompe il codicedisattivare il thinking non è più supportato — la vecchia chiamata con thinking.type: "disabled" fallisce
Prezzo per tokennon pubblicato — la tabella ufficiale non ha una riga per GLM-5.3 (quella del 5.2 resta a US$ 1,40 in ingresso / US$ 4,40 in uscita)
Disponibilità al giorno 1GLM Coding Plan e ZCode. API e pesi aperti: "in fasi"
Pesipromessi per ~due settimane dopo, previa "safety evaluation and hardening"
Licenzanon dichiarata — la MIT del GLM-5.2 non si estende automaticamente

La frase che organizza l'intero lancio è quella dell'annuncio stesso: i guadagni sono venuti dal "post-training on the 743B base model". Stessa base, stessa dimensione, ricetta nuova. Tenetelo a mente; torna due sezioni più avanti.

Un lancio di pesi aperti senza pesi, senza prezzo e senza licenza

Vale la pena dirlo a chiare lettere, perché la copertura giornalistica ci è passata sopra: nel giorno del lancio, GLM-5.3 non è un modello a pesi aperti. Non c'è un repository su Hugging Face, non c'è una model card, non c'è una licenza dichiarata, non c'è un prezzo per token e l'API pubblica non è aperta. Ci sono un abbonamento mensile e un agente proprietario. Tutto il resto è promessa datata — e la data è la stessa che fa da argomento di sicurezza.


La tabella integrale

Il post presenta 16 benchmark contro 7 concorrenti. La tabella completa, trascritta dai dati del post stesso:

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 ProQwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188,281,088,387,986,685,088,088,8
Terminal Bench 3.028,34,617,421,133,734,6
DeepSWE (v1.1)66,946,267,562,756,658,069,772,7
NL2Repo58,048,958,061,155,969,7
ProgramBench19,09,517,510,515,533,023,0
FrontierSWE78,167,566,588,2
SWE-Marathon (v1.1)42,519,448,148,833,142,5
PostTrainBench39,831,732,032,941,836,2
CyberGym84,577,280,083,378,578,183,883,6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54,424,432,228,840,078,076,5
Toolathlon Verified73,059,976,574,172,576,274,774,9
AutomationBench (v1.0.6)48,226,246,743,239,841,046,245,8
Agents' Last Exam (CLI)28,523,827,625,727,025,723,828,6
HLE con strumenti62,554,759,860,056,257,963,964,5
GDPval-AA v2 (Elo)17691508168215901739158817431730

Il salto rispetto al GLM-5.2 è reale e grande — Terminal Bench 3.0 da 4,6 a 28,3, ExploitBench da 24,4 a 54,4, SWE-Marathon più che raddoppiato. Ma la lettura onesta dell'intera tabella è più modesta del titolo: GLM-5.3 ha il miglior numero assoluto in tre delle sedici righe (CyberGym, AutomationBench, GDPval-AA). Il claim di "most capable open-weights model for coding" è contraddetto dalla tabella stessa in quattro delle otto righe di codice — Terminal Bench 2.1, DeepSWE e SWE-Marathon per Kimi K3, NL2Repo per DeepSeek —, e ce n'è una quinta fuori dalla sezione di codice, nel Toolathlon, anche questa per Kimi. Tutti aperti.

Nota metodologica — leggetela prima di citare questa tabella. Tutte le valutazioni sono state eseguite dalla stessa Z.ai, e quasi tutte dentro Claude Code 2.1.207, con sforzo max. ExploitBench ha solo 41 task; i budget di ExploitGym sono normalizzati per throughput usando numeri di Artificial Analysis, ma solo per tre modelli (GLM-5.3 a 115 tok/s, Kimi K3 a 40, Qwen3.8-Max a 47) — il metodo applicato ai modelli di Anthropic e di OpenAI non è dichiarato. In due benchmark (SWE-Marathon e PostTrainBench) Z.ai ha rimosso controlli anti-frode ufficiali, giustificando con i falsi positivi. E Z.ai Code Bench, che sostiene il numero più citato del lancio, è privato e non verificabile.

Il dettaglio per cui la tabella e il grafico non raccontano la stessa storia

Due incoerenze che emergono solo incrociando i dati con la figura pubblicata.

La colonna di Anthropic è due prodotti diversi. Nella tabella, la colonna si chiama Fable 5 (w/ fallback). Nella figura sulla cibersicurezza e nel testo, gli stessi numeri (83,8 in CyberGym, 78,0 in ExploitBench, 181/247 in ExploitGym) sono attribuiti a Mythos 5. Sono modelli con posture di sicurezza distinte: i due condividono lo stesso modello sottostante, ma Fable 5 porta con sé salvaguardie aggiuntive proprio per la capacità a uso duale, mentre Mythos 5 è servito senza di esse a organizzazioni approvate — e l'uso duale è esattamente ciò che questi tre benchmark misurano. In un test di capacità offensiva, sapere se le salvaguardie erano attive è il test. Il post non spiega mai il "(w/ fallback)".

E il leader di ExploitGym è sparito dal grafico. Il testo dice che "Mythos 5 remains well ahead at 181 and 247 tasks". Secondo i dati della tabella stessa, chi è ben avanti è il GPT-5.6 Sol, con 216 e 293 — e la sua barra semplicemente non esiste nel pannello di ExploitGym della figura ufficiale, benché il modello sia nella legenda e compaia negli altri due pannelli. Il numero è nella tabella; la barra e la frase, no.


Il ledger: 2.436 riscontri, uno inviato al manutentore

Qui c'è il cuore del lancio, ed è dove l'evidenza è più ricca — perché Z.ai ha pubblicato i dati.

Il post afferma: "After expert review, screening, and deduplication, the model identified 2.436 vulnerabilities across 269 projects, including 1.097 medium-to-high severity issues." Il ledger pubblico elenca ognuna di esse, con severità, progetto, hash del commit e stadio nel processo di divulgazione coordinata. Ho contato i 2.436 record:

Grafico waffle con 2.436 punti, uno per ogni vulnerabilità del ledger pubblico di Z.ai, colorati per stadio: 2.239 in scoperta, 84 segnalate, 1 inviata al manutentore, 29 riconosciute, 30 corrette e 53 divulgate pubblicamente.Le 2.436 vulnerabilità del ledger di Z.ai, per stadioOgni punto è una vulnerabilità · stadio attuale nel processo di divulgazione coordinata, letto il 14/08/2026Scoperta2.239 · 92% — mai segnalataSegnalata84 · 3,4%Inviata al manutentore1 · 0,04%Riconosciuta29 · 1,2%Corretta30 · 1,2%Divulgata pubblicamente53 · 2,2% — 37 alla vigiliaFonte: payload pubblico del ledger su cvd.z.ai/ledger/, contato record per record il 14/08/2026. Somma chiusa: 2.239 + 84 + 1 + 29 + 30 + 53 = 2.436.

Il pannello del sito annuncia i numeri grandi: 2.436 riscontri, 1.097 critiche e alte, 269 progetti, falla più vecchia del 1981, 26,6 anni di vita media prima della scoperta. Tutti tornano con i dati. Quello che il pannello non mostra è la distribuzione per stadio, ed è quella che qualifica l'argomento di sicurezza:

StadioRiscontri
Scoperta (nient'altro)2.239
Segnalata84
Inviata al manutentore1
Riconosciuta29
Corretta30
Divulgata pubblicamente53

Per essere giusti con il numero: lo stadio registrato è quello attuale, quindi i 113 riscontri che hanno già superato "segnalata" — inclusi i 30 corretti e i 53 pubblici — sono arrivati, sì, a qualche manutentore. Il problema non è la cima dell'imbuto, è la sua base: 2.239 riscontri si fermano alla scoperta, ed è di questi che la promessa di responsabilità deve parlare. Un archivio con il 92% degli elementi fermi prima del primo contatto è un inventario, non un programma di divulgazione coordinata. Questo non rende falsi i riscontri; rende la frase "stiamo agendo in modo responsabile" una promessa, non uno storico. E il sito non pubblica alcun termine di embargo — ho cercato in tutto il codice della pagina: non c'è una politica dei 90 giorni, né alcun termine. Una vulnerabilità critica senza termine di divulgazione è una vulnerabilità tenuta da parte a tempo indeterminato. Delle 107 critiche, 92 restano in "scoperta".

Altre tre cose che il conteggio rivela:

  1. 37 delle 53 divulgazioni pubbliche sono uscite il 13 agosto — la vigilia del lancio. Fino all'altro ieri il ledger aveva 16 elementi pubblici.
  2. La media di 26,6 anni viene da 244 record, non da 2.436. Solo il 10% dell'insieme ha l'anno di introduzione compilato; ricalcolando su quegli stessi 244, il risultato è 26,5 anni. E la base è distorta: 88 dei 244 sono degli anni 1980, con 47 nel solo 1987 e 20 nel 1981 — falle dell'era dei protocolli contate in implementazioni diverse (BIND, Unbound, Dnsmasq, PowerDNS, NetBSD, Solaris, Windows, macOS…). La frase "ogni vulnerabilità è rimasta nascosta in media 26,6 anni" descrive un sottoinsieme scelto, non l'archivio.
  3. La severità "medium-to-high" del post è un'altra cosa. I 1.097 del pannello sono critical (107) + high (990) — l'etichetta del sito stesso è "CRITICAL & HIGH". Da medium in su la somma sarebbe 2.383. Il numero è giusto; l'aggettivo, no.

Chi ha trovato le 2.436

La frase ufficiale è "the model identified 2,436 vulnerabilities". I metadati del ledger raccontano una storia diversa — e con nomi e cognomi. Ogni record accredita un ricercatore e un harness, e nessuno accredita un modello:

Ricercatore accreditatoRiscontriHarness usatoRiscontri
Clouditera Security1.364VulnForge1.364
Laboratorio NASP (Tsinghua)325Claude Code (Anthropic)517
Laboratorio AOSP (Nankai)212Vulcanix325
nsfocus205senza harness dichiarato230
Z.ai Security2

Il post è onesto su questo in una riga che quasi tutta la copertura ha ignorato: "we have been working with several security teams in China to run our models against real-world codebases". È un programma di red team esternalizzato con la partecipazione di quattro istituzioni, nel quale Z.ai stessa firma due riscontri. I 2.436 sono il risultato dell'insieme — modello, strumento, squadra umana, revisione e deduplicazione —, non di un modello letto come agente autonomo.

E il dato con la maggiore ironia del lancio: 517 dei riscontri (il 21%) sono stati prodotti con Claude Code come harness — lo strumento di Anthropic, la stessa azienda i cui modelli fanno da tetto nei benchmark cyber del post, e la stessa dentro cui Z.ai esegue tutte le sue valutazioni. L'harness non determina il modello: Claude Code parla con qualsiasi API, e presumibilmente guidava un GLM. Ma il ledger non permette di verificarlo — non c'è un campo per il modello — e l'effetto è che il registro pubblico della capacità di GLM-5.3 accredita, in un quinto dei casi, il prodotto del concorrente.


La rima: due laboratori in due settimane, stessa ricetta

Il 1º agosto ho scritto qui del V4-Flash-0731 di DeepSeek, il cui lancio è stato per intero "re-post-training, not a new design" — stessa architettura, salto da 7,3 a 54,4 nel DeepSWE. Due settimane dopo, Z.ai fa la stessa cosa con lo stesso enunciato: stessa base da 743B, Terminal Bench 3.0 da 4,6 a 28,3, e la frase dell'annuncio che dice che tutto è venuto dal post-training.

Quell'articolo si chiudeva scommettendo che la frontiera agentica fosse limitata meno dalla dimensione del modello e più dalla qualità della pipeline di post-training. Due settimane sono poche per parlare di tendenza, ma il secondo caso è arrivato in fretta e da un laboratorio diverso — e un investitore con una storia nel settore ha registrato lo stesso stupore quel giorno stesso: "Something has happened with post-training as shown by DeepSeek flash & GLM-5.3 updates. Same base, big improvement in perf to frontier levels. Can't explain this by even logit distillation."

La ricetta, di nuovo, non è pubblicata. Lo stack citato — l'IndexCache per l'attenzione sparsa, il SAO per l'RL asincrono e il framework slime — è pubblico e documentato, ma i paper descrivono il GLM-5.2: l'abstract del SAO dice testualmente che è stato usato nel 5.2, e il README di slime elenca modelli fino al 5.2. L'estensione al 5.3 è un'affermazione del post di lancio, non degli articoli. Vale la pena notare anche che IndexCache è ingegneria di inferenza, non di post-training — 1,82× nel prefill, 1,48× nel decode. Archiviarlo sotto "ricetta di post-training" è generoso con la propria narrazione.


Che cosa ha visto la community in 24 ore

Il thread del lancio su Hacker News ha superato i 530 punti e i 230 commenti nel primo giorno, e il dibattito non è stato sui benchmark — è stato su chi può usare la capacità offensiva.

Lo scetticismo ha puntato esattamente all'argomento di sicurezza. Il commento più diretto è di cubefox: "What safety evaluation? What safety hardening? They already evaluated it and found it to be highly capable at exploiting security vulnerabilities." Un altro lettore, tmsh, ha riassunto il dubbio tecnico in sei parole: "Is post-training magic just overfitting to benchmarks?" Fuori da HN, la critica più tagliente è stata quella di Lou: "Open weights in two weeks is a tease, not openness."

Ed è emerso un tema che non mi aspettavo dominasse la conversazione: il rifiuto. Diversi sviluppatori hanno raccontato di stare migrando verso modelli cinesi non per prezzo o qualità, ma perché i modelli occidentali rifiutano lavoro di sicurezza legittimo. SwellJoe: "The Fable guardrails have trained me to pretty much exclusively use Opus when using Claude Code (lately I'm focused on a lot of security and security-adjacent stuff, which Fable refuses to do)." 112233 è andato oltre: "Why should I apply for cybersecurity approval in order to have model debug a program it is writing itself?" E virgildotcodes ha formulato l'argomento strutturale: "we have a world of attackers using open and closed source models against a much smaller group of maintainers".

C'era anche il contro-argomento, ed è onesto: wren6991 ha osservato che è "quite hard to separate Mythos the model from Mythos the campaign" — capacità e narrazione di marketing diventano indistinguibili quando le due cose vengono annunciate insieme. L'osservazione vale integralmente per il lancio di oggi.

Quello che ha impressionato tecnicamente è la dimensione. wren6991 di nuovo: GLM-5.3 fa questo con "one quarter the total parameter count of K3 (and 40% active parameter count)". E unrvl22: "this is 744b and its head to head with Kimi K3 (2.8T), smashes DS v4 pro (1.5T)".


Che cosa ancora non esiste

Vale la pena farne la lista, perché è corta e decisiva. Fino a stamattina, Artificial Analysis non elenca GLM-5.3 in nessuna delle sue pagine — nessun indice di intelligenza, nessun prezzo, nessuna velocità misurata. È normale nel giorno del lancio, con un dettaglio che non lo è: Z.ai cita Artificial Analysis come fonte di due numeri dell'annuncio stesso (i 115 tok/s che normalizzano ExploitGym e i 1.769 del GDPval-AA v2). Entrambi compaiono solo nel materiale di Z.ai.

Non esistono nemmeno: pesi, licenza, model card, prezzo per token, API pubblica e alcuna riproduzione indipendente di alcun numero di questo lancio.


Cosa ne farei io

Non ho provato GLM-5.3 — nel giorno del lancio non c'era nulla da provare al di fuori di un abbonamento. Dove guarderei:

Trattare il ledger come il prodotto più interessante, ed esigere il termine. L'idea di un registro pubblico, con l'hash del commit per ogni riscontro, è buona e dovrebbe diventare uno standard — Z.ai sta inventando in pubblico un processo che i laboratori chiusi eseguono in privato. Ma quello che ha pubblicato oggi è un inventario con il 92% degli elementi fermi alla scoperta e senza un termine di embargo dichiarato. La domanda da fare tra due settimane non è "i pesi sono usciti?", ma "quanti di quei 2.239 sono arrivati a un manutentore?". Quel numero è il test dell'intero argomento di sicurezza.

Non confondere l'harness con il modello — nei due sensi. Il lancio misura tutto dentro Claude Code e gli accredita 517 riscontri. Se volete confrontare modelli, il metro deve essere il vostro: stesso harness, stessi strumenti, stesso budget di token. Vale per il benchmark che leggete e per il test che eseguite.

Misurare l'efficienza di token, non solo il punteggio. Il numero più difendibile del lancio non è il più grande: GLM-5.3 segna il 31,4% con sforzo high spendendo circa 50 mila token di output per task, contro il 29,5% di Opus 4.8 che ne spende 120 mila. È lo stesso livello per meno della metà della spesa. Ma il benchmark è interno e privato, e confrontare l'high di uno con il max dell'altro è una scelta di chi pubblica — nel max, GLM-5.3 arriva al 34,5% e Fable 5 guida con il 39,5%. Se il costo per task completato è il vostro criterio, questa è la riga da riprodurre con il vostro backlog.

E aspettare le due settimane prima di chiamarlo aperto. Un modello senza pesi, senza licenza e senza prezzo non è un modello aperto in ritardo — è un annuncio. Se i pesi usciranno sotto licenza MIT a fine agosto, il lancio diventerà ciò che promette di essere. Fino ad allora, l'unica cosa verificabile che Z.ai ha consegnato è il ledger. E il ledger, verificato, dice meno del titolo.


Fonti

I numeri di benchmark sono stati trascritti dai dati del post ufficiale stesso (la pagina è un'applicazione JavaScript; i dati arrivano nel pacchetto che essa carica) e confrontati con le figure pubblicate e con la tabella di Kingy AI — le tre fonti coincidono. Il conteggio del ledger è mio: ho scaricato il payload pubblico di cvd.z.ai/ledger/ il 14/08/2026 e ho contato i 2.436 record per stadio, severità, ricercatore e harness; la somma per stadio chiude a 2.436 e la severità riproduce il pannello del sito (107 critiche + 990 alte = 1.097). La media di 26,5 anni che ho ricalcolato usa gli stessi 244 record con l'anno di introduzione compilato. L'assenza di una politica sui termini di embargo è stata verificata cercando nel codice della pagina. Le citazioni della community sono state raccolte il 14/08/2026 e verificate una per una contro la fonte originale — quelle di Hacker News tramite l'API pubblica di Algolia, quelle di X tramite il contenuto grezzo di ogni post — e ognuna è linkata. Il punteggio del thread è quello del momento della raccolta. Prezzi e assenza della riga di GLM-5.3 ricontrollati nella tabella ufficiale di Z.ai il 14/08/2026; l'assenza del modello su Artificial Analysis è stata verificata nelle pagine dei modelli, della leaderboard e di GDPval-AA nella stessa mattina.