HomeArticoli

Articoli su IA, ingegneria e sistemi complessi

Scrittura d’autore, pubblicata quando c’è qualcosa da dire. Ogni analisi distingue ciò che è stato verificato sulla fonte primaria da ciò che è una mia lettura — e dichiara quale sia quale.

4 settembre 2026

A mesma amostra de skills dá 6,57% ou 48,71%, conforme o scanner

Circulou que 48% das skills de agentes de IA são inseguras. A fonte não é um estudo: é o post de um blogueiro de SEO, cujo filtro descartou 261.451 achados para chegar lá. Dois meses depois, NVIDIA e OpenClaw Foundation mediram 67.453 versões com três scanners ao mesmo tempo — e os três devolveram 6,57%, 7,75% e 48,71%.

#ia#agentes#ciberseguranca#fact-check#metodologia
Le 7 statistiche centrali sui deepfake vengono da chi vende il rilevatore — l'unica cifra ufficiale di danno conta le "menzioni all'IA" e la scienza dà 55%, una monetina
28 agosto 2026

Le 7 statistiche centrali sui deepfake vengono da chi vende il rilevatore — l'unica cifra ufficiale di danno conta le "menzioni all'IA" e la scienza dà 55%, una monetina

La pagina di statistiche sui deepfake più completa che ho trovato avverte che i numeri vengono da chi vende rilevatori — e nonostante questo prende da lì le sue sette cifre centrali. Le ho controllate una a una: Signicat, Entrust due volte, Sumsub due volte, Resemble AI e iProov. Sette su sette fornitori, nessun organo ufficiale, nessuna accademia, nessuna indagine pubblica. Quattro righe del tabellone sono sbagliate, e gli errori sulle leggi vanno tutti nella stessa direzione: fanno sembrare la regolamentazione più avanti di quanto sia. Sono andato a cercare quello che esiste davvero: l'unica cifra ufficiale di danno è 893 milioni di dollari — il 4,28% delle perdite dell'anno, sotto un'etichetta che l'FBI definisce come "contiene un riferimento all'intelligenza artificiale"; l'unica misurazione indipendente della capacità umana è accademica e dà 55,5%, con un intervallo di confidenza che attraversa il 50%, cioè una monetina; e il miglior dato pubblico al mondo è brasiliano, del Cetic.br, perché mette alla prova invece di chiedere (il 41% si dice sicuro, il 17% è andato bene al test, e le due cose non sono correlate). Ho contato io stesso il pannello di Resemble AI: dei 2.266 incidenti, il famoso "1,3 miliardi di dollari" ne descrive 159.

#deepfake#estatisticas#desinformacao#metodologia#fraude#brasil
La lettera sulla cyberdifesa firmata da 155 aziende non contiene un solo impegno
28 agosto 2026

La lettera sulla cyberdifesa firmata da 155 aziende non contiene un solo impegno

Il 27 agosto 2026 una lettera aperta promossa e ospitata da OpenAI ha chiesto una risposta collettiva agli attacchi informatici alimentati dall'IA, e la stampa ha coperto il numero: più di cento aziende. Sono andato dietro alla domanda noiosa — che cosa esattamente qualcuno si è impegnato a fare. Ho separato i quattro blocchi di richieste da una cattura fissata della pagina e ho cercato al loro interno i cinque segnali che distinguono un impegno da una dichiarazione di intenti: cifra, scadenza, verbo che obbliga, responsabile nominato e obiettivo verificabile. Sono diciotto frasi all'imperativo e, su venti celle, nessuna occorrenza. L'ambra che si vede nella figura è una concessione che ho fatto a mano contro il mio stesso argomento, e spiego perché. Per dimostrare che il righello misura, ho eseguito lo stesso test su una pagina della stessa OpenAI, di febbraio, che accende tre delle cinque colonne: l'azienda scrive una cifra quando vuole. Mostro inoltre che l'elenco dei firmatari è cambiato quattro volte in quarantasette ore — 116, 127, 128, 155 — mentre il testo dei quattro blocchi non è cambiato di un byte, che un'azienda è stata rimossa senza spiegazioni, e che la pagina porta due elenchi i cui conteggi si scontrano sullo stesso numero. E separo, con cura, ciò che è misura da ciò che è analisi mia.

#ia#ciberseguranca#openai#politica-de-tecnologia#verificacao
La card che dice quale IA gira sulla tua GPU azzecca quasi tutto — e sbaglia l'unico conto che decide
27 agosto 2026

La card che dice quale IA gira sulla tua GPU azzecca quasi tutto — e sbaglia l'unico conto che decide

Una card in spagnolo risolve in una tabella cosa gira in ogni fascia di memoria video, da 4 GB a 256 GB. Ho rifatto il conto: dei diciassette verdetti sull'hardware, sedici sono giusti, e tutti i modelli citati esistono davvero — l'unico pezzo inesistente è la RTX 5080 Super, rinviata a tempo indeterminato perché il modulo di GDDR7 da 3 GB costa il triplo di quello da 2 GB. L'errore che conta è un altro, ed è di metodo: la card preventiva solo il file dei pesi e ignora la cache di contesto, che cresce mentre parli. Con le due voci misurate — pesi del GGUF pubblicato, cache calcolata dal config.json di ogni modello — uno dei dieci gradini non chiude nemmeno in una sessione di lavoro da 32 mila token, ed è proprio il più popolare, quello da 8 GB; sei dei dieci non chiudono nel contesto massimo del modello stesso che la card consiglia. Distinguo inoltre quattro trappole di nomenclatura, tra cui un "Q8" che ha 4,3 bit per peso e un formato che non appartiene allo stesso ecosistema degli altri, e tre avvertenze che valgono per tutta la tabella, incluso il perché due schede da 32 GB non sono una scheda da 64 GB.

#ia#llm#hardware#quantizacao#vram#didatico
Solo 8 dei 20 numeri più citati su OpenAI sono di OpenAI — il resto è fuga, obiettivo o nessuno sa da dove venga
26 agosto 2026

Solo 8 dei 20 numeri più citati su OpenAI sono di OpenAI — il resto è fuga, obiettivo o nessuno sa da dove venga

Ho classificato i 20 numeri più citati sull'OpenAI: 8 sono ufficiali, 6 sono reportage, 3 sono obiettivi e 3 nessuno sa da dove siano venuti. Il 92% ha 31 mesi. Sono andato alla fonte di ogni numero che circola nelle raccolte sull'azienda: quelli della stessa OpenAI sono corretti — e sono i meno interessanti; quello che fa notizia è ciò che lei non ha mai firmato. Il "92% della Fortune 500" viene dalla risposta dell'OpenAI alla causa del New York Times, del gennaio 2024, e circola senza data; 24 mld di ricavi è ufficiale, 40 mld è una stima, 280 mld è un obiettivo — unire i tre con lo stesso verbo è sbagliato anche con ogni numero corretto; SoftBank ha investito 64,6 mld, non "oltre 71", e i 500 mld di Stargate sono un impegno di calcolo, non un investimento. Lo "stipendio di 76.001 dollari" di Altman è la somma di due colonne del Form 990, l'anno successivo dà 113.674, ed è il decimo di dodici nomi in retribuzione. In Brasile, "50 milioni di utenti" appare identico in agosto 2025 e agosto 2026 — i messaggi al giorno sono saliti del 54%.

#ia#openai#estatisticas#metodologia
Quanti modelli linguistici esistono? 274, 95 o 403.420 — e il voto di codice che circola viene da un test abbandonato dal suo creatore
26 agosto 2026

Quanti modelli linguistici esistono? 274, 95 o 403.420 — e il voto di codice che circola viene da un test abbandonato dal suo creatore

274, 95 o 403.420 modelli linguistici: i tre conteggi sono tutti corretti. E il benchmark di codice che circola è stato abbandonato dal suo stesso creatore a febbraio. Sono andato a verificare le statistiche di LLM che circolano nelle raccolte: "quanti modelli esistono" non ha risposta, perché di definizioni ce n'è in eccesso — 403.420 repository su Hugging Face (misurazione propria, un comando di una riga), 95 notevoli nell'AI Index di Stanford, 274 in un catalogo editoriale. Il voto che il laboratorio dà a se stesso ha retto alla verifica (zero-quattro punti di differenza dove lo stesso modello è stato misurato da fuori); ciò che non regge è il metro: la OpenAI ha dichiarato lo SWE-bench Verified contaminato e ha smesso di pubblicarlo il 23/02/2026, e ad agosto è ancora il test di "chi programma meglio". I confronti tra versioni sbagliano il segno (il DeepSeek di agosto è 8 punti avanti a Opus 4.8, non indietro); "il più caro" costa US$ 30 nelle raccolte e US$ 150 nel catalogo reale; i modelli più grandi con dimensione nota sono tutti aperti. In Brasile, la Maritaca fa i prezzi in reais e pubblica l'unico confronto di costo di suite in moneta nazionale: R$ 206 sul Sabiá 4 Thinking contro R$ 590 sull'Opus 4.8.

#ia#llm#estatisticas#benchmarks#metodologia
Eu estava medindo recusas invisíveis. A recusa apareceu — e não era invisível
26 agosto 2026

Eu estava medindo recusas invisíveis. A recusa apareceu — e não era invisível

Um estudo meu sobre recusas de IA que passam despercebidas dentro de sistemas de agentes foi interrompido por uma recusa: o classificador de salvaguardas bloqueou a geração do corpus, porque um conjunto de prompts SOBRE recusas lê, para um classificador, como material ofensivo. Havia dois caminhos — reescrever o pedido até passar, o que quase sempre funciona, ou parar. Reformular um pedido porque ele foi sinalizado é evasão de salvaguarda, um andar abaixo do jailbreak e da mesma família; um pesquisador que contorna o classificador para estudar o classificador contaminou o próprio objeto. Congelei o braço do estudo com data no arquivo de estado do projeto e me candidatei ao Cyber Verification Program da Anthropic, o canal formal para trabalho de uso duplo com propósito defensivo. A aprovação saiu dentro do prazo de dois dias úteis. O que ela é: uso duplo deixa de ser bloqueado por padrão, dentro do caso de uso submetido e sob monitoramento contínuo. O que ela não é: parceria, certificação ou endosso — uso proibido continua bloqueado com programa ou sem. E fica a lição que o incidente entrega de graça, que é a tese do estudo: uma recusa só é gerenciável quando é legível. A que me bloqueou tinha texto, categoria e porta de saída; as que eu estou medindo chegam ao orquestrador como resultado vazio e são tratadas como sucesso.

#ia#agentes#ciberseguranca#anthropic#pesquisa#salvaguardas
No, nessuno ha provato che Meta legge il tuo WhatsApp. Quello che ho trovato è peggio
26 agosto 2026

No, nessuno ha provato che Meta legge il tuo WhatsApp. Quello che ho trovato è peggio

Un avvocato ha perso dieci anni di conversazioni in una mattina e un video ha concluso che Meta aveva letto quello che lui aveva scritto. Sono andato a verificare quell'accusa nei documenti tecnici di WhatsApp dal 2016 al 2026, nel codice del client, in catture archiviate del centro assistenza di Instagram, nella decisione della Commissione europea del 2017 e negli atti di cause in Brasile, negli Stati Uniti e in India. Il video sbaglia per due ragioni, e la seconda seppellisce l'argomento: bandire in massa e rumorosamente è la firma di un classificatore automatico, non di chi legge — chi ha una capacità segreta preziosa protegge la capacità, non il caso individuale. Ma quello che resta al suo posto è peggio. L'azienda è passata a definire da sola che cosa conta come conversazione protetta e a elencare eccezioni che essa stessa riconosce; nessuna osservazione disponibile al pubblico distingue un'azienda che non può leggere da una che può e non lo dice; e le tre scelte che producono quell'impossibilità — applicazione chiusa, nessun build riproducibile, nessuna verifica esterna — sono sue, e reversibili da lei. L'8 maggio 2026 Meta ha spento la crittografia end-to-end dei messaggi di Instagram: la garanzia che ci hanno venduto come matematica è sempre stata una promessa aziendale, e le promesse aziendali si revocano.

#criptografia#whatsapp#instagram#meta#privacidade#verificacao
"Il 95% dei progetti pilota di IA fallisce" viene da 52 interviste — e le tre domande che evitano il prossimo
26 agosto 2026

"Il 95% dei progetti pilota di IA fallisce" viene da 52 interviste — e le tre domande che evitano il prossimo

Il "95% dei progetti pilota di IA fallisce" viene da 52 interviste e non ha misurato agenti. Sono andato alle fonti primarie: ogni statistica sugli agenti è previsione, dichiarazione o misurazione — e ciascuna fallisce a modo suo. Gartner pubblica una previsione e un sondaggio da webinar sulla stessa pagina; l'AI Index dice 70% nel riassunto e 79% nel proprio grafico; METR ha cronometrato sviluppatori il 19% più lenti mentre loro si credevano il 20% più veloci, e nel 2026 non ha potuto ripetere l'esperimento perché nessuno accetta di lavorare senza IA; la metrica di consistenza è sparita dalle classifiche; un record è stato ritirato per fuga di risposte. Ho misurato le tubature (SDK di MCP: 1.087 volte in 18 mesi) e il Brasile (il 17% delle aziende usa l'IA; il 68% di questo è automazione di flussi). Nessun numero è falso — tutti cambiano peso quando l'etichetta viaggia con loro.

#ia#agentes#estatisticas#benchmarks#metodologia
Teoria dei Vincoli: il vincolo è un luogo, non uno sforzo
25 agosto 2026

Teoria dei Vincoli: il vincolo è un luogo, non uno sforzo

Nathan Barry ha riassunto la Teoria dei Vincoli in una frase — lo sforzo fuori dal collo di bottiglia peggiora il collo di bottiglia — appoggiandosi alla serie di Tiago Forte che circola come la spiegazione dell'argomento. Sono andato a controllare la serie, il libro e la frase, e ho scritto un simulatore di coda per misurare invece di discutere per analogia. La serie ha 11 post, non 3, e quelli che dicono che cosa fare dopo aver trovato il collo di bottiglia stanno dietro un paywall; i cinque passi di Goldratt non sono in L'obiettivo, ma in un libro del 1990 che quasi nessuno apre; e la frase-morale azzecca il segno e sbaglia il grado: raddoppiare la capacità di chi non è il vincolo non ha tolto un pezzo in più (-0,3%, rumore) e ha fatto crescere l'attesa il 33% più in fretta — peggiora l'attesa, non l'uscita. Elevare il vincolo del 25% ha reso il 24,9%. La corda di Goldratt costa il 5% di portata e compra un attraversamento 8.900 volte minore. Salgo la scala in quattro gradini — la panetteria, i nomi, la Legge di Little e i cinque passi letti alla fonte, il ponte con gli agenti di IA, dove il collo di bottiglia cambia posto — e chiudo controllando Ford, Spanx e Kit. Dieci figure mie, fatte in codice; la stessa panetteria ritorna con i dati di ogni esperimento.

#teoria-das-restricoes#goldratt#gestao#filas#lei-de-little#agentes-de-ia#didatico
25 agosto 2026

Il grafico virale incorona il Mac, la tabella incorona lo Spark: ho misurato 43 mila chiamate e il vincitore non è nessuna macchina

Due immagini virali confrontano Mac Studio M5 Ultra 256 GB, RTX 5090, RTX PRO 6000 e DGX Spark in "valore per dollaro" per far girare l'IA in casa. Sono andato a verificare: la metrica moltiplica stock per portata, il prezzo dello Spark è morto a febbraio e la PRO 6000 è entrata senza PC host. Poi ho rifatto il conto che conta — token per dollaro contro l'API dello stesso modello — e la sua prima versione assumeva che una persona usi la macchina 1 % del tempo. Ho misurato 43.593 chiamate reali di agente di codice su questa macchina: l'1 % non descrive nessuno (la chat sta vicino allo 0,03 %; l'agente, tra 10 % e 30 %), il 96 % dell'ingresso è rilettura di contesto, e cambiare la regola di addebito di quella rilettura muove il conto di 16 volte, mentre cambiare macchina lo muove di 3,6. Nell'unico regime in cui la macchina più economica vince (1,5x), il suo giorno di picco non ci sta nel giorno e la chiamata media, di 151,9 mila token, non ci sta nel contesto del modello. Compra per sovranità, non per risparmio.

#ia#llm#hardware#custo#inferencia-local
Il punteggio di sicurezza è della coppia, non del modello — e il laboratorio stesso lo aveva già corretto
25 agosto 2026

Il punteggio di sicurezza è della coppia, non del modello — e il laboratorio stesso lo aveva già corretto

Un benchmark di sicurezza del codice ha misurato Claude Fable 5 al 59,8% di correttezza funzionale e al 19,0% di correttezza di sicurezza, e il numero è diventato il titolo su un modello che ha deluso. Sei giorni dopo, lo stesso laboratorio, lo stesso autore e lo stesso benchmark hanno pubblicato la stessa Fable 5 al 72,6% e al 29,0% — il miglior punteggio di sicurezza della tabella in quel momento. Non hanno cambiato il modello; hanno cambiato lo strumento che lo guidava. Sono andato a cercare i due testi e ne ho trovato un terzo, dello stesso autore e dello stesso giorno, che nessuno cita: la verifica antifrode del benchmark stesso, che ha tolto 9 punti percentuali di sicurezza a una combinazione senza che nel modello cambiasse nulla. Mostro la conclusione stretta che i dati reggono — il punteggio è della coppia strumento e modello, e della versione del metro nel giorno in cui è stata eseguita —, il suo limite (nelle otto coppie della leaderboard la mediana della differenza è 1,65 punti, e il caso della Fable 5 è sei volte tanto), il contraddittorio di Hacker News, che accusa il benchmark di essere storto CONTRO il modello, e la scoperta meccanica: ho contato i link fra le quattro pagine e il grafo è a senso unico — chi arriva dal testo che è circolato non ha alcun percorso verso la correzione. Sei figure originali, fatte in codice, e tutti i calcoli via script sulle 27 righe della leaderboard.

#ia#benchmark#seguranca#agentes#claude#metodologia
L'era degli umani è finita? Robot più veloci di Bolt, più in alto di Sotomayor, 97% fabbricati in Cina — cosa provano i video di Pechino, e i due che sono falsi
24 agosto 2026

L'era degli umani è finita? Robot più veloci di Bolt, più in alto di Sotomayor, 97% fabbricati in Cina — cosa provano i video di Pechino, e i due che sono falsi

Nel 2009 Usain Bolt ha corso i 100 m in 9,58 s e nessuno gli si è avvicinato in 17 anni. Sabato 22 agosto, a Pechino, un robot ha coperto la distanza in 9,39 s in una batteria ufficiale — e un anno fa il vincitore della stessa gara aveva fatto 21,50 s. Ho letto i 14 post più condivisi della settimana dei World Humanoid Robot Games 2026, ho scaricato gli 11 video, ho estratto fotogramma per fotogramma, ho letto la stampa cinese, i fact-checker e il regolamento. La risposta ha due metà. La prima è sì: quello che è successo a Pechino è reale, è più grande del 2025 di un ordine di grandezza — 2.056 robot, 666 squadre, 16 paesi, cinque giorni — ed è più impressionante di quanto raccontino le didascalie. La seconda è quello che le didascalie nascondono: i 9,32 s ripostati da Elon Musk non sono il numero del tabellone (al secondo 18 del video si legge 9,39, batteria 9, e il robot che ha vinto non è quello della Honor); i due clip più spaventosi della timeline sono falsi; e la domanda giusta per ogni video non è "che tempo ha fatto" — è "chi aveva il controllo". Prima i robot, poi il metro di misura. Aggiornato il 26/08: la finale ha chiuso i Giochi in 8,64 s.

#robotica#humanoides#china#ia#fact-check#video
14 agosto 2026

La filigrana di Claude non è un timbro nascosto nel testo — è il modo in cui vengono scelte le parole

La parola "filigrana" fa immaginare a quasi tutti la cosa sbagliata: un timbro nascosto, un carattere invisibile, qualcosa aggiunto al testo. Non è niente di tutto questo: non viene inserito nulla, e ciò che cambia è l'origine del sorteggio quando il modello sceglie fra due parole che andrebbero ugualmente bene. Spiego il meccanismo da zero, prima senza una sola parola tecnica (la strada di casa e un numero segreto concordato con un amico), poi con i nomi che compaiono nella documentazione. Dal meccanismo discendono gratis tutti i limiti: perché il testo breve quasi non viene marcato, perché il codice quasi non viene marcato, perché la revisione di un tuo testo quasi non lascia filigrana, e perché la filigrana non dirà mai chi ha scritto. Separo anche ciò che la stampa unirà nei prossimi giorni: filigrana nel testo e credenziale C2PA nel file sono meccanismi diversi. Sette figure originali, fatte in codice. E la precisazione che cambia l'uso: l'API che permetterebbe a chiunque di verificare un testo non esiste ancora — l'articolo la tratta come promessa, non come fatto.

#ia#claude#anthropic#marca-dagua#regulacao#didatico
14 agosto 2026

Come sapere se un modello di IA gira sul tuo computer — e perché

La domanda di chi vuole far girare un modello linguistico sul proprio computer è sempre la stessa: questo ci sta qui? La risposta ha due voci, e solo una di esse cresce mentre parli. Spiego entrambe da zero, tre volte di fila: prima senza nessuna parola tecnica, poi con i nomi che compaiono nella documentazione, poi con la formula e i numeri reali del Qwen3.8-27B, uscito questo mese — 27.781.427.952 parametri, 64 strati di cui solo 16 mantengono cache che cresce, 15,82 GiB di pesi in Q4_K_M e 16,14 GiB di cache nel contesto massimo di 262.144 token. Lungo il percorso, tre trappole che i numeri tondi nascondono: K è 1.024 e non mille, GB non è GiB, e il nome del modello è arrotondato. Ogni numero di questo articolo proviene da un programma pubblicato insieme: qualsiasi lettore può rifare il conto sulla propria macchina.

#ia#llm#hardware#quantizacao#didatico
14 agosto 2026

Anthropic ha alzato il rischio dei propri modelli: cosa dicono le 186 pagine del rapporto di agosto

Per la prima volta Anthropic ha peggiorato il voto che dà a se stessa — e ha riclassificato anche il passato. Ho letto le 186 pagine del rapporto di rischio di agosto 2026: ciò che conta non è il voto, ma i cinque fallimenti di processo che l'azienda descrive, inclusa una contaminazione dei dati di addestramento che ha colpito quasi tutti i modelli Claude con knowledge cutoff successivo a dicembre 2024.

#anthropic#seguranca-de-ia#claude#governanca
GLM-5.3: Z.ai ha rinviato i pesi citando la capacità cyber e ha pubblicato 2.436 vulnerabilità come prova — 2.239 non sono mai uscite dalla scoperta
14 agosto 2026

GLM-5.3: Z.ai ha rinviato i pesi citando la capacità cyber e ha pubblicato 2.436 vulnerabilità come prova — 2.239 non sono mai uscite dalla scoperta

Z.ai ha rinviato i pesi aperti di GLM-5.3 sostenendo che la capacità offensiva del modello è cresciuta più in fretta del previsto, e ha offerto come prova un ledger pubblico di 2.436 vulnerabilità in software reale. Ho scaricato e contato l’intero ledger: il 92% delle scoperte non è mai stato segnalato a nessuno, esattamente una risulta inviata al manutentore, non è dichiarata alcuna scadenza di embargo e nessun record attribuisce la scoperta a un modello — il 21% ha usato Claude Code come harness.

#glm#z.ai#llm#benchmarks#open-weights#seguranca
11 agosto 2026

Claude Code: la statistica che circola è 4.000 volte più piccola di quella che chiunque può misurare

La pagina di statistiche più completa su Claude Code attribuisce i suoi numeri di download a un pacchetto npm che non è mai esistito: 404 nel registry, zero catture nella Wayback Machine. Il pacchetto vero ha un'API pubblica, senza chiave e senza paywall — 429 milioni di download cumulativi, 44,4 milioni nel solo mese in cui la pagina ha pubblicato "111.000+". Ho misurato ogni numero misurabile e il tabellino si è chiuso su quattro giusti, quattro sbagliati e due senza fonte che permetta un verdetto: il sondaggio da "15.000 sviluppatori" aveva 906 rispondenti; le "22.000 stelle" erano 71.847 il 1° marzo; l'"open source" ha un LICENSE.md di quattordici parole, tre delle quali sono "all rights reserved". Dall'altro lato, l'affermazione più incredibile dell'elenco — il 4% di tutti i commit pubblici di GitHub — regge come stima, e Anthropic stessa l'ha ripresa nell'annuncio della Serie G. Il dettaglio che ordina il tabellino: gli errori puntano tutti nella stessa direzione, verso il basso. Il prodotto misurabile con un'API pubblica è più grande del prodotto descritto dalla pagina che esisteva per promuoverlo. E il dato primario che nessuno usa dà il taglio brasiliano: il 26,0% dell'uso di Claude.ai in Brasile viene da occupazioni informatiche e matematiche — sopra la media globale (23,8%) e gli Stati Uniti (21,1%).

#ia#claude-code#anthropic#estatisticas#fact-check#brasil
10 agosto 2026

Il Brasile è il 5° paese che più usa Claude — e vuol dire meno di quanto sembri

Il Brasile è il quinto paese che più usa Claude — e il dato, al contrario di quasi tutto ciò che circola, viene da una fonte primaria: il microdato che la stessa Anthropic pubblica con licenza CC-BY. Ho scaricato il dataset e ho misurato. La stessa misurazione dice ciò che il titolo non porta: in intensità pro capite siamo il 61° su 121 — siamo in cima perché siamo grandi, non perché siamo intensi. Il volume non è intensità, e la versione in denaro di quella confusione (il run rate non è fatturato) regge quasi ogni pagina di "statistiche su Claude" del 2026. Ho verificato la più completa di esse fonte per fonte: il run rate da 47 miliardi di dollari è un mese forte annualizzato; il CFO, sotto giuramento, ha dichiarato più di 5 miliardi dalla fondazione nella stessa finestra dei "~19 miliardi" pubblici — non è una pistola fumante, è tachimetro contro contachilometri. E l'unico dato che chiunque può riprodurre gratis riceve una riga nella pagina; l'indiscrezione riceve il titolo.

#ia#claude#anthropic#estatisticas#fact-check#brasil
3 agosto 2026

ChatGPT: i 900 milioni sono usciti da un annuncio di raccolta — e il metro sta in un altro documento

I due numeri che reggono qualsiasi pagina di "statistiche su ChatGPT" — 900 milioni di utenti attivi settimanali e 50 milioni di abbonati — vengono dalla stessa frase di un comunicato di raccolta da 110 miliardi di dollari. Sono andato a leggere il post: la definizione di "utente attivo settimanale" non c'è. Esiste, ma vive in un altro documento, pubblicato quattro mesi dopo, con un perimetro più stretto. E il denominatore ha una paternità ricostruibile: il COO ha misurato 400 milioni contro la popolazione totale, il paper di OpenAI con il NBER ha misurato 700 milioni contro quella adulta, e la pagina che mi ha dato lo spunto è tornata alla totale — "il 10% è diventato 11%" sembra progressione ed è un metro cambiato. Sullo stesso metro sarebbero 11,3% e 14,5%. Più il gradino Brasile: il portoghese è la seconda lingua non inglese di ChatGPT, e due testate hanno descritto lo stesso briefing di OpenAI con metriche diverse nella prima riga.

#ia#chatgpt#openai#estatisticas#fact-check#brasil
2 agosto 2026

Quante persone usano l’IA? Sono andato a verificare i numeri giganti — contano account, non persone

2,42 miliardi di persone usano l’IA generativa, dice il titolo — ma la fonte stessa sconsiglia di leggere quel numero come persone. Ho verificato ogni gradino della piramide sulle fonti primarie, ho aggiunto il gradino che nessuna versione internazionale ha (il Brasile) e il risultato cambia la lettura: i paganti di tutto il mondo sono ~1% dell’umanità, e la bolla dei coding agents lo 0,14%. Non siete in ritardo — il feed è la bolla che parla di sé stessa.

#ia#adocao#estatisticas#fact-check#brasil
Noisy-TV negli agenti LLM: ho setacciato quattro letterature a caccia della trappola — nessuno l'ha formalizzata, e io l'ho misurata nel mio stesso agente
2 agosto 2026

Noisy-TV negli agenti LLM: ho setacciato quattro letterature a caccia della trappola — nessuno l'ha formalizzata, e io l'ho misurata nel mio stesso agente

Nel 2018 un agente mosso dalla curiosità si fermò ipnotizzato davanti a una TV che trasmetteva statica — il noisy-TV problem, che l'apprendimento per rinforzo ha passato sette anni a domare. Ho setacciato quattro letterature a caccia della stessa trappola nella strumentazione della curiosità degli agenti LLM: nessuno l'ha formalizzata. E non è ipotetica — nell'agente sperimentale che mantengo sulla mia macchina, il rumore dello strumento (σ=0,177) è più grande del segnale che dovrebbe misurare.

#agentes#llm#curiosidade#noisy-tv#embeddings#reinforcement-learning
2 agosto 2026

Statistiche sull'IA nel 2026: il tabellone, verificato numero per numero

I data center "consumeranno più di 1.000 TWh nel 2026 — l'equivalente del Giappone", ripetono le raccolte di statistiche sull'IA. Sono andato a verificare: la stessa IEA ha mandato in pensione il numero; la serie attuale misura 485 TWh. Ho verificato una per una le statistiche che più circolano, alla fonte primaria, e il tabellone ha "confermato", "mezza verità", "fossile" e "zombie" — con uno schema ricorrente: il denominatore omesso (il "53% della popolazione" era USA, 18-64 anni). E il gradino Brasile che nessuna versione internazionale ha: l'84% degli universitari ha già usato la genAI, mentre il paese è fuori dalla top-15 dell'investimento privato.

#ia#estatisticas#fact-check#energia#brasil
V4-Flash-0731: DeepSeek ha pubblicato la tabella in cui è lei stessa a perdere 9 a 0 — ed è il pezzo migliore del lancio
1 agosto 2026

V4-Flash-0731: DeepSeek ha pubblicato la tabella in cui è lei stessa a perdere 9 a 0 — ed è il pezzo migliore del lancio

Il titolo dice che il modello economico di DeepSeek batte il flagship di casa. La model card dice di più: Opus 4.8 vince tutte e nove le righe della tabella — pubblicata da DeepSeek stessa. Perché annunciare la propria sconfitta funziona quando costi 89 volte meno, cosa dice il salto da 7,3 a 54,4 senza nuova architettura sul post-training, e cosa le prime 48 ore fuori dall’harness hanno confermato e smentito.

#deepseek#llm#api#benchmarks#open-weights