
Bajé el dataset: 14.591 ediciones de 3.100 agentes que dicen ser de OpenAI copiando en un wiki alemán. Copia real; la acusación de encubrimiento retrocedió.
#ia#agentes#openai#seguranca#fact-check#metodologia
Refiz a conta dos 2,42 bilhões de usuários de IA: cinco degraus, um só dado publicado. O último é a China, que mede por telefone quem usou uma vez em 6 meses.
#ia#estatisticas#china#brasil#metodologia
Circulou que 48% das skills de agentes de IA são inseguras. A fonte não é um estudo: é o post de um blogueiro de SEO, cujo filtro descartou 261.451 achados para chegar lá. Dois meses depois, NVIDIA e OpenClaw Foundation mediram 67.453 versões com três scanners ao mesmo tempo — e os três devolveram 6,57%, 7,75% e 48,71%.
#ia#agentes#ciberseguranca#fact-check#metodologia

Comprobé uno a uno los números sobre energía de IA. Seis de siete tenían la ficha técnica cambiada. El séptimo, el que decidiría la red aquí, no existe.
#ia#energia#data-center#brasil#fact-check#metodologia

Los cuatro números cuadran: 57 frente a 62 en el índice, 0,09 USD frente a 3,14 USD por tarea. El titular de los 100 billones, no: la frase es de otra empresa.
#glm#z.ai#llm#benchmarks#open-weights#fact-check

EE. UU. tiene una serie mensual de despidos atribuidos a la IA (Challenger). Brasil tiene 37–41% del empleo expuesto, uso récord de ChatGPT y Claude — y ninguna estadística de lo que ya pasó. Fui a las fuentes primarias.
#ia#brasil#fact-check#estatisticas

La página de estadísticas de deepfake más completa que encontré avisa que los números vienen de quien vende detectores — y aun así saca de ahí sus siete cifras centrales. Las comprobé una a una: Signicat, Entrust dos veces, Sumsub dos veces, Resemble AI e iProov. Siete de siete proveedores, ningún organismo oficial, ninguna academia, ninguna encuesta pública. Cuatro filas del marcador son falsas, y los errores sobre leyes van todos en la misma dirección: hacen que la regulación parezca más avanzada de lo que es. Fui a buscar lo que existe de verdad: la única cifra oficial de daño es de US$ 893 millones — el 4,28% de las pérdidas del año, bajo una etiqueta que el FBI define como "contiene una referencia a inteligencia artificial"; la única medición independiente de la capacidad humana es académica y da 55,5%, con un intervalo de confianza que cruza el 50%, es decir, una moneda; y el mejor dato público del mundo es brasileño, del Cetic.br, porque prueba en vez de preguntar (41% se dicen confiados, 17% salió bien en la prueba, sin correlación entre ambas cosas). Conté el panel de Resemble AI yo mismo: de los 2.266 incidentes, el famoso "US$ 1.300 millones" describe 159.
#deepfake#estatisticas#desinformacao#metodologia#fraude#brasil

El 27 de agosto de 2026, una carta abierta convocada y alojada por OpenAI pidió una respuesta colectiva a los ciberataques impulsados por IA, y la prensa cubrió la cifra: más de cien empresas. Fui tras la pregunta aburrida — qué se comprometió exactamente alguien a hacer. Separé los cuatro bloques de peticiones de una captura fijada de la página y busqué dentro de ellos las cinco señales que distinguen un compromiso de una declaración de intenciones: cifra, plazo, verbo que obliga, responsable nombrado y meta verificable. Son dieciocho frases en imperativo y, en veinte celdas, ninguna ocurrencia. El ámbar que aparece en la figura es una concesión que hice a mano contra mi propio argumento, y explico por qué. Para probar que la regla mide, corrí la misma prueba en una página de la propia OpenAI, de febrero, que enciende tres de las cinco columnas: la empresa escribe cifras cuando quiere. Muestro además que la lista de firmantes cambió cuatro veces en cuarenta y siete horas — 116, 127, 128, 155 — mientras que el texto de los cuatro bloques no cambió ni un byte, que una empresa salió sin explicación, y que la página tiene dos listas cuyos recuentos coinciden en el mismo número. Y separo, con cuidado, lo que es medida de lo que es análisis mío.
#ia#ciberseguranca#openai#politica-de-tecnologia#verificacao

Una infografía resuelve en una tabla qué se ejecuta en cada franja de memoria de vídeo, de 4 GB a 256 GB. Rehice la cuenta: de los diecisiete veredictos de hardware, dieciséis son correctos, y todos los modelos citados existen de verdad — la única pieza inexistente es la RTX 5080 Super, aplazada por tiempo indefinido porque el módulo de GDDR7 de 3 GB cuesta tres veces el de 2 GB. El error que importa es otro, y es de método: la infografía solo presupuesta el archivo de pesos e ignora el caché de contexto, que crece mientras conversas. Con las dos partidas medidas — pesos del GGUF publicado, caché calculado del config.json de cada modelo — uno de los diez escalones no cierra ni en una sesión de trabajo de 32 mil tokens, y es justamente el más popular, el de 8 GB; seis de los diez no cierran en el contexto máximo del propio modelo que la infografía recomienda. Separo además cuatro trampas de nomenclatura, entre ellas un "Q8" que tiene 4,3 bits por peso y un formato que no es del mismo ecosistema que los otros, y tres salvedades que valen para la tabla entera, incluyendo por qué dos tarjetas de 32 GB no son una tarjeta de 64 GB.
#ia#llm#hardware#quantizacao#vram#didatico

Clasifiqué los 20 números más citados sobre OpenAI: 8 son oficiales, 6 son reportaje, 3 son meta y de 3 nadie sabe de dónde salieron. El 92 % tiene 31 meses. Fui a la fuente de cada número que circula en los compilados sobre la empresa: los de la propia OpenAI concuerdan — y son los menos interesantes; lo que da titulares es lo que ella nunca firmó. El "92 % de la Fortune 500" salió de la respuesta de OpenAI a la demanda del New York Times, en enero de 2024, y circula sin fecha; 24 mil millones de ingresos es oficial, 40 mil millones es estimación, 280 mil millones es meta — juntar los tres con el mismo verbo está mal aunque cada número sea correcto; SoftBank invirtió 64,6 mil millones, no "más de 71", y los 500 mil millones de Stargate son un compromiso de computación, no una inversión. El "salario de US$ 76.001" de Altman es la suma de dos columnas del Form 990, el año siguiente da 113.674, y él es el décimo de doce nombres en remuneración. En Brasil, "50 millones de usuarios" aparece idéntico en agosto de 2025 y agosto de 2026 — los mensajes por día subieron 54 %.
#ia#openai#estatisticas#metodologia

274, 95 o 403.420 modelos de lenguaje: los tres conteos son correctos. Y el benchmark de código que circula fue abandonado por su propio creador en febrero. Fui a verificar las estadísticas de LLM que circulan en compilados: "cuántos modelos existen" no tiene respuesta porque sobra definición — 403.420 repositorios en Hugging Face (medición propia, un comando de una línea), 95 notables en el AI Index de Stanford, 274 en un catálogo editorial. La nota que el laboratorio se da a sí mismo resistió la comprobación (cero a cuatro puntos de diferencia donde el mismo modelo fue medido desde fuera); lo que no resiste es la regla: OpenAI declaró el SWE-bench Verified contaminado y dejó de publicarlo el 23/02/2026, y en agosto todavía es la prueba de "quién programa mejor". Las comparaciones entre versiones se equivocan de signo (el DeepSeek de agosto está 8 puntos por delante del Opus 4.8, no por detrás); "el más caro" cuesta US$ 30 en los compilados y US$ 150 en el catálogo real; los modelos más grandes con tamaño conocido son todos abiertos. En Brasil, Maritaca fija precios en reales y publica el único comparativo de costo de suite en moneda nacional: R$ 206 en el Sabiá 4 Thinking contra R$ 590 en el Opus 4.8.
#ia#llm#estatisticas#benchmarks#metodologia

Um estudo meu sobre recusas de IA que passam despercebidas dentro de sistemas de agentes foi interrompido por uma recusa: o classificador de salvaguardas bloqueou a geração do corpus, porque um conjunto de prompts SOBRE recusas lê, para um classificador, como material ofensivo. Havia dois caminhos — reescrever o pedido até passar, o que quase sempre funciona, ou parar. Reformular um pedido porque ele foi sinalizado é evasão de salvaguarda, um andar abaixo do jailbreak e da mesma família; um pesquisador que contorna o classificador para estudar o classificador contaminou o próprio objeto. Congelei o braço do estudo com data no arquivo de estado do projeto e me candidatei ao Cyber Verification Program da Anthropic, o canal formal para trabalho de uso duplo com propósito defensivo. A aprovação saiu dentro do prazo de dois dias úteis. O que ela é: uso duplo deixa de ser bloqueado por padrão, dentro do caso de uso submetido e sob monitoramento contínuo. O que ela não é: parceria, certificação ou endosso — uso proibido continua bloqueado com programa ou sem. E fica a lição que o incidente entrega de graça, que é a tese do estudo: uma recusa só é gerenciável quando é legível. A que me bloqueou tinha texto, categoria e porta de saída; as que eu estou medindo chegam ao orquestrador como resultado vazio e são tratadas como sucesso.
#ia#agentes#ciberseguranca#anthropic#pesquisa#salvaguardas

Un abogado perdió diez años de conversaciones en una mañana y un video concluyó que Meta leyó lo que él escribió. Fui a verificar esa acusación en los informes técnicos de WhatsApp de 2016 a 2026, en el código del cliente, en capturas archivadas del centro de ayuda de Instagram, en la decisión de la Comisión Europea de 2017 y en los autos de procesos en Brasil, Estados Unidos e India. El video se equivoca por dos razones, y la segunda entierra el argumento: banear en masa y ruidosamente es la firma de un clasificador automático, no de quien lee — quien tiene una capacidad secreta valiosa protege la capacidad, no el caso individual. Pero lo que queda en su lugar es peor. La empresa pasó a definir sola qué cuenta como conversación protegida y a listar excepciones que ella misma reconoce; ninguna observación disponible al público distingue una empresa que no puede leer de una que puede y no lo dice; y las tres elecciones que producen esa imposibilidad — aplicación cerrada, sin build reproducible, sin auditoría externa — son de ella, y reversibles por ella. El 8 de mayo de 2026 Meta apagó el cifrado de extremo a extremo de los mensajes de Instagram: la garantía que nos vendieron como matemática siempre fue una promesa corporativa, y las promesas corporativas se revocan.
#criptografia#whatsapp#instagram#meta#privacidade#verificacao

El "95% de los pilotos de IA fracasa" salió de 52 entrevistas y no midió agentes. Fui a las fuentes primarias: toda estadística de agentes es previsión, declaración o medición — y cada una falla a su manera. Gartner publica una previsión y una encuesta de webinar en la misma página; el AI Index dice 70% en el resumen y 79% en su propio gráfico; METR cronometró a desarrolladores un 19% más lentos mientras ellos se creían un 20% más rápidos, y en 2026 no pudo repetir el ensayo porque nadie acepta trabajar sin IA; la métrica de consistencia desapareció de los rankings; un récord fue retirado por filtración de respuestas. Medí la tubería (SDK de MCP: 1.087 veces en 18 meses) y Brasil (17% de las empresas usan IA; el 68% de eso es automatización de flujos). Ningún número es falso — todos cambian de peso cuando la etiqueta va con ellos.
#ia#agentes#estatisticas#benchmarks#metodologia

Nathan Barry resumió la Teoría de las Restricciones en una frase — el esfuerzo fuera del cuello de botella empeora el cuello de botella — apoyado en la serie de Tiago Forte que circula como "la explicación" del asunto. Fui a comprobar la serie, el libro y la frase, y escribí un simulador de colas para medir en vez de discutir por analogía. La serie tiene 11 posts, no 3, y los que dicen qué hacer después de encontrar el cuello de botella están detrás de un paywall; los cinco pasos de Goldratt no están en La Meta, sino en un libro de 1990 que casi nadie abre; y la frase-moraleja acierta el signo y erra el grado: doblar la capacidad de quien no es la restricción no sacó un ítem más (-0,3%, ruido) e hizo que la espera creciera 33% más rápido — empeora la espera, no la salida. Elevar la restricción en 25% rindió 24,9%. La cuerda de Goldratt cuesta 5% de caudal y compra una travesía 8.900 veces menor. Subo la escalera en cuatro peldaños — la panadería, los nombres, la Ley de Little y los cinco pasos leídos en la fuente, el puente con agentes de IA, dónde el cuello de botella cambia de lugar — y cierro comprobando Ford, Spanx y Kit. Diez figuras propias, hechas en código; la misma panadería reaparece con los datos de cada experimento.
#teoria-das-restricoes#goldratt#gestao#filas#lei-de-little#agentes-de-ia#didatico
Dos imágenes virales comparan Mac Studio M5 Ultra 256 GB, RTX 5090, RTX PRO 6000 y DGX Spark en "valor por dólar" para ejecutar IA en casa. Fui a comprobarlo: la métrica multiplica stock por caudal, el precio del Spark murió en febrero y la PRO 6000 entró sin PC anfitrión. Después rehíce la cuenta que importa — tokens por dólar contra la API del mismo modelo — y su primera versión asumía que una persona usa la máquina el 1 % del tiempo. Medí 43.593 llamadas reales de agente de código en esta máquina: el 1 % no describe a nadie (el chat queda cerca del 0,03 %; el agente, entre el 10 % y el 30 %), el 96 % de la entrada es relectura de contexto, y cambiar la regla de cobro de esa relectura mueve la cuenta 16 veces, mientras que cambiar de máquina la mueve 3,6. En el único régimen en que la máquina más barata gana (1,5x), su día pico no cabe en el día y la llamada media, de 151,9 mil tokens, no cabe en el contexto del modelo. Compra por soberanía, no por ahorro.
#ia#llm#hardware#custo#inferencia-local

Un benchmark de seguridad de código midió a Claude Fable 5 en 59,8% de aciertos funcionales y 19,0% de aciertos seguros, y el número se volvió titular sobre un modelo que decepcionó. Seis días después, el mismo laboratorio, el mismo autor y el mismo benchmark publicaron la misma Fable 5 en 72,6% y 29,0% — la mejor marca de seguridad de la tabla en ese momento. No cambiaron el modelo; cambiaron la herramienta que lo operaba. Fui a buscar los dos textos y encontré un tercero, del mismo autor y del mismo día, que nadie cita: la auditoría antifraude del propio benchmark, que tumbó 9 puntos porcentuales de seguridad de una combinación sin que nada cambiara en el modelo. Muestro la conclusión estrecha que los datos sostienen — la nota es del par herramienta y modelo, y de la versión de la regla el día en que se ejecutó —, su límite (en los ocho pares del leaderboard la mediana de la diferencia es 1,65 puntos, y el caso de la Fable 5 es seis veces eso), el contradictorio de Hacker News, que acusa al benchmark de estar torcido CONTRA el modelo, y el hallazgo mecánico: conté los enlaces entre las cuatro páginas y el grafo es de sentido único — quien llega por el texto que circuló no tiene camino hasta la corrección. Seis figuras propias, hechas en código, y todos los cálculos por script sobre las 27 filas del leaderboard.
#ia#benchmark#seguranca#agentes#claude#metodologia

En 2009, Usain Bolt corrió 100 m en 9,58 s y nadie se le acercó en 17 años. El sábado 22 de agosto, en Pekín, un robot hizo la distancia en 9,39 s en una serie oficial — y hace un año el ganador de la misma prueba hacía 21,50 s. Leí los 14 posts más compartidos de la semana de los World Humanoid Robot Games 2026, descargué los 11 videos, extraje frame por frame, leí la prensa china, a los fact-checkers y el reglamento. La respuesta tiene dos mitades. La primera es sí: lo que pasó en Pekín es real, es mayor que 2025 por un orden de magnitud — 2.056 robots, 666 equipos, 16 países, cinco días — y es más impresionante de lo que cuentan las leyendas. La segunda es lo que las leyendas esconden: los 9,32 s que reposteó Elon Musk no son el número del marcador (a los 18 s del video se lee 9,39, serie 9, y el robot que ganó no es el de Honor); los dos clips más aterradores de la timeline son falsos; y la pregunta correcta para cada video no es "qué tiempo hizo" — es "quién estaba al mando". Primero los robots, después la vara. Actualizado el 26/08: la final cerró los Juegos en 8,64 s.
#robotica#humanoides#china#ia#fact-check#video
La expresión "marca de agua" hace que casi todo el mundo imagine lo equivocado: un sello escondido, un carácter invisible, algo añadido al texto. No es nada de eso: no se inserta nada, y lo que cambia es el origen del sorteo cuando el modelo elige entre dos palabras que servirían igual de bien. Explico el mecanismo desde cero, primero sin una sola palabra técnica (el camino a casa y un número secreto acordado con un amigo), después con los nombres que aparecen en la documentación. Del mecanismo salen gratis todos los límites: por qué el texto corto casi no marca, por qué el código casi no marca, por qué corregir un texto tuyo casi no marca, y por qué la marca nunca dirá quién escribió. También separo lo que la prensa va a juntar estos días: marca de agua en el texto y credencial C2PA en el archivo son mecanismos distintos. Siete figuras propias, hechas en código. Y la salvedad que cambia el uso: la API que permitiría a cualquiera comprobar un texto todavía no existe — el artículo lo trata como promesa, no como hecho.
#ia#claude#anthropic#marca-dagua#regulacao#didatico
La pregunta de quien quiere ejecutar un modelo de lenguaje en su propio ordenador es siempre la misma: ¿esto cabe aquí? La respuesta tiene dos partidas, y solo una de ellas crece mientras conversas. Explico las dos desde cero, tres veces seguidas: primero sin ninguna palabra técnica, luego con los nombres que aparecen en la documentación, luego con la fórmula y los números reales del Qwen3.8-27B, lanzado este mes — 27.781.427.952 parámetros, 64 capas de las cuales solo 16 guardan caché que crece, 15,82 GiB de pesos en Q4_K_M y 16,14 GiB de caché en el contexto máximo de 262.144 tokens. Por el camino, tres trampas que los números redondos esconden: K es 1.024 y no mil, GB no es GiB, y el nombre del modelo es redondeado. Todo número de este artículo sale de un programa publicado junto: cualquier lector rehace la cuenta en su propia máquina.
#ia#llm#hardware#quantizacao#didatico
Por primera vez Anthropic empeoró la nota que se da a sí misma — y reclasificó el pasado con ella. Leí las 186 páginas del informe de riesgo de agosto de 2026: lo que importa no es la nota, sino las cinco fallas de proceso que la empresa describe, incluida una contaminación de entrenamiento que alcanzó a casi todos los modelos Claude con corte de conocimiento posterior a diciembre de 2024.
#anthropic#seguranca-de-ia#claude#governanca

Z.ai retrasó los pesos abiertos del GLM-5.3 alegando que la capacidad ofensiva del modelo creció más rápido de lo esperado, y ofreció como prueba un ledger público de 2436 vulnerabilidades en software real. Descargué y conté el ledger entero: el 92 % de los hallazgos nunca fue reportado a nadie, exactamente uno consta como enviado al mantenedor, no hay plazo de embargo declarado y ningún registro atribuye el descubrimiento a un modelo — el 21 % usó Claude Code como harness.
#glm#z.ai#llm#benchmarks#open-weights#seguranca
La página de estadísticas más completa sobre Claude Code atribuye sus cifras de descargas a un paquete de npm que nunca existió: 404 en el registro, cero capturas en Wayback Machine. El paquete real tiene una API pública, sin clave y sin muro de pago — 429 millones de descargas acumuladas, 44,4 millones solo en el mes en que la página publicó "111 000+". Medí cada número que se podía medir y el marcador cerró en cuatro correctos, cuatro equivocados y dos sin fuente que permita juzgar: la encuesta de "15 000 desarrolladores" tenía 906 respuestas; las "22 000 estrellas" eran 71 847 el 1 de marzo; el "open source" tiene un LICENSE.md de catorce palabras, tres de las cuales son "all rights reserved". Del otro lado, la afirmación más increíble de la lista — el 4 % de todos los commits públicos de GitHub — se confirma como estimación, y la propia Anthropic la repitió en el anuncio de la Serie G. El detalle que ordena el marcador: los errores apuntan todos en la misma dirección, hacia abajo. El producto medible por API pública es mayor que el producto descrito por la página que existía para promoverlo. Y el dato primario que nadie usa da el recorte brasileño: el 26,0 % del uso de Claude.ai en Brasil viene de ocupaciones de computación y matemáticas — por encima de la media global (23,8 %) y de Estados Unidos (21,1 %).
#ia#claude-code#anthropic#estatisticas#fact-check#brasil
Brasil es el quinto país que más usa Claude — y el dato, al contrario de casi todo lo que circula, viene de fuente primaria: el microdato que la propia Anthropic publica bajo CC-BY. Descargué el dataset y medí. La misma medición dice lo que el titular no carga: en intensidad per cápita somos el 61.º de 121 — estamos en la cima porque somos grandes, no porque seamos intensos. Volumen no es intensidad, y la versión en dinero de esa confusión (run rate no son ingresos) sostiene casi todas las páginas de "estadísticas de Claude" de 2026. Verifiqué la más completa de ellas fuente por fuente: el run rate de 47 000 millones de dólares es un mes fuerte anualizado; el CFO, bajo juramento, declaró más de 5 000 millones desde la fundación en la misma ventana de los "~19 000 millones" públicos — no es un flagrante, es velocímetro contra odómetro. Y el único dato que cualquiera puede reproducir gratis recibe una línea en la página; la filtración recibe el titular.
#ia#claude#anthropic#estatisticas#fact-check#brasil
Los dos números que sostienen cualquier página de "estadísticas de ChatGPT" — 900 millones de usuarios activos semanales y 50 millones de suscriptores — vienen de la misma frase de un comunicado de financiación de 110 000 millones de dólares. Fui a leer el post: la definición de "usuario activo semanal" no está ahí. Existe, pero vive en otro documento, publicado cuatro meses después, con un alcance más estrecho. Y el denominador tiene paternidad rastreable: el COO midió 400 millones contra la población total, el paper de OpenAI con el NBER midió 700 millones contra la adulta, y la página que me dio el tema volvió a la total — "el 10 % pasó a 11 %" parece progresión y es cambio de regla. En la misma regla serían 11,3 % y 14,5 %. Y el escalón Brasil: el portugués es el segundo idioma no inglés de ChatGPT, y dos medios describieron el mismo briefing de OpenAI con métricas distintas en la primera línea.
#ia#chatgpt#openai#estatisticas#fact-check#brasil
2420 millones de personas usan IA generativa, dice el titular — pero la propia fuente desaconseja leer ese número como personas. Verifiqué cada peldaño de la pirámide en la fuente primaria, añadí el peldaño que ninguna versión internacional tiene (Brasil) y el resultado cambia la lectura: los usuarios de pago de todo el mundo son ~1 % de la humanidad, y la burbuja de los coding agents, el 0,14 %. No llegas tarde — el feed es la burbuja hablando de sí misma.
#ia#adocao#estatisticas#fact-check#brasil

En 2018, un agente movido por curiosidad se quedó hipnotizado frente a un televisor de estática — el noisy-TV problem, que el aprendizaje por refuerzo pasó siete años domando. Barrí cuatro literaturas buscando la misma trampa en la instrumentación de curiosidad de los agentes LLM: nadie la formalizó. Y no es hipotética — en el agente experimental que mantengo en mi máquina, el ruido del instrumento (σ=0,177) es mayor que la señal que debería medir.
#agentes#llm#curiosidade#noisy-tv#embeddings#reinforcement-learning
Los data centers "consumirán más de 1000 TWh en 2026 — el equivalente a Japón", repiten las recopilaciones de estadísticas de IA. Fui a verificar: la propia IEA retiró el número; la serie actual mide 485 TWh. Verifiqué una a una, en la fuente primaria, las estadísticas que más circulan, y el marcador tiene cuadra, media verdad, fósil y zombi — con un patrón: el denominador omitido ("el 53 % de la población" era EE. UU., 18-64 años). Y el escalón Brasil que ninguna versión internacional tiene: el 84 % de los universitarios ya usó genAI, mientras el país queda fuera del top-15 de inversión privada.
#ia#estatisticas#fact-check#energia#brasil

El titular dice que el modelo barato de DeepSeek supera al flagship de la casa. El model card dice más: el Opus 4.8 gana las nueve filas de la tabla — publicado por la propia DeepSeek. Por qué anunciar la propia derrota funciona cuando cuestas 89 veces menos, qué dice el salto de 7,3 a 54,4 sin arquitectura nueva sobre el post-entrenamiento, y qué confirmaron y desmintieron las primeras 48 horas fuera del harness.
#deepseek#llm#api#benchmarks#open-weights

Anthropic lanzó Claude Opus 5 prometiendo inteligencia de frontera a mitad de precio. Qué cambió realmente en la API, qué muestran los gráficos del anuncio cuando abres las imágenes — incluido que el esfuerzo máximo empeora el resultado — y por qué la burla más votada de la comunidad no sobrevive a una verificación.
#claude#anthropic#llm#api#benchmarks