O número mais útil de hoje é um empate que não se resolve. Mesmo Opus 4.8, mesmas 80 tarefas, Claude Agent SDK contra deepagents: 48,8% contra 50,0%. O intervalo de confiança vai de 10 pontos contra o nativo a 7,5 a favor. A premissa de que o harness do fornecedor rende mais no modelo do próprio fornecedor não aparece na média. Aparece com sinal trocado conforme o tipo de tarefa, e aparece no custo, que é justamente a medida mais frágil do artigo. O resto do dia mora na mesma camada, entre o modelo e o mundo: um verificador mostrando que editar por número de linha corrompe 99,1% dos arquivos quando o conteúdo desloca uma linha, uma CLI que audita a transcrição de tool calls, a Linux Foundation abrigando um roteador que achata a diferença entre as APIs de OpenAI e Anthropic, um app brasileiro por cima do Claude Code que já promete Codex e Kimi. Para mim, se o harness nativo não ganha nem no próprio modelo, fica mais fácil defender um harness só para vários modelos, e o roteador é a peça que barateia essa troca. Ficam fora desse fio os itens de modelo e infraestrutura: o MoE da NVIDIA, o cache do block diffusion, a Oracle pagando datacenter com folha. E a frase de quinta, escrever ficou barato, conferir não, ganhou um dado: 22 dos 81 runs cortados pelo teto de tempo já tinham produzido um patch que passava.
O relatório de uso indevido da Anthropic, pelo resumo do Xataka, mostra a mesma camada do lado de quem não devia estar ali. A célula no Iêmen montou um harness de três papéis — uma instância do Claude programando, outra pesquisando, uma terceira revisando a primeira. As proteções barraram muitos pedidos, mas não todos: o objetivo vinha escondido e o projeto vinha picado entre conversas. As checagens de hoje têm essa mesma granularidade: o verificador pré-ação julga um comando, o ToolReplay julga uma sessão contra ela mesma. Acho que esse é o lugar certo para pegar o erro silencioso, mas não é onde se enxerga intenção. No mesmo dia, Bryan Cantrill escreve que inteligência não basta, que engenharia exige o mundo físico e que a IA só age nesse mundo até onde humanos permitem. Sobre risco de extinção, concordo que o ônus da prova é de quem alega. Mas a premissa do controle humano consola pouco quando quem controla é quem quer a arma. A equipe na Rússia desenhou o enxame justamente para detonar sem humano no circuito, e a célula do Iêmen voltou ao Claude horas depois de um teste de foguete que, ao que parece, deu errado.
laboratórios
MoE dropless em JAX com o Transformer Engine — No treino do DeepSeek-V3 em GB200, o baseline não otimizado fazia 103 TFLOPS/GPU e gastava 84% do tempo de kernel acumulado em comunicação entre GPUs. Com os kernels do Transformer Engine, chegou a 1.068 TFLOPS/GPU, 10,4x. O ganho vem de tratar o tensor irregular que o router produz sem descartar nem preencher tokens. Um grouped GEMM roda todos os experts numa chamada só, com a contagem real de tokens e sem a cópia device-to-host que quebra CUDA graphs. Dispatch e combine rodam fundidos sobre o NCCL EP, com MXFP8 nas multiplicações dos experts em Blackwell. A comparação é contra um baseline que a própria NVIDIA chama de não otimizado, não contra MegaBlocks ou outro stack de produção, então o 10,4x não diz quanto se ganha sobre o que você já roda.
pesquisa
Harness or Model? — A suíte é privada, com 256 tarefas de repositório e de programação competitiva posteriores ao cutoff. As mesmas 80 rodaram no Claude Agent SDK e no deepagents com Opus 4.8, e no SDK do Codex e no deepagents com GPT-5.5; 792 de 800 runs foram corrigidos por um oracle isolado. Nenhum dos contrastes mostra vantagem média: -1,25 pp para o nativo no Opus (IC 95% de -10,0 a +7,5) e +1,25 pp no GPT-5.5 (de -4,4 a +6,9). No Opus, o nativo perde 9,0 pp nas 61 tarefas de repositório e ganha 23,7 pp nas 19 de competição (p = 0,003), mas esse corte foi escolhido depois de ver os dados, e o próprio artigo pede uma replicação planejada. No custo por tarefa resolvida, o harness neutro sai 1,3 a 1,6 vez mais caro no Opus e 1,2 vez no GPT-5.5. Só que 58 runs na conta da Anthropic não deixaram registro de uso, e, dependendo de onde esse gasto cair, a razão vai de 0,7 a 2,3. Esta versão ainda corrige números de custo de agosto que vinham de um defeito na telemetria do próprio estudo. Minha leitura para quem escolhe ferramenta: “o nativo é melhor no modelo da casa” virou hipótese, e a conta de custo é mais frágil que a de acerto.
Look Before You Leap — A falha que o artigo persegue é a silenciosa: o comando que roda sem erro e faz a coisa errada. Em shell, um verificador estático sobre 9.930 comandos e 482 ferramentas pega 95,8% dos inválidos com 10,0% de falso positivo. As checagens de sintaxe e de binário têm zero falso positivo e sozinhas pegam metade dos erros; todo falso positivo vem da checagem de flags, limitada pelo que o help text cobre. Em edição de código, 640 edições em 224 arquivos mostram que o formato decide. Search/replace e diff falham com barulho. Edição ancorada em número de linha corrompe 99,1% dos arquivos quando o conteúdo desloca uma linha, e a ancorada em nome de função acerta a função errada 12,7% das vezes. Um aplicador que ancora no conteúdo, verifica e se recusa quando não tem certeza registrou uma aplicação errada silenciosa em 8.320 tentativas (0,01%). Formato de edição é justamente o tipo de diferença que um contraste de harness inteiro, como o de cima, não separa.
Fixed State, Long Reach — Diffusion LMs decodificam tokens em paralelo, mas o denoiser bidirecional impede o KV cache comum. Block diffusion volta a cachear bloco a bloco, mas os caches usados até aqui dependem de attention, crescem O(L) e, enxertados sem treino, só aproximam a conta do modelo. O artigo treina três denoisers de 3B (attention, Mamba e híbrido) com 300B tokens e objetivo block-causal, que torna o cache exato. Em 256k tokens, com o cache de attention em 82 GB e 29 ms por passo, o de Mamba tem latência 4,3x menor, 11x menos memória e 2,6x o throughput de um stream. Como a memória não cresce, escala com batch até 14x o throughput agregado, onde attention não passa de um stream. Mamba e híbrido seguem fazendo retrieval até 8 a 16 vezes o comprimento de treino, enquanto attention colapsa em 2x. O abstract diz que isso não custou qualidade mensurável, sem dizer em que avaliação, e tudo é em 3B.
brasil
anywh.sh, um app nativo por cima do Claude Code — wilmacedo publicou no TabNews um app open source (Apache 2.0, sem telemetria) para quem usa o Claude Code em mais de uma máquina e com mais de uma conta. Cada perfil guarda conta logada, pasta de projeto e modelo, e o app tem terminal integrado, navegador de arquivos, upload de imagem e voz por modelo local. Por enquanto só funciona com o Claude Code; Codex CLI e Kimi CLI estão prometidos. O post resolve o resync entre máquinas com o app mais um relay e diz que tudo roda 100% local, mas não explica onde o relay fica. É a primeira coisa que eu perguntaria.
mercado
Agent Router vai para a Linux Foundation — Segundo o Publickey, a Agentic AI Foundation, braço da Linux Foundation que já cuida de MCP, AGENTS.md e do protocolo Agent2Agent, passa a abrigar o Agent Router. É um projeto open source que absorve as diferenças entre as APIs de OpenAI, Anthropic e outros fornecedores, com a meta anunciada de virar padrão da indústria. O trecho disponível tem só o título e o começo do texto: não dá para saber quem mantinha o projeto, quais APIs cobre nem como trata recurso sem equivalente do outro lado. Minha leitura, junto com o artigo do harness: sobra menos motivo técnico para casar harness e fornecedor, e a API vira a costura principal.
ToolReplay — CLI em Python 3.11+, sem dependência de runtime e sem acesso à rede. Lê a transcrição de tool calls em JSONL (índice, ferramenta, args e resposta, com um parser que recusa campo a mais). Sela os registros num hash chain SHA-256, aponta o primeiro elo quebrado, marca chamada redundante e não determinismo, e confere cada chamada contra uma lista de ferramentas permitidas. Lendo as regras do README, vejo dois limites. O escopo compara só o nome da ferramenta, então um agente com write_file liberado escreve em qualquer caminho sem gerar alerta. E a regra de redundância admite que uma escrita no meio pode ter mudado o estado, mas a de não determinismo não admite: no exemplo que vem no repositório, as duas buscas marcadas como não determinísticas têm um write_file entre elas.
Oracle demite de novo para pagar a conta da IA — A Oracle abriu hoje outra rodada de demissões, avisada por e-mail e sem número divulgado. A empresa projeta US$ 90 a 95 bilhões de capex neste ano e já acumula US$ 125 bilhões de dívida com datacenter e chip. No ano fiscal encerrado em 31 de maio, o quadro já tinha caído cerca de 21 mil pessoas (13%), e o custo do plano de reestruturação subiu US$ 700 milhões, para US$ 2,8 bilhões, principalmente por causa das rescisões. A Fast Company põe na mesma linha a Atlassian, que cortou cerca de 1.600 vagas (10%) em março para “autofinanciar” investimento em IA. Eu leio assim: o mecanismo aqui não é o agente substituindo gente, é o datacenter disputando o mesmo caixa que a folha. E isso não depende de o agente resolver 50% das tarefas ou 5%.
mundo
Claude como engenheiro de míssil, enxame e mapa de Taiwan — O Xataka resume o relatório mais recente da Anthropic sobre uso indevido dos modelos. No norte do Iêmen, uma célula tocava ao mesmo tempo um foguete guiado, um míssil balístico de múltiplos estágios com alcance-alvo acima de 2.000 km e uma família chamada R2000 com variante de planador hipersônico. Na Rússia, uma equipe pequena usou o Claude Code em boa parte do software de um enxame de drones FPV que identificava alvos, inclusive a categoria “pessoa”, e emitia a ordem de detonação sem humano no circuito. Na China, uma conta com vínculos a instituições da República Popular, entre elas a Academia de Ciências Militares do Exército de Libertação Popular, chegou à 12ª versão de uma suíte de guerra eletrônica cujo cenário padrão tinha 12 alvos em Taiwan. Uma operação ligada ao Irã montou em Python um pipeline de recomendação de alvos contra forças navais americanas, a partir de fotos públicas, transponders e imagem de satélite comercial. A Anthropic baniu as contas e passou informações sobre algumas operações às autoridades. O relatório não tem prova de arma operacional nem atribui o projeto russo e os chineses a programas oficiais.
quem escreveu
The contagion of fear — Bryan Cantrill abre com uma confissão de faculdade. Com colegas, anunciou num laboratório lotado de estudantes de humanas, na semana de provas, que um vírus tinha escapado do laboratório de computação, e o pânico fez gente desligar máquina e perder trabalho. O alvo do texto é a afirmação de Jacob Coxon, que saiu da Anthropic, endossada por Evan Hubinger, à frente de Alignment Science na empresa: mais de 10% de chance de a IA matar todos os humanos na próxima década. O contra-argumento vem de quem constrói computador. Engenharia não é só inteligência, depende de agir no mundo físico, e a IA só age nesse mundo até onde humanos responsáveis permitem. Quem faz a alegação extraordinária é que precisa provar, não o público que duvida. Chegou por Simon Willison e pelo Lobsters.
o resto em uma linha
- Five eras of UX design and the lessons to keep in the AI era — chamada do UX Collective que promete percorrer as reinvenções de human factors desde a Bell Labs e defender que as lições mais antigas são as que servem agora; só a chamada estava disponível.
fontes paradas
Mais de 100 dias: First Round Review (322), fasterthanli.me (257), Brendan Gregg (221), The Gradient (208), Andrej Karpathy (137), Anthropic Engineering (113), web.dev (109). Entre 30 e 100: Eugene Yan (86), Chrome Developers (85), A List Apart (76), Lil’Log (73), Adjacent Possible (36). Até um mês: Stripe Blog (26), Airbnb Engineering (20), Netflix Tech Blog (17), One Useful Thing (15), Anthropic News (14), Microsoft Research (14), Go Blog (13), GitHub Engineering (12), Fly.io (12), NAVER D2 (12), Meta Engineering (11), Benedict Evans (11), Import AI (8), Dan Luu (8), Discord Blog (7), Kakao Tech (7).