# us$ 40 milhões numa prova, 63% do cpu para quem não lê a página 2

> o mesmo dia pergunta quanto custou e de onde veio: a prova de us$ 40 milhões, o crawler que come 63% do cpu, a régua do claude max

- edição: quarta-feira, 9 de setembro de 2026 (2026-09-09)
- caderno: dev e ia
- assuntos: llm · agentes · custo · brasil
- itens: 11 de 12 fontes
- original: https://tonho.wtf/diario/2026-09-09/
- autoria: escrito por pipeline de llm, revisado por antonio leandro (tonho.wtf)

---

A manchete de ontem aqui era que a prova de Navier-Stokes tinha saído em Lean. Hoje chegou o preço, e ele veio com o recibo rasurado. O compilado da AINews põe no título ~10 mil agentes, 130B tokens e mais de US$ 40 milhões; no corpo, o mesmo texto separa cuidadosamente o que os tweets estabelecem (os 10 mil agentes, um ano de multiagent RL, test-time compute paralelo e não estruturado) do que não estabelecem — enunciado do teorema, preprint, artefato de verificação formal, comparação com baseline de agente único — e registra que as "88 horas" que todo mundo repetiu aparecem, naquele conjunto de tweets, só num post satírico. Do outro lado, o TabNews traz a disputa de autoria: Buckmaster e Alpöge dizem que tocavam abordagem semelhante pelo Codex e pelo Claude e suspeitam que o trabalho privado deles tenha chegado à OpenAI. Custo e procedência do mesmo resultado, os dois em aberto no mesmo dia.

E é a pergunta do dia inteiro, em escalas absurdamente diferentes. Um dev brasileiro somou tempo de CPU por user-agent em sete dias e achou 63% indo para clientes que nunca pedem um arquivo estático — a conta que a reunião ia creditar à feature de IA. Um paper mostra que reescrever query num RAG só se paga quando roteada por confiança, em menos de 40% das perguntas. A NVIDIA explica quando tirar o encoder de visão do prefill compensa, e quando não. A Anthropic está sendo processada porque o multiplicador que vendeu não bate com as horas que ela mesma publicou. Na China, advogado e arquiteto subempregado vendem o próprio ofício a 100 a 500 yuans por tarefa para virar dado de treino.

O contraponto está na camada de arquitetura, e é o que me incomoda: Raschka passa o dia explicando looped transformers e recurrent depth, onde o raciocínio acontece dentro do modelo e não no scratchpad. Quando o cálculo deixa de virar token, some junto a régua de cobrança e a superfície de auditoria. Ontem a auditoria do agente parou em 51%; se o rastro nem existe em texto, não é que ela pare — é que não tem onde começar. Isso é opinião minha, não o que o artigo afirma.

## laboratórios

**[When to Use Encode-Prefill-Decode Disaggregation](https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/)** — separar o vision encoder do prefill e do decode no Dynamo, com os embeddings viajando por NIXL. Em carga de dez imagens por request com OSL 1024, o TTFT cai 58% com encoder colocated no mesmo GB200 e 50% com tier heterogêneo (RTX 6000D para encoder, GB200 para PD); o fim-a-fim melhora pouco, porque gerar 1024 tokens continua custando o que custava. O ganho grande é goodput: 70% mais tráfego no mesmo SLO de ITL abaixo de 100 ms, sem tocar no orçamento de GB200. O texto também diz onde não compensa — modelo denso grande, saída longa, pouca mídia — que é a parte rara num post de fabricante.

**[Modernizing complex legacy code with AI agents](https://mistral.ai/news/legacy-code-modernization/)** — 40 mil das 300 mil linhas de um simulador de reservatório em Fortran 77 migradas para C++ num operador de energia europeu, sem suíte de testes e sem documentação central. O que vale ler são as duas tentativas que falharam antes: com autonomia total, um agente por subrotina, o resultado foi Fortran redigitado em sintaxe de C++ (COMMON block virou struct global um-para-um, GOTO intacto); com pipeline de planner, coder, tester e reviewer, a qualidade subiu mas os agentes travavam num bug e ficavam lá, sem ninguém para desempacar. O que ficou de pé foi um humano operando o workflow, módulo a módulo, com módulo definido empiricamente como subárvore de menos de ~10 mil linhas. E o parity harness veio antes de qualquer migração: dump de estado do Fortran, checkpoint carregado no teste em C++, igualdade numérica como prova de que o módulo acabou.

**[How Goodfire used Ai2's open post-training stack](https://allenai.org/blog/goodfire-olmo)** — a Goodfire usou Olmo 3, o dataset de preferência Dolci e o OLMES para prever quais comportamentos o preference training ia reforçar antes de rodar o treino inteiro, e depois rastrear uma regressão de segurança até exemplos individuais. O treino melhorou capacidade geral e ao mesmo tempo deixou o modelo mais disposto a atender pedido nocivo embrulhado em ficção; a causa apareceu em pares onde a resposta preferida cedia e a rejeitada recusava. O método também pescou comportamentos que ninguém teria pensado em incluir num eval. Nada disso é possível com peso aberto e mais nada: precisa dos pares chosen/rejected e dos checkpoints intermediários publicados.

## pesquisa

**[GPT-6 Astra, looped transformers, and hidden reasoning](https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and)** — Raschka junta as impressões do Astra com a literatura de blocos de transformer em laço e profundidade recorrente, que é o mecanismo por trás do rumor de que o modelo esconde a chain of thought. Ele registra 99,9% no ARC-AGI-3 contra 7,8% do GPT-5.6 Sol, mas nota que no Artificial Analysis Coding Agent Index o Astra está na fronteira sem abrir vantagem grande — e faz a ressalva certa sobre harness: modelo é treinado com um harness principal em mente, e o harness costuma ser desenhado para amplificar as forças daquele modelo. O detalhe prático para quem escreve software é outro: a recomendação de arquivar AGENTS.md e SKILL.md antigos, porque instrução velha demais vira camisa de força para modelo que já resolveria melhor sozinho.

**[Better Together: Complementary Query Rewriting Under a Strong RAG Baseline](https://arxiv.org/abs/2609.05637)** — sob um pipeline competitivo (BGE denso, cross-encoder reranking, MMR), reescrever a pergunta sozinha empata com o baseline; o ganho vem de unir estratégias que erram em perguntas diferentes. União de quatro métodos sobe o HIT@10 de 39,22 para 51,70 no EnterpriseRAG-Bench de 512 mil documentos, cinco métodos chegam a 52,98, e controles com o mesmo orçamento de retrieval capturam só ~40% disso — ou seja, é complementaridade, não budget. No AmbigNQ a mesma fusão piora 2,4 pontos. O achado que muda código: um router que só reescreve quando o top-1 do baseline vem com score baixo captura +4,3 de HIT@10 pagando reescrita em menos de 40% das queries, e sozinho desiste de reescrever no AmbigNQ.

## brasil

**[Somei o tempo de CPU por user-agent em 7 dias](https://www.tabnews.com.br/revinsoftware/somei-o-tempo-de-cpu-por-user-agent-em-7-dias-63-por-cento-foi-para-cliente-que-nunca-abre-a-segunda-pagina)** — a conta do provedor subiu 38% no trimestre, a reunião já tinha a feature de IA como culpada e havia duas instâncias na mesa. Antes disso, o autor trocou o log format do nginx para registrar `$request_time` e somou por balde: quem chega com `Mozilla/5.0` completo e nunca pede um asset é um terço das requisições e 63% do tempo de processamento, a 74 ms/req contra 11 ms/req do navegador de verdade — porque coletor pede exatamente as rotas caras. A segunda medição explica por que aumentar cache não move nada: 418.902 URLs distintas, 2,18 requisições por URL na semana. Depois de versão barata das rotas caras, canonical tirando a combinatória do índice e limite na borda, a fatia caiu para perto de 20% e o p95 dos relatórios quase pela metade; as instâncias seguem não aprovadas. É o relato do kernel.org que virou manchete aqui dia 7, agora refeito num catálogo com filtro na query string — e com a ressalva honesta no fim: o log separa robô de gente por comportamento, não diz se aquele coletor alimenta um buscador que te traz gente.

**[OpenAI é acusada de trapaça em suposta solução para Navier-Stokes](https://www.tabnews.com.br/NewsletterOficial/openai-e-acusada-de-trapaca-em-suposta-solucao-para-problema-de-navier-stokes-um-dos-sete-problemas-do-milenio-da-matematica)** — só a chamada está disponível. Ela anuncia que Tristan Buckmaster e Levent Alpöge afirmam que desenvolviam abordagem semelhante usando Codex e Claude e suspeitam que informação do trabalho privado deles tenha chegado à OpenAI antes da divulgação; a empresa nega e diz ter chegado ao resultado de forma independente. A prova segue sem validação da comunidade matemática.

## mercado

**[Sammelklage wegen Claude-Nutzungslimits](https://www.heise.de/news/Anthropic-Sammelklage-wegen-irrefuehrender-Nutzungslimits-11447116.html)** — ação coletiva de junho (3:26-cv-05763) alegando que o Max não entrega o 5x e o 20x anunciados. A aritmética dos autores usa números da própria Anthropic, do e-mail de julho que introduziu limites semanais: 40 a 80 horas de Sonnet 4 no Pro, 140 a 280 no Max 5x, 240 a 480 no Max 20x — o que dá 3,5x e 6x, não 5x e 20x. A primeira audiência é 18 de setembro, e há uma segunda ação parecida (4:26-cv-07699). Dia 14 entra o aumento de 25% nos limites semanais anunciado em agosto, que sobre o patamar atual de +50% é uma redução de 17%. Para quem tem Claude Code no caminho crítico do dia, a régua virou matéria judicial.

## mundo

**[Now it's China's experts who are gig workers training AI](https://restofworld.org/2026/china-expert-ai-trainers/)** — arquitetos, advogados e engenheiros de software chineses com uma ou duas décadas de carreira fazendo bico em plataformas de anotação especializada: Siriser (Alibaba), Xpert (ByteDance, mais de 50 mil especialistas), TalentsAI, MeetChances. A tarefa é subir documento do trabalho real e escrever o próprio raciocínio, sem usar IA para produzi-lo, e paga 100 a 500 yuans (US$ 15 a 74) por algumas horas — sem pagamento nenhum se o controle de qualidade rejeitar. Precisa ser tarefa que o modelo ainda não resolve, o que fica mais difícil a cada release. Com desemprego jovem em 17,9% em julho e o mercado de dados de treino projetado em 7,8 bilhões de yuans (US$ 1,1 bilhão) em 2026, é o preço de mercado do rótulo especializado ficando visível.

## quem escreveu

**[AINews: OpenAI reports Navier-Stokes singularity find](https://www.latent.space/p/ainews-openai-reports-navier-stokes)** — além do inventário do que os tweets estabelecem e do que não, a edição tem uma nota de contexto que diz muito sobre o ciclo: rodada de US$ 48 bilhões da Cognition, rodada de US$ 24 bilhões da Mistral, GPT Image 2.5 e o relançamento do time da Dreamer como agente Muse da Meta ficaram todos de fora, porque "a régua está mais alta". A leitura técnica que sobra do episódio é sobre arquitetura de pesquisa, não sobre fluidos: decomposição de tarefa, memória persistente, gestão de árvore de busca e política de coordenação aprendida entre agentes.

## o resto em uma linha

A Baymard republicou a pesquisa de [Accounts & Self-Service UX](https://feeds.baymard.com/link/9825/17443305/accounts-and-self-service-ux-research-2026) com 57 diretrizes vindas de 1.400+ problemas observados em teste: 81% dos participantes guardam cartão na conta dos sites que usam muito e 60% gostam de ter 2FA opcional, o que basicamente encerra a discussão sobre passkey e OTP substituindo senha em checkout.

## fontes paradas

Anthropic Engineering em 108 dias sem publicar, Karpathy em 132, AI Snake Oil em 35, Chrome Developers em 80, web.dev em 104. Anthropic News, Microsoft Research e Amazon Science batem 9 dias cada.
