A manchete de ontem aqui era que a prova de Navier-Stokes tinha saído em Lean. Hoje chegou o preço, e ele veio com o recibo rasurado. O compilado da AINews põe no título ~10 mil agentes, 130B tokens e mais de US$ 40 milhões; no corpo, o mesmo texto separa cuidadosamente o que os tweets estabelecem (os 10 mil agentes, um ano de multiagent RL, test-time compute paralelo e não estruturado) do que não estabelecem — enunciado do teorema, preprint, artefato de verificação formal, comparação com baseline de agente único — e registra que as “88 horas” que todo mundo repetiu aparecem, naquele conjunto de tweets, só num post satírico. Do outro lado, o TabNews traz a disputa de autoria: Buckmaster e Alpöge dizem que tocavam abordagem semelhante pelo Codex e pelo Claude e suspeitam que o trabalho privado deles tenha chegado à OpenAI. Custo e procedência do mesmo resultado, os dois em aberto no mesmo dia.
E é a pergunta do dia inteiro, em escalas absurdamente diferentes. Um dev brasileiro somou tempo de CPU por user-agent em sete dias e achou 63% indo para clientes que nunca pedem um arquivo estático — a conta que a reunião ia creditar à feature de IA. Um paper mostra que reescrever query num RAG só se paga quando roteada por confiança, em menos de 40% das perguntas. A NVIDIA explica quando tirar o encoder de visão do prefill compensa, e quando não. A Anthropic está sendo processada porque o multiplicador que vendeu não bate com as horas que ela mesma publicou. Na China, advogado e arquiteto subempregado vendem o próprio ofício a 100 a 500 yuans por tarefa para virar dado de treino.
O contraponto está na camada de arquitetura, e é o que me incomoda: Raschka passa o dia explicando looped transformers e recurrent depth, onde o raciocínio acontece dentro do modelo e não no scratchpad. Quando o cálculo deixa de virar token, some junto a régua de cobrança e a superfície de auditoria. Ontem a auditoria do agente parou em 51%; se o rastro nem existe em texto, não é que ela pare — é que não tem onde começar. Isso é opinião minha, não o que o artigo afirma.
laboratórios
When to Use Encode-Prefill-Decode Disaggregation — separar o vision encoder do prefill e do decode no Dynamo, com os embeddings viajando por NIXL. Em carga de dez imagens por request com OSL 1024, o TTFT cai 58% com encoder colocated no mesmo GB200 e 50% com tier heterogêneo (RTX 6000D para encoder, GB200 para PD); o fim-a-fim melhora pouco, porque gerar 1024 tokens continua custando o que custava. O ganho grande é goodput: 70% mais tráfego no mesmo SLO de ITL abaixo de 100 ms, sem tocar no orçamento de GB200. O texto também diz onde não compensa — modelo denso grande, saída longa, pouca mídia — que é a parte rara num post de fabricante.
Modernizing complex legacy code with AI agents — 40 mil das 300 mil linhas de um simulador de reservatório em Fortran 77 migradas para C++ num operador de energia europeu, sem suíte de testes e sem documentação central. O que vale ler são as duas tentativas que falharam antes: com autonomia total, um agente por subrotina, o resultado foi Fortran redigitado em sintaxe de C++ (COMMON block virou struct global um-para-um, GOTO intacto); com pipeline de planner, coder, tester e reviewer, a qualidade subiu mas os agentes travavam num bug e ficavam lá, sem ninguém para desempacar. O que ficou de pé foi um humano operando o workflow, módulo a módulo, com módulo definido empiricamente como subárvore de menos de ~10 mil linhas. E o parity harness veio antes de qualquer migração: dump de estado do Fortran, checkpoint carregado no teste em C++, igualdade numérica como prova de que o módulo acabou.
How Goodfire used Ai2’s open post-training stack — a Goodfire usou Olmo 3, o dataset de preferência Dolci e o OLMES para prever quais comportamentos o preference training ia reforçar antes de rodar o treino inteiro, e depois rastrear uma regressão de segurança até exemplos individuais. O treino melhorou capacidade geral e ao mesmo tempo deixou o modelo mais disposto a atender pedido nocivo embrulhado em ficção; a causa apareceu em pares onde a resposta preferida cedia e a rejeitada recusava. O método também pescou comportamentos que ninguém teria pensado em incluir num eval. Nada disso é possível com peso aberto e mais nada: precisa dos pares chosen/rejected e dos checkpoints intermediários publicados.
pesquisa
GPT-6 Astra, looped transformers, and hidden reasoning — Raschka junta as impressões do Astra com a literatura de blocos de transformer em laço e profundidade recorrente, que é o mecanismo por trás do rumor de que o modelo esconde a chain of thought. Ele registra 99,9% no ARC-AGI-3 contra 7,8% do GPT-5.6 Sol, mas nota que no Artificial Analysis Coding Agent Index o Astra está na fronteira sem abrir vantagem grande — e faz a ressalva certa sobre harness: modelo é treinado com um harness principal em mente, e o harness costuma ser desenhado para amplificar as forças daquele modelo. O detalhe prático para quem escreve software é outro: a recomendação de arquivar AGENTS.md e SKILL.md antigos, porque instrução velha demais vira camisa de força para modelo que já resolveria melhor sozinho.
Better Together: Complementary Query Rewriting Under a Strong RAG Baseline — sob um pipeline competitivo (BGE denso, cross-encoder reranking, MMR), reescrever a pergunta sozinha empata com o baseline; o ganho vem de unir estratégias que erram em perguntas diferentes. União de quatro métodos sobe o HIT@10 de 39,22 para 51,70 no EnterpriseRAG-Bench de 512 mil documentos, cinco métodos chegam a 52,98, e controles com o mesmo orçamento de retrieval capturam só ~40% disso — ou seja, é complementaridade, não budget. No AmbigNQ a mesma fusão piora 2,4 pontos. O achado que muda código: um router que só reescreve quando o top-1 do baseline vem com score baixo captura +4,3 de HIT@10 pagando reescrita em menos de 40% das queries, e sozinho desiste de reescrever no AmbigNQ.
brasil
Somei o tempo de CPU por user-agent em 7 dias — a conta do provedor subiu 38% no trimestre, a reunião já tinha a feature de IA como culpada e havia duas instâncias na mesa. Antes disso, o autor trocou o log format do nginx para registrar $request_time e somou por balde: quem chega com Mozilla/5.0 completo e nunca pede um asset é um terço das requisições e 63% do tempo de processamento, a 74 ms/req contra 11 ms/req do navegador de verdade — porque coletor pede exatamente as rotas caras. A segunda medição explica por que aumentar cache não move nada: 418.902 URLs distintas, 2,18 requisições por URL na semana. Depois de versão barata das rotas caras, canonical tirando a combinatória do índice e limite na borda, a fatia caiu para perto de 20% e o p95 dos relatórios quase pela metade; as instâncias seguem não aprovadas. É o relato do kernel.org que virou manchete aqui dia 7, agora refeito num catálogo com filtro na query string — e com a ressalva honesta no fim: o log separa robô de gente por comportamento, não diz se aquele coletor alimenta um buscador que te traz gente.
OpenAI é acusada de trapaça em suposta solução para Navier-Stokes — só a chamada está disponível. Ela anuncia que Tristan Buckmaster e Levent Alpöge afirmam que desenvolviam abordagem semelhante usando Codex e Claude e suspeitam que informação do trabalho privado deles tenha chegado à OpenAI antes da divulgação; a empresa nega e diz ter chegado ao resultado de forma independente. A prova segue sem validação da comunidade matemática.
mercado
Sammelklage wegen Claude-Nutzungslimits — ação coletiva de junho (3:26-cv-05763) alegando que o Max não entrega o 5x e o 20x anunciados. A aritmética dos autores usa números da própria Anthropic, do e-mail de julho que introduziu limites semanais: 40 a 80 horas de Sonnet 4 no Pro, 140 a 280 no Max 5x, 240 a 480 no Max 20x — o que dá 3,5x e 6x, não 5x e 20x. A primeira audiência é 18 de setembro, e há uma segunda ação parecida (4:26-cv-07699). Dia 14 entra o aumento de 25% nos limites semanais anunciado em agosto, que sobre o patamar atual de +50% é uma redução de 17%. Para quem tem Claude Code no caminho crítico do dia, a régua virou matéria judicial.
mundo
Now it’s China’s experts who are gig workers training AI — arquitetos, advogados e engenheiros de software chineses com uma ou duas décadas de carreira fazendo bico em plataformas de anotação especializada: Siriser (Alibaba), Xpert (ByteDance, mais de 50 mil especialistas), TalentsAI, MeetChances. A tarefa é subir documento do trabalho real e escrever o próprio raciocínio, sem usar IA para produzi-lo, e paga 100 a 500 yuans (US$ 15 a 74) por algumas horas — sem pagamento nenhum se o controle de qualidade rejeitar. Precisa ser tarefa que o modelo ainda não resolve, o que fica mais difícil a cada release. Com desemprego jovem em 17,9% em julho e o mercado de dados de treino projetado em 7,8 bilhões de yuans (US$ 1,1 bilhão) em 2026, é o preço de mercado do rótulo especializado ficando visível.
quem escreveu
AINews: OpenAI reports Navier-Stokes singularity find — além do inventário do que os tweets estabelecem e do que não, a edição tem uma nota de contexto que diz muito sobre o ciclo: rodada de US$ 48 bilhões da Cognition, rodada de US$ 24 bilhões da Mistral, GPT Image 2.5 e o relançamento do time da Dreamer como agente Muse da Meta ficaram todos de fora, porque “a régua está mais alta”. A leitura técnica que sobra do episódio é sobre arquitetura de pesquisa, não sobre fluidos: decomposição de tarefa, memória persistente, gestão de árvore de busca e política de coordenação aprendida entre agentes.
o resto em uma linha
A Baymard republicou a pesquisa de Accounts & Self-Service UX com 57 diretrizes vindas de 1.400+ problemas observados em teste: 81% dos participantes guardam cartão na conta dos sites que usam muito e 60% gostam de ter 2FA opcional, o que basicamente encerra a discussão sobre passkey e OTP substituindo senha em checkout.
fontes paradas
Anthropic Engineering em 108 dias sem publicar, Karpathy em 132, AI Snake Oil em 35, Chrome Developers em 80, web.dev em 104. Anthropic News, Microsoft Research e Amazon Science batem 9 dias cada.