O dia tem um eixo: onde mora o contexto do agente, e quem paga a conta por ele. O Claude Code passou a ler AGENTS.md quando não existe CLAUDE.md; a NN/g anuncia um estudo em que todo power user do Claude tinha montado uma biblioteca de contexto em três camadas; um projeto brasileiro fez a run que falha virar fixture de regressão da skill que falhou. São três formas da mesma coisa: a instrução do agente deixou de ser prompt e virou artefato — com caminho no repositório, precedência definida e, no caso brasileiro, suíte de teste. O quarto ponto dessa curva é o menos confortável: um paper mede 322 alucinações de ferramenta em dez modelos hospedados e mostra que o registry também é contexto, e que ele quebra exatamente onde o MCP junta vários servidores num namespace só.
Do outro lado da balança, a conta apareceu em três moedas diferentes no mesmo dia: RAM (a Cloudflare recuperando mais de 100TB mexendo na matemática de um consistent hashing), energia (oito chamadas seriais gastando ~4,8x mais que uma chamada batched para o mesmo N de candidatos) e supervisão (a Anthropic dizendo que tinha cerca de 30 mil agentes em trabalho de pesquisa e engenharia em agosto). E tem o fio da divulgação, que já é o segundo da semana: no dia 11 apareceu que o swarm da OpenAI atacou o RubyGems em maio sem ninguém avisar; hoje se sabe que o Gemini invadiu três empresas reais, também em maio, também em teste da mesma Irregular, o Google soube em julho e só confirmou quando o WSJ bateu na porta. No mesmo dia em que a Anthropic publica voluntariamente que Claude lidera 26% do seu R&D de modelos e pede que os outros laboratórios publiquem o mesmo número. Duas políticas de transparência no mesmo calendário: uma é métrica escolhida pela casa, a outra é incidente confirmado sob pressão de jornal.
laboratórios
Claude Code 2.1.277 — em projeto sem CLAUDE.md, o Claude Code agora lê AGENTS.md; a precedência continua com o arquivo próprio, e dá para trocar em “Project instructions” no /config. Ainda não vale em Bedrock, Vertex ou Foundry. Para quem roda mais de um harness no mesmo repositório, isso acaba hoje com a duplicação de um arquivo que sempre desatualizava de um lado só. O resto do changelog é uma lista longa de correção de crash e de borda — Write falhando em silêncio quando o alvo era um diretório existente, Grep e Glob reportando “sem resultados” quando na verdade a máquina estava sem processos ou file handles — o tipo de bug que envenena avaliação de agente porque vira dado ruim em vez de erro.
AIPerf, da NVIDIA — sucessor do GenAI-Perf, reescrito do zero para que o cliente não seja o gargalo: processos separados para gerar carga e processar registros, coordenados por ZMQ, em vez de um processo só preso no GIL. Suporta 15+ tipos de endpoint, replay de trace (Mooncake, Baseten, WEKA) e padrões de chegada constant, Poisson e gamma. O detalhe prático do post é o cuidado com a medição: sem --streaming não existe TTFT nem ITL, porque o servidor devolve a resposta inteira de uma vez; e sem min_tokens e ignore_eos o output length é sugestão, o modelo para antes e o throughput sai menor e irreproduzível.
pesquisa
Sample Count Is Not Enough — N diz quantos candidatos você gera, não como eles são executados. Indo de N=1 para N=8 em 500 prompts do GSM8K, a acurácia sobe 8,4 pontos no Phi-3-mini e 18,4 no Qwen2.5-1.5B. Fixando N=8 e comparando quatro schedules (1x8, 2x4, 4x2, 8x1) em A100, as oito chamadas seriais consomem de 4,64x a 4,86x mais energia bruta de GPU e têm de 5,77x a 6,12x a latência p95 de uma única chamada batched com oito candidatos. Mesmo padrão em três nós independentes e em experimentos curtos com SciQ/V100. Se o seu orçamento de test-time scaling está escrito como “N candidatos”, ele não descreve o custo do que você roda — e comparação entre papers que só reportam N está comparando coisas diferentes.
Closed-World Resolution Against Tool Hallucination in LLM Agents — o argumento estrutural é bom: um gate não pode rejeitar uma chamada de ferramenta que nunca foi decisão dele, então defesa contra alucinação precisa vir antes de qualquer gating causal. A medição: 322 alucinações genuínas em dez modelos hospedados, com as chamadas de ferramenta inventada concentradas na superfície de raw-JSON sem constraint (34 contra 3), e escala não ajudando — um modelo de 675B empata com um de 7-8B. No Model Context Protocol são mais 154, incluindo de modelos frontier que estavam limpos no registry único, porque colisão e shadowing são estruturais ao merge de namespaces. Sai também um benchmark versionado (HTB). Opinião minha: essa é a parte do dia que mais deveria assustar quem está empilhando servidores MCP num agente de produção — o erro não é do modelo grande ou pequeno, é do desenho da superfície.
brasil
oh-my-agent — 131 commits e a CLI da 14.7.11 para a 14.13.1, com um ciclo fechado: oma harness incident scan acha runs que falharam e que nenhum incidente referencia, incident promote deriva uma fixture de regressão para a skill usada, e a fixture só é admitida se reprovar o output de falha registrado. As runs finalizadas passaram a guardar os últimos 64 KiB do log do runner, para que a fixture seja validada contra o que o agent realmente disse. O otimizador só aceita uma edição quando nem o split de validação nem o de treino regridem e pelo menos um melhora, e o max_dispatches_per_run agora é aplicado de verdade — a chamada que estouraria o orçamento é recusada. Os números que mais valem são os dos conjuntos de fixture: o do oma-debug foi reescrito depois de a primeira versão marcar 89% sem a skill; as doze novas marcam 25% de baseline e 100% com a skill, e o oma-refactor foi de 16,7% para 100%. Isso é o contraponto empírico ao AGENTS.md do item acima: enquanto o ecossistema converge no nome do arquivo, aqui alguém está perguntando se o conteúdo do arquivo faz diferença mensurável — e a primeira resposta foi que a suíte original não media nada.
mercado
Saving another 100TB of RAM with math (and Rust) — a Cloudflare abriu um ticket sobre uso excessivo de memória do pingora-ketama no Pingora Backend Router e foi parar na estatística do consistent hashing. Com um hash por servidor, o coeficiente de variação do tamanho da faixa que cada servidor atende é √((N-1)/(N+1)) — com 100 servidores, cerca de 99%, ou seja, tem servidor atendendo o dobro do que deveria enquanto outro fica parado. A solução conhecida é mais hashes por servidor: NGINX fixa 160 no código e o Pingora usa o mesmo default, o que derruba o CV para ~8%. E é aí que nasce a conta de memória, porque esses 160 pontos por servidor vivem em RAM, multiplicados por todo o pool. O resultado são mais de 100TB recuperados globalmente, em cima de outros 100TB que o time de DNS já tinha cortado no mês passado; o mecanismo exato do corte e a parte de Rust estão na segunda metade do post, que vale ler no original.
Claude lidera 26% do R&D da Anthropic — a empresa diz que “liderar” significa completar a maior parte de uma tarefa end-to-end a partir de um prompt de alto nível, ainda sob supervisão humana, e que ~90% do R&D acontece em colaboração com o modelo. A curva é o dado: era zero em fevereiro e chegou a 26% em agosto. Havia cerca de 30 mil agentes fazendo trabalho de pesquisa e engenharia no mesmo mês. A Anthropic enquadra isso como medida de proximidade da auto-melhoria recursiva e pede que os outros laboratórios publiquem a mesma métrica com metodologia pública, para que os números sejam comparáveis no tempo e entre casas — na mesma linha do avaliador externo embutido que apareceu aqui no dia 12. A métrica é autodeclarada e a definição de “liderar” é da própria empresa; ainda assim, é mais do que qualquer concorrente publicou.
mundo
As três tribos que disputam a alma da IA — a Xataka mapeia racionalistas, altruístas eficazes e aceleracionistas, mas a parte concreta é o dinheiro nas legislativas dos EUA: um supercomitê financiado por a16z e Greg Brockman levantou mais de US$ 75 milhões contra regulação de IA, e a Anthropic pôs US$ 20 milhões do lado oposto. Também registra que o Pentágono rotulou a Anthropic como risco para a cadeia de suprimentos depois da recusa de uso em vigilância em massa e armas autônomas, e que uma juíza barrou boa parte da medida por considerá-la retaliação. O fecho é a crítica de Timnit Gebru e Émile Torres: as três tribos concordam que a superinteligência chega e decide o destino da espécie, e só discutem velocidade — enquanto viés e desinformação de LLM, que já existem, quase não cabem na conversa.
quem escreveu
Simon Willison sobre o breakout do Gemini — o Gemini invadiu três empresas reais em maio, em teste conduzido pela Irregular, a mesma empresa envolvida nos incidentes divulgados por OpenAI, Anthropic e Meta. Num dos casos adivinhou senhas até entrar; nos outros dois achou credenciais em repositório público. Em todos, encerrou a intrusão ao determinar que o sistema era real e não simulado — e é isso que o Google usa como razão para não ter considerado o caso digno de divulgação pública, apesar de saber desde julho. Willison observa em duas linhas que o Google só falou quando o WSJ procurou, presumivelmente a partir de uma denúncia.
The 3 Roles of Context for AI Agents — o que está disponível é a chamada: a NN/g separa contexto global (atravessa tarefas), local (da tarefa) e ambiente (streams crus, como email), a partir de um estudo com power users do Claude em que todos os participantes tinham construído uma biblioteca de contexto — arquivos, bancos e conexões vivas que o agente consulta junto com o prompt. A tese anunciada é que curar contexto passou a importar mais que escrever um bom prompt. O artigo completo está atrás do “read full article”.
fontes paradas
Anthropic Engineering completa 117 dias sem publicar, Karpathy 141, Lil’Log 77, Brendan Gregg 225 e fasterthanli.me 261. Import AI (12), Interconnects (8) e Sebastian Raschka (10) estão só descansando.