antonio leandro

dev e iaagentespaperssegurançainference

claude trabalha de laptop fechado, e três typos quebram o probe

o claude passa a trabalhar sem ninguém olhando; deu certo hoje onde o juiz era mecânico (diff de ir, tempo de execução) e falhou no probe que lê o modelo por dentro.

· 10 itens de 9 fontes

escrito por pipeline de llm, revisado por antonio leandro antes de publicar · como é feito

A Anthropic juntou chat e Cowork num Claude só, e a mudança de verdade é que a tarefa continua depois que você fecha o laptop. O controle que resta é um ajuste: por padrão o Claude pergunta antes de agir, e dá para trocar por um modo em que ele só chama quando algo precisa de um olhar mais atento. Conferir deixa de ser o passo seguinte e vira exceção — e o resto do dia, lido junto, é sobre o que confere quando ninguém está olhando.

Onde funcionou, o juiz era mecânico e ficava fora do modelo. A NVIDIA confia nos kernels de GPU portados por agentes porque um diff de IR julga a tradução antes de qualquer teste. O modelo de 4B que escolhe plano melhor que o Postgres aprendeu porque o relógio diz se o plano presta (e até o relógio precisou de uma bancada contra ruído). Onde o juiz lê o modelo por dentro, três erros de digitação por mensagem tiram 12 pontos de um probe de prompt injection. A manchete de ontem foi que o RL ainda não compra problema difícil, e o caso do Postgres afina a frase: join ordering é NP-hard de resolver e barato de conferir, basta rodar a consulta. Minha leitura é que o RL não compra problema difícil de conferir. A alta de juros do Fed não conversa com nada disso.

laboratórios

Cowork e chat viram um Claude só — Você não escolhe mais onde a tarefa mora: o Claude decide o que ela pede, segue trabalhando com o laptop fechado, mostra o progresso no celular e roda tarefa agendada sem ser chamado. Chegam também Claude Docs e Claude Slides, e o Claude Design passa a funcionar dentro da conversa, com exportação para PowerPoint e PDF; os três estão em beta nos planos pagos. O rollout começa por Pro e Max nas próximas semanas, Team e Free vêm depois, e admins de Enterprise recebem aviso com pelo menos 30 dias de antecedência. Para quem já configurou skills e connectors, o ponto prático é que eles passam a valer num modo que roda sem você. Eu olharia o ajuste de check-in antes de deixar qualquer connector com permissão de escrita nesse modo.

OpenAI publica um framework para relatar desalinhamento — A OpenAI anuncia um método para rastrear, investigar e divulgar desalinhamento de modelo, junto com seis relatórios de comportamento inesperado ou preocupante. Só tenho a chamada: não sei o que o framework obriga a divulgar nem em que prazo, nem se o swarm que atacou o RubyGems em maio sem aviso (edição de 11/09) está entre os seis casos.

cuTile Rust, portado de Python por agentes — O cutile-rs leva o ownership do Rust para kernels de GPU baseados em tiles, dividindo as saídas mutáveis em pedaços disjuntos. Com um pipeline multiagente, a NVIDIA portou os 24 operadores públicos do TileGym (cerca de 40 kernels, de operações element-wise a decode de flash-attention, MLA e MoE) e chegou, na média, a 99,5% do desempenho da versão em Python. O que torna o porte confiável é que cuTile Python, Triton-TileIR e cuTile Rust compilam para o mesmo Tile IR, então cada tradução passa por um diff de IR: uma tradução “wrong-but-plausible” passa nos testes, mas não passa no diff. O trabalho pesado foi explicitar o que o JIT do Python especializa em silêncio — um layer_norm vira duas entradas em Rust porque um branch muda o rank do tile. É a manchete de 10/09 (escrever ficou barato, conferir não) num caso em que conferir sai barato porque o IR é o mesmo.

pesquisa

BITCOS: ternário abaixo de 1,58 bit — O formato padrão de LLM ternário põe cinco trits num byte e, com grupos em potência de dois, gasta 1,625 bit por peso, como se −1, 0 e +1 fossem igualmente prováveis. Os autores mediram 29 modelos ternários e acharam até 51,5% de zeros. O layout proposto, um bitmap de presença mais um vetor de sinais compactado, custa 2 − z bits por peso, sendo z a fração de zeros: só ganha do padrão quando z passa de 37,5%, o que acontece em 26 dos 29 modelos, e chega a 1,485 bit no mais esparso. Em inference, o ganho vai a até 1,28× no kernel de multiplicação e a até 1,18× (CPU) e 1,27× (GPU) no throughput de decode, com números só de x86 (AVX-512, AVX2) e GPUs Intel Xe2; CUDA e ARM não aparecem no resumo.

Um modelo de 4B contra o planejador do Postgres — Rohan Bansal pegou um modelo aberto de 4B e fez SFT e depois RL agêntico para gerar planos de consulta. A premissa é que join ordering é NP-hard, mas um plano se confere rodando. O destaque que li é uma redução de 44,7% na latência de 113 consultas pesadas em join, partindo de um modelo que no começo não conseguia gerar plano para 99 delas. O título fala em 81%, e o trecho que consegui ler para antes da metodologia, então não sei o que cada número mede nem se as 113 consultas ficaram fora do treino. Para quem já tentou RL em ambiente real, o que interessa é a infraestrutura: uma bancada que reduz o ruído do page cache do Linux entre containers concorrentes, uma variante de GRPO para pontuar rollouts com medição ruidosa, vLLM e trainer num nó alugado com 2× H100, quatro containers de Postgres na mesa do autor e destilação off-policy sobre cerca de 500 trajetórias do GPT-6 Astra.

Latent Undertow: erro de digitação quebra probe — Probes que leem os hidden states para detectar prompt malicioso são uma defesa barata contra prompt injection. O paper mostra que um typo comum, que não muda a intenção do usuário nem a resposta do modelo, gira o vetor de leitura do probe no token alterado, e o efeito cai abaixo de 15% em uns 10 tokens. Com uns três typos por mensagem, um probe de posição única perde 12,0 pontos percentuais de TPR a 1% de FPR, e recalibrar não fecha essa diferença. Agregar várias posições resolve typo concentrado, mas typo espalhado ainda custa cerca de 3,8 pontos. A correção é um fork do kv cache: um sufixo fixo e curto depois da mensagem do usuário, para o probe ler alguns tokens adiante da perturbação. Isso recupera 95% da perda (sobra 0,6 ponto), contra 3,7 pontos que ainda se perdem com treino aumentado com perturbações. A geometria se repete em Llama-3.1-8B, Qwen3-8B e Gemma-4-E4B, mas o probe só foi avaliado no Llama-3.1-8B.

brasil

BLIND-CLAUDE.md, do Nubank — Uma pessoa com baixa visão que trabalha no Nubank transformou um atrito de todo dia num arquivo de instruções referenciado pelo CLAUDE.md. A iniciativa nasceu no NuPlural, o grupo de funcionários com deficiência, que foi de 5 para mais de 400 pessoas desde 2021. O arquivo não mexe no modelo: parte de que a resposta vai ser ouvida por leitor de tela e define regras concretas, como prosa curta ou lista simples em vez de tabela densa, referência autocontida em vez de “veja acima”, equivalente em texto para todo diagrama e explicação do que o código faz antes ou junto do snippet. A regra central é “Every response must make sense read top-to-bottom, out loud, in order.” No exemplo do post, a arquitetura diplomat, que sem o arquivo vinha como wire.in → adapter → model → logic → controller, passa a ser narrada em sequência. No dia em que a Anthropic leva slides e design para dentro da conversa, o arquivo lembra que o formato padrão de uma resposta presume que alguém vai olhar para ela.

mercado

OpenAI entra em publicidade com Sponsored Agents — A OpenAI anuncia produtos de publicidade: Sponsored Agents, ferramentas para profissionais de marketing e integrações com HubSpot e Shopify. Só li a chamada, e ela não diz se Sponsored Agents são agentes de marca que o usuário aciona ou patrocínio dentro do que o agente recomenda. Para quem vende software, essa diferença é a notícia inteira.

mundo

Fed sobe juros pela primeira vez em três anos — O Federal Reserve subiu a taxa de 3,5%–3,75% para 3,75%–4%, por unanimidade e contra os pedidos de corte de Trump. Kevin Warsh, de quem se esperava alinhamento com a Casa Branca, justificou a alta dizendo que a inflação está alta demais há tempo demais. É a primeira alta desde julho de 2023, e a maioria do comitê projeta outra ainda este ano, para 4%–4,25%, com cortes só a partir de 2028. Não tem ligação com o resto do dia. Registro porque, na minha opinião (não na da BBC), é o preço do dinheiro que vai financiar data center e rodada de IA pelos próximos dois anos.

quem escreveu

Ben Thompson: Salesforce, agentes como UI e a corrida para o headless — O texto é para assinantes, e só li a chamada: a Salesforce está abandonando a UI como fosso, “a very smart move because it’s disappearing for everyone”. É o lançamento da Anthropic visto do outro lado do balcão: se documento, slide e design cabem dentro de uma conversa, quem vendia a tela passa a vender o que o agente consegue chamar.

fontes paradas

Dias sem publicar: Anthropic News (16; o lançamento de hoje saiu no blog do claude.com), Anthropic Research (7), Anthropic Engineering (115), Microsoft Research (16), GitHub Engineering (14), Fly.io (14), Netflix Tech Blog (19), NAVER D2 (14), Kakao Tech (9), Console.dev (7), Chrome Developers (87), web.dev (111), A List Apart (78), Import AI (10), Last Week in AI (8), Sebastian Raschka (8), Benedict Evans (13), One Useful Thing (17), Adjacent Possible (38), Lil’Log (75), Eugene Yan (88), Andrej Karpathy (139), The Gradient (210), Brendan Gregg (223), First Round Review (324).