antonio leandro

dev e iallmpapersinferênciamercado

google solta voz ao vivo, e o rl ainda não compra problema difícil

gemini 3.8 live sai em duas faixas de preço, o rl melhora só o que já era fácil e o naive bayes bate um 397b com rótulo: o dia é alocação de compute.

· 12 itens de 12 fontes

escrito por pipeline de llm, revisado por antonio leandro antes de publicar · como é feito

O anúncio do dia é o Google colocando voz ao vivo em produção, e até ele chega partido em dois: um modelo para escala e custo, outro para tarefa complexa. Essa divisão é o fio de tudo o que veio depois. Um paper mede que o RL engorda o que o modelo já acertava e quase não move o difícil, e propõe realocar amostragem para onde o compute ainda compra alguma coisa. Outro reusa um índice de 1 bit para não pagar attention densa em contexto longo. Um terceiro mostra Complement Naive Bayes empatando com um 27B e ganhando de um frontier de 397B em classificação de tópico, a milhares de amostras por segundo numa CPU comum. A NVIDIA publica o critério explícito de quando dense e quando MoE, com preço e throughput na mesma tabela. Ninguém está perguntando qual modelo é mais inteligente. Estão todos perguntando onde o compute a mais para de comprar capacidade.

E tem a camada de fora, que é a conta mesmo. No TabNews, o argumento é que sem custo por token e veredito de eval no mesmo span você não descobre qual 1% das queries come metade do orçamento. A Cloudflare separa crawl de busca de crawl de treino, porque recusar um significava perder o outro. O diesel nos EUA bate recorde, que é o insumo de energia que os labs declaram como restrição. E contra o ensaio do Amodei que entrou aqui no dia 12, o Xataka aponta um detalhe simples de verificar: as palavras “open weights” não aparecem uma única vez no texto, e quem está derrubando preço é justamente quem publica peso.

laboratórios

Gemini 3.8 Live e 3.8 Live Extended Thinking — Dois modelos speech-to-speech no formato da família GPT-Live, e a divisão entre eles é declarada no próprio anúncio: o Live é para escala e eficiência de custo, o Extended Thinking é para tarefa complexa e raciocina enquanto fala, usando pistas verbais e narração de progresso para não deixar a conversa em silêncio durante uma chamada de tool. O Extended Thinking pegou o primeiro lugar no Speech to Speech Quality Index da Artificial Analysis (82,6), com 68,6% no τ-Voice, 35,1% no τ-Voice-banking da Sierra e 97,7% no Big Bench Audio; o Live ficou em segundo no Speech Agent Arena. Detecta e troca entre 97 idiomas no meio da conversa, executa tools em background enquanto continua respondendo, e todo áudio sai com marca d’água SynthID. Já está na Gemini API e no AI Studio, e o texto que vende “preço altamente competitivo” não traz um número de preço, o que é irritante num lançamento cujo argumento central é custo.

Dense vs. MoE: parâmetros ativos, throughput e quando escolher cada um — A tese útil do post da NVIDIA é que MoE desacopla memória de compute: VRAM acompanha o total de parâmetros, FLOPs por token acompanha os ativos. Um MoE de 30B e um dense de 30B ocupam os mesmos ~60 GB em BF16; a diferença é o que você compra com esses gigabytes, capacidade ou throughput. A vantagem aparece em batch 1, onde decode é limitado por memória e o MoE lê menos bytes de peso por token, e comprime em alta concorrência, quando os tokens acabam ativando quase todos os experts — que precisam estar na GPU ao mesmo tempo de qualquer jeito, sobrando menos espaço para o kv cache. A tabela fecha o argumento: Nemotron 3.5 Lightning (30B totais, 3B ativos, híbrido Mamba-2 + MoE) entrega 235,7 a 494,2 t/s a US$ 0,22 por milhão de tokens de saída, contra 46,8 t/s e US$ 3,00 do Qwen3.8-27B dense, com menos da metade da pontuação de capacidade (24 contra 52).

pesquisa

Learning to Solve Hard Problems in RL for LLMs by Never Giving Up — O efeito Mateus no RL: o treino melhora muito os problemas que o modelo já resolvia e pouco os difíceis, e os autores argumentam que os métodos atuais pioram isso ao gastar compute demais no que já está fácil. A proposta, Never Give Up, é amostragem adaptativa — continua gerando amostras para um problema até uma sair correta — que, apoiada em RL assíncrono, filtra o fácil com poucas amostras e realoca o resto para o difícil. No Deepscaler melhora performance por compute, com o ganho concentrado nos problemas duros; na tarefa de código Manufactoria, GRPO com reward por teste empaca em problemas que misturam testes fáceis e difíceis, e o NGU vai resolvendo testes cada vez mais duros até fechar o problema inteiro. Assinam Michael Noukhovitch, Hamish Ivison, Nathan Lambert e Aaron Courville.

Self-Indexing Attention — Inferência esparsa de contexto longo costuma usar estratégias de retrieval diferentes em prefill e decode, o que impede reaproveitar uma mesma representação ao longo da inferência. O paper propõe uma representação sign-magnitude compartilhada em domínio transformado, training-free, em que os sinais das keys viram um índice de 1 bit reusável nas duas etapas, resolvido por operações bitwise que os aceleradores modernos já suportam. A 5% de densidade de attention fica perto de dense attention no LongBench e no RULER, com até 6,1x de speedup no operador de attention em prefill e 10,3x em decode, e continua compatível com compressão de kv cache de baixo bit, testada com TurboQuant e DeepSeekV4-Flash.

LLMs or Naive Bayes? Old Gems or New Ways — Complement Naive Bayes contra LLMs de quatro famílias, de 27B a um MoE de 1T, em classificação de texto. O LLM só domina no regime sem dado rotulado (98,0% contra 88,2% no Amazon Polarity), e mesmo essa vitória é sensível a contaminação: numa tarefa de sentimento de baixa contaminação o NB ganha do zero-shot, 81,7% contra 73,0%. Com rótulo disponível, no AG News, o NB chega a 89,1%, estatisticamente indistinguível do 27B zero-shot (89,0%) e acima do frontier de 397B (84,8%), a milhares de amostras por segundo numa CPU comum — inferência batched de LLM pequeno em GPU sai 40 a 486x mais lenta, com cerca de duas ordens de grandeza mais energia por amostra. A linha de decisão é por tarefa, com parity em torno de 10⁴ rótulos para classificação de tópico, e vem acompanhada de um operador Helm para Kubernetes que automatiza a escolha com thresholds e métricas Prometheus verificáveis. Para quem mantém uma fila de classificação em produção, é o paper mais acionável do dia.

brasil

Observabilidade e Evals em Produção: O Fechamento do LLMOps — Quinto e último artigo da série de andersonlimadev no TabNews, com uma tese estreita o bastante para ser testável: sem prompt completo, versão de modelo e veredito de eval no mesmo span, não existe observabilidade generativa, só log de servidor fingindo entender LLM. O mecanismo concreto está nas GenAI semantic conventions do OpenTelemetry, e o detalhe que ele destaca é a separação entre gen_ai.request.model e gen_ai.response.model — é ela que torna model drift visível quando o provedor troca a snapshot por baixo sem você fazer deploy nenhum. Do lado do custo, defende atribuir tokens e custo a cada span como única forma de achar o 1% de queries que consome metade do orçamento, e rodar o eval span só numa amostra, já que LLM-as-judge em 100% das respostas não fecha a conta. Fecha com online evals em shadow contra golden set e rollback automático por degradação de métrica.

mercado

Cloudflare separa crawl de busca de crawl de treino — Até hoje, recusar treino a um crawler mixed-use significava sumir da busca, porque é o mesmo bot fazendo as duas coisas. A nova configuração Disallow AI Training publica a preferência no robots.txt e mantém liberados para indexação os crawlers com a designação Accountable; Apple, Google e Microsoft cumprem ou se comprometeram a cumprir os requisitos, que incluem visibilidade em nível de URL sobre quais páginas ficaram disponíveis para treino. Os números explicam o desenho: menos de 1% dos sites na Cloudflare bloqueiam bots de busca, contra 17% que ativam algum mecanismo contra treino. Vale a atenção para a mudança de semântica que passa a valer hoje — Block e “Block on pages with ads” agora se aplicam a crawlers mixed-use, ou seja, quem já usava Block perde busca também, e Managed Robots.txt foi depreciado em favor do Bot Preference Sync.

B2B Medical & Pharma UX Benchmark — O Baymard avaliou 10 sites de insumos médicos e farma em 400+ parâmetros, gerando 3.400+ scores ponderados e 2.600+ exemplos de boa prática, todos vindos de teste com usuário. Nenhum dos dez chega sequer a “decent”: a faixa vai de “poor” a “mediocre”, com Thermo Fisher, McKesson, Henry Schein e Sigma Aldrich no fundo. As falhas são de implementação, não de tendência — documentação ausente atrás de especificações que existem, o mesmo atributo com rótulo diferente de um produto para outro, preço e custo total do pedido fora da seção de compra, busca que desiste quando a query sai levemente errada, e carrinho que não pode ser salvo nem passado adiante, num contexto em que quem monta o pedido quase nunca é quem o aprova.

mundo

Diesel nos EUA em máxima recorde — Chamada do Semafor, sem texto completo disponível: o diesel bateu recorde nesta terça com estoques comerciais e estratégicos baixos, o CEO da Chevron dizendo que os buffers que seguravam o risco de preço e oferta se esgotaram, e a Arábia Saudita cancelando embarques para a Europa com o pipeline East-West fora do ar por semanas após ataque de drone. Fica linkado como contexto do insumo que os labs declaram como restrição das AI factories.

quem escreveu

Simon Willison, Gemini Live audio — Em vez de repetir o release, Willison apontou o GPT-6 Astra Extra High para a documentação e publicou uma UI web para testar os modelos novos: escolhe modelo e voz, system prompt opcional, conversa pelo navegador e pode interromper o modelo no meio da fala. A implementação não usa biblioteca nenhuma, conecta direto no endpoint WebSocket BidiGenerateContent e usa um AudioContext da Web Audio API para captura e playback. É a forma mais rápida de descobrir o que a API de fato entrega, que raramente é o que a tabela de benchmark diz.

Gergely Orosz, Inside OpenAI’s agentic software factory — Relato de uma visita à OpenAI com sete pessoas de engenharia, e o dado central é de adoção: em quatro meses, áreas não técnicas como finanças, recrutamento e jurídico saíram de perto de 0% para 90% de uso do Codex, sem mandato de cima. Uso de IDE cai desde janeiro, o que forçou repensar pull request e code review; a Perf Factory monitora produção e dispara agentes para corrigir regressão de performance sozinha; threads duram dias com o /goal, e um agente de longa duração ramifica outros agentes, reduzindo a superfície que um humano precisa gerenciar. Há duas ressalvas honestas no texto: o Codex interno é muito mais plugado nos sistemas da casa que o externo, e CPU virou gargalo da API. Vale ler contra o achado do dia 14 aqui — harness nativo não ganha na média, e mesmo assim a empresa inteira depende de um único harness compartilhado, a ponto de uma falha menor ser avisada por colegas antes do alerta automático disparar.

Javier Lacort, Xataka — A observação que sustenta o texto inteiro: as palavras “open weights” não aparecem uma única vez no “We must pace the frontier” do Amodei, que entrou aqui no dia 12. Certificação por capacidade é fácil de cumprir para um lab fechado, que controla cada cópia, e impossível para quem publica peso, porque qualquer um remove a salvaguarda depois; a isenção antitruste proposta desenha uma mesa onde quem não senta sofre os limites sem ajudar a fixá-los. Os números que ele junta são o argumento: DeepSeek V4 Flash sai 150x mais barato que GPT-5.5 em tokens de saída no OpenRouter, os melhores modelos abertos estão 3 a 6 meses atrás e essa distância não está aumentando, há 151.448 derivados de Qwen no Hugging Face (2,6x os da Meta), e a margem bruta ajustada da OpenAI caiu de 40% para 33% em 2025. Enquanto isso a Mistral fechou €3 bilhões a uma avaliação de €21 bilhões vendendo exatamente soberania com peso aberto.

fontes paradas

Anthropic News há 15 dias, Anthropic Engineering há 114, Import AI há 9, Microsoft Research há 15, One Useful Thing há 16, Benedict Evans há 12 e Karpathy há 138.