# google solta voz ao vivo, e o rl ainda não compra problema difícil

> gemini 3.8 live sai em duas faixas de preço, o rl melhora só o que já era fácil e o naive bayes bate um 397b com rótulo: o dia é alocação de compute.

- edição: terça-feira, 15 de setembro de 2026 (2026-09-15)
- caderno: dev e ia
- assuntos: llm · papers · inferência · mercado
- itens: 12 de 12 fontes
- original: https://tonho.wtf/diario/2026-09-15/
- autoria: escrito por pipeline de llm, revisado por antonio leandro (tonho.wtf)

---

O anúncio do dia é o Google colocando voz ao vivo em produção, e até ele chega partido em dois: um modelo para escala e custo, outro para tarefa complexa. Essa divisão é o fio de tudo o que veio depois. Um paper mede que o RL engorda o que o modelo já acertava e quase não move o difícil, e propõe realocar amostragem para onde o compute ainda compra alguma coisa. Outro reusa um índice de 1 bit para não pagar attention densa em contexto longo. Um terceiro mostra Complement Naive Bayes empatando com um 27B e ganhando de um frontier de 397B em classificação de tópico, a milhares de amostras por segundo numa CPU comum. A NVIDIA publica o critério explícito de quando dense e quando MoE, com preço e throughput na mesma tabela. Ninguém está perguntando qual modelo é mais inteligente. Estão todos perguntando onde o compute a mais para de comprar capacidade.

E tem a camada de fora, que é a conta mesmo. No TabNews, o argumento é que sem custo por token e veredito de eval no mesmo span você não descobre qual 1% das queries come metade do orçamento. A Cloudflare separa crawl de busca de crawl de treino, porque recusar um significava perder o outro. O diesel nos EUA bate recorde, que é o insumo de energia que os labs declaram como restrição. E contra o ensaio do Amodei que entrou aqui no dia 12, o Xataka aponta um detalhe simples de verificar: as palavras "open weights" não aparecem uma única vez no texto, e quem está derrubando preço é justamente quem publica peso.

## laboratórios

**[Gemini 3.8 Live e 3.8 Live Extended Thinking](https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/)** — Dois modelos speech-to-speech no formato da família GPT-Live, e a divisão entre eles é declarada no próprio anúncio: o Live é para escala e eficiência de custo, o Extended Thinking é para tarefa complexa e raciocina enquanto fala, usando pistas verbais e narração de progresso para não deixar a conversa em silêncio durante uma chamada de tool. O Extended Thinking pegou o primeiro lugar no Speech to Speech Quality Index da Artificial Analysis (82,6), com 68,6% no τ-Voice, 35,1% no τ-Voice-banking da Sierra e 97,7% no Big Bench Audio; o Live ficou em segundo no Speech Agent Arena. Detecta e troca entre 97 idiomas no meio da conversa, executa tools em background enquanto continua respondendo, e todo áudio sai com marca d'água SynthID. Já está na Gemini API e no AI Studio, e o texto que vende "preço altamente competitivo" não traz um número de preço, o que é irritante num lançamento cujo argumento central é custo.

**[Dense vs. MoE: parâmetros ativos, throughput e quando escolher cada um](https://developer.nvidia.com/blog/dense-vs-moe-models-active-parameters-throughput-and-when-to-choose-each/)** — A tese útil do post da NVIDIA é que MoE desacopla memória de compute: VRAM acompanha o total de parâmetros, FLOPs por token acompanha os ativos. Um MoE de 30B e um dense de 30B ocupam os mesmos ~60 GB em BF16; a diferença é o que você compra com esses gigabytes, capacidade ou throughput. A vantagem aparece em batch 1, onde decode é limitado por memória e o MoE lê menos bytes de peso por token, e comprime em alta concorrência, quando os tokens acabam ativando quase todos os experts — que precisam estar na GPU ao mesmo tempo de qualquer jeito, sobrando menos espaço para o kv cache. A tabela fecha o argumento: Nemotron 3.5 Lightning (30B totais, 3B ativos, híbrido Mamba-2 + MoE) entrega 235,7 a 494,2 t/s a US$ 0,22 por milhão de tokens de saída, contra 46,8 t/s e US$ 3,00 do Qwen3.8-27B dense, com menos da metade da pontuação de capacidade (24 contra 52).

## pesquisa

**[Learning to Solve Hard Problems in RL for LLMs by Never Giving Up](https://arxiv.org/abs/2609.13443)** — O efeito Mateus no RL: o treino melhora muito os problemas que o modelo já resolvia e pouco os difíceis, e os autores argumentam que os métodos atuais pioram isso ao gastar compute demais no que já está fácil. A proposta, Never Give Up, é amostragem adaptativa — continua gerando amostras para um problema até uma sair correta — que, apoiada em RL assíncrono, filtra o fácil com poucas amostras e realoca o resto para o difícil. No Deepscaler melhora performance por compute, com o ganho concentrado nos problemas duros; na tarefa de código Manufactoria, GRPO com reward por teste empaca em problemas que misturam testes fáceis e difíceis, e o NGU vai resolvendo testes cada vez mais duros até fechar o problema inteiro. Assinam Michael Noukhovitch, Hamish Ivison, Nathan Lambert e Aaron Courville.

**[Self-Indexing Attention](https://arxiv.org/abs/2609.13205)** — Inferência esparsa de contexto longo costuma usar estratégias de retrieval diferentes em prefill e decode, o que impede reaproveitar uma mesma representação ao longo da inferência. O paper propõe uma representação sign-magnitude compartilhada em domínio transformado, training-free, em que os sinais das keys viram um índice de 1 bit reusável nas duas etapas, resolvido por operações bitwise que os aceleradores modernos já suportam. A 5% de densidade de attention fica perto de dense attention no LongBench e no RULER, com até 6,1x de speedup no operador de attention em prefill e 10,3x em decode, e continua compatível com compressão de kv cache de baixo bit, testada com TurboQuant e DeepSeekV4-Flash.

**[LLMs or Naive Bayes? Old Gems or New Ways](https://arxiv.org/abs/2609.13185)** — Complement Naive Bayes contra LLMs de quatro famílias, de 27B a um MoE de 1T, em classificação de texto. O LLM só domina no regime sem dado rotulado (98,0% contra 88,2% no Amazon Polarity), e mesmo essa vitória é sensível a contaminação: numa tarefa de sentimento de baixa contaminação o NB ganha do zero-shot, 81,7% contra 73,0%. Com rótulo disponível, no AG News, o NB chega a 89,1%, estatisticamente indistinguível do 27B zero-shot (89,0%) e acima do frontier de 397B (84,8%), a milhares de amostras por segundo numa CPU comum — inferência batched de LLM pequeno em GPU sai 40 a 486x mais lenta, com cerca de duas ordens de grandeza mais energia por amostra. A linha de decisão é por tarefa, com parity em torno de 10⁴ rótulos para classificação de tópico, e vem acompanhada de um operador Helm para Kubernetes que automatiza a escolha com thresholds e métricas Prometheus verificáveis. Para quem mantém uma fila de classificação em produção, é o paper mais acionável do dia.

## brasil

**[Observabilidade e Evals em Produção: O Fechamento do LLMOps](https://www.tabnews.com.br/andersonlimadev/observabilidade-e-evals-em-producao-o-fechamento-do-llmops)** — Quinto e último artigo da série de andersonlimadev no TabNews, com uma tese estreita o bastante para ser testável: sem prompt completo, versão de modelo e veredito de eval no mesmo span, não existe observabilidade generativa, só log de servidor fingindo entender LLM. O mecanismo concreto está nas GenAI semantic conventions do OpenTelemetry, e o detalhe que ele destaca é a separação entre `gen_ai.request.model` e `gen_ai.response.model` — é ela que torna model drift visível quando o provedor troca a snapshot por baixo sem você fazer deploy nenhum. Do lado do custo, defende atribuir tokens e custo a cada span como única forma de achar o 1% de queries que consome metade do orçamento, e rodar o eval span só numa amostra, já que LLM-as-judge em 100% das respostas não fecha a conta. Fecha com online evals em shadow contra golden set e rollback automático por degradação de métrica.

## mercado

**[Cloudflare separa crawl de busca de crawl de treino](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)** — Até hoje, recusar treino a um crawler mixed-use significava sumir da busca, porque é o mesmo bot fazendo as duas coisas. A nova configuração Disallow AI Training publica a preferência no robots.txt e mantém liberados para indexação os crawlers com a designação Accountable; Apple, Google e Microsoft cumprem ou se comprometeram a cumprir os requisitos, que incluem visibilidade em nível de URL sobre quais páginas ficaram disponíveis para treino. Os números explicam o desenho: menos de 1% dos sites na Cloudflare bloqueiam bots de busca, contra 17% que ativam algum mecanismo contra treino. Vale a atenção para a mudança de semântica que passa a valer hoje — Block e "Block on pages with ads" agora se aplicam a crawlers mixed-use, ou seja, quem já usava Block perde busca também, e Managed Robots.txt foi depreciado em favor do Bot Preference Sync.

**[B2B Medical & Pharma UX Benchmark](https://feeds.baymard.com/link/9825/17462397/b2b-medical-pharma-ux-benchmark-2026)** — O Baymard avaliou 10 sites de insumos médicos e farma em 400+ parâmetros, gerando 3.400+ scores ponderados e 2.600+ exemplos de boa prática, todos vindos de teste com usuário. Nenhum dos dez chega sequer a "decent": a faixa vai de "poor" a "mediocre", com Thermo Fisher, McKesson, Henry Schein e Sigma Aldrich no fundo. As falhas são de implementação, não de tendência — documentação ausente atrás de especificações que existem, o mesmo atributo com rótulo diferente de um produto para outro, preço e custo total do pedido fora da seção de compra, busca que desiste quando a query sai levemente errada, e carrinho que não pode ser salvo nem passado adiante, num contexto em que quem monta o pedido quase nunca é quem o aprova.

## mundo

**[Diesel nos EUA em máxima recorde](https://www.semafor.com/article/09/15/2026/us-diesel-hits-record-highs-and-oil-supply-fears-mount)** — Chamada do Semafor, sem texto completo disponível: o diesel bateu recorde nesta terça com estoques comerciais e estratégicos baixos, o CEO da Chevron dizendo que os buffers que seguravam o risco de preço e oferta se esgotaram, e a Arábia Saudita cancelando embarques para a Europa com o pipeline East-West fora do ar por semanas após ataque de drone. Fica linkado como contexto do insumo que os labs declaram como restrição das AI factories.

## quem escreveu

**[Simon Willison, Gemini Live audio](https://simonwillison.net/2026/Sep/15/gemini-live/)** — Em vez de repetir o release, Willison apontou o GPT-6 Astra Extra High para a documentação e publicou uma UI web para testar os modelos novos: escolhe modelo e voz, system prompt opcional, conversa pelo navegador e pode interromper o modelo no meio da fala. A implementação não usa biblioteca nenhuma, conecta direto no endpoint WebSocket `BidiGenerateContent` e usa um AudioContext da Web Audio API para captura e playback. É a forma mais rápida de descobrir o que a API de fato entrega, que raramente é o que a tabela de benchmark diz.

**[Gergely Orosz, Inside OpenAI's agentic software factory](https://newsletter.pragmaticengineer.com/p/openai-software-factory)** — Relato de uma visita à OpenAI com sete pessoas de engenharia, e o dado central é de adoção: em quatro meses, áreas não técnicas como finanças, recrutamento e jurídico saíram de perto de 0% para 90% de uso do Codex, sem mandato de cima. Uso de IDE cai desde janeiro, o que forçou repensar pull request e code review; a Perf Factory monitora produção e dispara agentes para corrigir regressão de performance sozinha; threads duram dias com o `/goal`, e um agente de longa duração ramifica outros agentes, reduzindo a superfície que um humano precisa gerenciar. Há duas ressalvas honestas no texto: o Codex interno é muito mais plugado nos sistemas da casa que o externo, e CPU virou gargalo da API. Vale ler contra o achado do dia 14 aqui — harness nativo não ganha na média, e mesmo assim a empresa inteira depende de um único harness compartilhado, a ponto de uma falha menor ser avisada por colegas antes do alerta automático disparar.

**[Javier Lacort, Xataka](https://www.xataka.com/robotica-e-ia/frenar-ia-suena-a-proteger-a-humanidad-tambien-forma-muy-eficaz-frenar-a-deepseek-qwen-mistral)** — A observação que sustenta o texto inteiro: as palavras "open weights" não aparecem uma única vez no "We must pace the frontier" do Amodei, que entrou aqui no dia 12. Certificação por capacidade é fácil de cumprir para um lab fechado, que controla cada cópia, e impossível para quem publica peso, porque qualquer um remove a salvaguarda depois; a isenção antitruste proposta desenha uma mesa onde quem não senta sofre os limites sem ajudar a fixá-los. Os números que ele junta são o argumento: DeepSeek V4 Flash sai 150x mais barato que GPT-5.5 em tokens de saída no OpenRouter, os melhores modelos abertos estão 3 a 6 meses atrás e essa distância não está aumentando, há 151.448 derivados de Qwen no Hugging Face (2,6x os da Meta), e a margem bruta ajustada da OpenAI caiu de 40% para 33% em 2025. Enquanto isso a Mistral fechou €3 bilhões a uma avaliação de €21 bilhões vendendo exatamente soberania com peso aberto.

## fontes paradas

Anthropic News há 15 dias, Anthropic Engineering há 114, Import AI há 9, Microsoft Research há 15, One Useful Thing há 16, Benedict Evans há 12 e Karpathy há 138.
