# flash custa metade do claude, e o data center promete se apagar

> o dia inteiro é custo: token a 0,75 dólar por milhão, 100 mw que se apagam na virgínia, ascend com 2 petaflops e um ledger brasileiro que cabe em 8 bytes.

- edição: sábado, 19 de setembro de 2026 (2026-09-19)
- caderno: dev e ia
- assuntos: llm · mercado · infra · brasil
- itens: 11 de 9 fontes
- original: https://tonho.wtf/diario/2026-09-19/
- autoria: escrito por pipeline de llm, revisado por antonio leandro (tonho.wtf)

---

Cinco itens de hoje dizem a mesma coisa em unidades diferentes. O Google cortou o preço do token, a Huawei promete flop barato em território sancionado, uma aliança de energia quer cortar o pico do watt, um commit do PyTorch quer cortar as passadas sobre o buffer de logits, e um post no TabNews quer cortar o registro do ledger para oito bytes. É o mesmo problema — quanto custa rodar isto — visto de cinco camadas da pilha, e nenhuma das cinco resolve a conta da outra.

O que interessa é onde a aritmética não fecha. O t3n registra a pegadinha do Flash: o preço por token ficou igual ao da versão anterior, mas o modelo novo aplica mais compute em tarefa complexa, então o preço do token não mexeu e o preço do trabalho pode ter subido. Na rede elétrica a distância é da mesma natureza, só que maior: a Emerald AI fala em liberar uma centena de gigawatts da malha americana existente, e o primeiro teste de verdade é um site de 100 MW na Virgínia. Três ordens de grandeza entre a promessa e o piloto. Não passou nenhum paper hoje, então não há seção de pesquisa.

## laboratórios

**[Gemini 3.8 Flash](https://t3n.de/news/google-gemini-3-8-flash-halb-so-teuer-claude-1761336/?utm_source=rss&utm_medium=newsFeed&utm_campaign=newsFeed)** — Terceiro release Flash em poucas semanas (o 3.7 saiu há três), e o preço não mudou em relação ao antecessor: US$ 0,75 por milhão de tokens de input e US$ 3,75 no output, contra US$ 5 e US$ 25 do Claude Opus 5 e US$ 4 e US$ 20 do GPT-5.6 Sol. O Google diz que é seu melhor modelo de reasoning e coding: lidera o HLE-Verified e fica logo atrás do Opus 5 no DeepSWE v1.1. A ressalva do t3n é a que importa para orçamento de agente: mais compute por tarefa difícil significa mais tokens consumidos, e o custo do job pode não seguir o custo da unidade.

**[Gemini 3.8 Flash Cyber](https://t3n.de/news/google-gemini-3-8-flash-halb-so-teuer-claude-1761336/?utm_source=rss&utm_medium=newsFeed&utm_campaign=newsFeed)** — Mesmo modelo base, treinado para achar e corrigir vulnerabilidade, com guardrails deliberadamente menos restritivos. Resolve 86,2% do Cybergym em uma tentativa (GPT-5.5-Cyber: 85,6%) e 47,2% no CWE-Bench, atrás do Fable 5. Não é público: sai só pelo Fairwind Program, para mais de 650 empresas parceiras, entre elas Crowdstrike e Snowflake. É o terceiro laboratório a reter uma capacidade específica atrás de uma lista de convidados.

**[linear_cross_entropy roteado no PyTorch](https://github.com/pytorch/pytorch/releases/tag/trunk%2F717d7a288d82e60e92d7936cf41aaf3ec4b23c2d)** — O commit instala o override `torch._native` para as duas versões chunked do loss e mais nada: a implementação ainda delega para o eager, e o texto diz explicitamente que nenhuma mudança de performance é esperada ou reivindicada. O motivo de existir está na descrição do alvo: `linear_cross_entropy` coloca atrás de um símbolo só um matmul (N, F) x (F, C), um softmax deslocado por linha, a redução e três matmuls de gradiente, e o loop eager percorre o buffer de logits (B, C) umas sete vezes por chunk antes de os gradientes o lerem de novo. Separar o roteamento do kernel é para que uma regressão futura seja atribuível a um ou a outro. Nota de rodapé que já virou rotina: o commit foi redigido pelo Claude Code e revisado e aprovado por pearu.

## brasil

**[JEC Enterprise 64-bit](https://www.tabnews.com.br/mlopes75/otimizando-sistemas-de-pagamento-de-alta-escala-com-bit-packing-conheca-o-jec-enterprise-64-bit)** — Resposta a um guia de sistema de pagamentos com pico de 25 mil transações/s e 500 GB/dia de ledger: empacotar timestamp em microssegundos mais 7 bits de user space (id do microsserviço ou região) numa palavra nativa de 64 bits, no lugar de UUID de 16 bytes com tabela de mapeamento. A parte que vale o post é o caso limite: Dart trata int de 64 bits como signed, EVM como unsigned, e no `BIGINT` do Postgres metade do espaço do header ordena invertido por causa do bit de sinal. A correção é máscara na cláusula de ordenação, `ORDER BY (jec_id & x'7FFFFFFFFFFFFFFF'::int8)`, que mantém a ordenação de graça.

**[Contrato de dado para mercado cripto](https://www.tabnews.com.br/musheghmanukyan/como-projetar-dados-de-mercado-cripto-que-continuam-confiaveis-quando-a-api-falha)** — O problema não é a API que cai, é a que responde 200 OK com preço velho, volume em outra moeda de cotação ou o último valor conhecido repetido sem avisar. A proposta é tratar frescor como campo, não como suposição: `observed_at` e `received_at` separados, estados explícitos (`fresh`, `delayed`, `stale`, `unavailable`), janela de `stale-if-error` limitada, proveniência que sobrevive à normalização e zero que nunca substitui ausência. Vale para qualquer integração com fonte externa, não só cripto. O autor do texto dirige a ARMCP.net, e isso está declarado no post.

**[Mulher paga conta da epidemia de bets](https://www.canalmeio.com.br/2026/09/19/mulher-paga-conta-da-epidemia-de-bets/)** — Chamada de Mariliz Pereira Jorge no Meio, com o texto atrás de assinatura: 42% das brasileiras já apostam e 67% dizem que as plataformas estão implodindo as famílias. O produto digital mais bem otimizado do país continua sendo medido por uma unidade que não aparece em nenhum outro item de hoje.

## mercado

**[Tin](https://planetscale.com/blog/introducing-tin)** — A PlanetScale lançou em GA uma extensão de full-text search para Postgres, com expressão booleana, frase, fuzzy, wildcard, regex, `COUNT(*)` e top-k por BM25 — a lista existe porque, segundo o post, nenhum dos três índices de texto que já existem para Postgres atende a tudo. Os números do benchmark são dela: corpus de 85 GB e 150 milhões de documentos do Stack Exchange, container de 8 vCPUs e 32 GB, índice de 50,7 GB construído em 8m10s, contra 19m20s do ParadeDB e 2h09m do GIN — e os outros três só terminaram a construção com 64 a 128 GB de RAM. Em consulta mista top-10 dá 25× o QPS do ParadeDB com p99 26× menor; com escrita concorrente de 1.000 UPDATEs/s, completa 270.279 updates em dez minutos contra 735 do pg_textsearch, que trava porque leitura contínua nunca solta o lock. Benchmark de fornecedor é benchmark de fornecedor, mas a decisão que ele ataca é concreta: não subir um Elasticsearch ao lado do banco.

**[Ascend 960](https://korben.info/huawei-avance-ses-puces-dia-ascend-960-pour-doubler-nvidia-en-chine.html?utm_source=rss&utm_medium=feed&utm_campaign=flux-complet)** — O 960DT chega no primeiro trimestre de 2027, nove meses antes do previsto, com 2 petaflops, 288 GB e 9,6 TB/s de banda — contra os cerca de 17 petaflops prometidos pelo Rubin da Nvidia no mesmo formato. A aposta não é chip contra chip: é o UnifiedBus e o SuperPoD Atlas 960, grappe de mais de 4.000 aceleradores em fibra óptica, embora a máquina de 15.000 chips falada no ano passado tenha encolhido. O chip chegou mais cedo e o cluster diminuiu. Para o outro fosso, a Huawei abriu o código do CANN, seu equivalente ao CUDA, já compatível com PyTorch. Ninguém sabe quem grava essas pastilhas sem a TSMC, e a própria empresa admite não produzir o suficiente para a demanda chinesa.

**[AI Energy Management Alliance](https://korben.info/data-centers-dia-google-et-nvidia-promettent-de-moduler-la-conso-pour-eviter-le-black-out.html?utm_source=rss&utm_medium=feed&utm_campaign=flux-complet)** — Google, Nvidia e Emerald AI juntaram uma vintena de atores, incluindo Anthropic, Constellation e National Grid, para padronizar data center flexível: pausar, desacelerar ou deslocar o compute menos urgente nas horas de tensão da rede. A moeda de troca é explícita — conexão mais rápida, já que nos EUA um data center novo pode esperar até dez anos para ser ligado. A Emerald AI vende o software que orquestra a flexibilidade e acabou de levantar US$ 150 milhões acima de US$ 1 bilhão de valuation, o que a tira do papel de árbitro. Primeiro teste até o fim do ano: cerca de 100 MW na Virgínia, com Nvidia, Emerald e Digital Realty.

## mundo

**[Trump anuncia uma "AI Force" e um czar de IA](https://www.bbc.co.uk/news/articles/cqlykr2vrv04o?at_medium=RSS&at_campaign=rss)** — O anúncio cai numa semana em que a pressão vinha de dentro da indústria: Dario Amodei pedindo desaceleração e monitoramento independente, com Sam Altman e Elon Musk dizendo concordar; Jack Clark falando à BBC que um kill switch verificável por terceiro pode precisar ser obrigatório; e Altman dizendo que Washington não consegue acompanhar o ritmo e que o mundo deveria confiar que as empresas farão o certo. No Reino Unido, o Joint Committee on Human Rights publicou relatório pedindo uma lei específica de IA. Opinião: o Fairwind do Google, no item de laboratórios, é exatamente o formato que sai desse impasse — a capacidade perigosa fica com 650 parceiros escolhidos pela empresa, e a fiscalização pública ganha uma força-tarefa e um czar.

## quem escreveu

**[What Zig felt like, coming from Rust](https://besok.github.io/posts/what-zig-felt-like-coming-from-rust/)** — Sete anos de Rust, e a reimplementação do jsonpath-rust como zig-jsonpath (RFC 9535) para comparar em terreno conhecido. O que mais surpreende no relato não é o desempenho: é o suporte de IDE quase inexistente, que empurrou o projeto para CLI e `build.zig`, e a estrutura achatada — cinco arquivos em Zig contra a árvore de quase vinte em Rust, porque o limiar para precisar de hierarquia se mostrou muito mais alto. A perda real é o paradigma funcional: onde Rust usa combinador e imutabilidade, Zig empurra para mutação in-place; sum type sobrevive, mas via `anytype` e duck typing. 172 pontos e 209 comentários no Hacker News, boa parte deles contraponto.

**[Disconcerting genre shift](https://seths.blog/2026/09/disconcerting-genre-shift/)** — Godin sobre perceber no minuto dez que o documentário era ficção, e como tudo depois soa errado até você trocar de modo. O argumento é que sinais de gênero — a recepção do hotel, os tropos da interação — parecem baixa utilidade e são caros de ignorar. É o item que não conversa com nenhum outro de hoje, e fica aqui por mérito próprio.

## fontes paradas

Anthropic Engineering em 118 dias sem publicar, Karpathy em 142, fasterthanli.me em 262. Do lado que ainda respira mas está devendo: Import AI em 13 dias, Sebastian Raschka em 11, Transformers releases em 10.
