antonio leandro

enciclopédia

o caminho mínimo

os 81 verbetes marcados como núcleo, de 221: se só puder ler alguns, são estes. cada estante na ordem que ela promete, e a estante inteira está a um clique no título.

ia generativa19 de 61

  1. 2013Efficient Estimation of Word Representations in Vector Spaceo gargalo era a camada escondida: sem ela o modelo prevê pior e treina em bilhões de palavras — e o espaço que sobra é linear o bastante para rei − homem + mulher cair em rainha · núcleo
  2. 2017Attention Is All You Needtirar a recorrência inteira do modelo não piora a tradução: com atenção pura o caminho entre duas posições vira constante, o treino paraleliza, e 12 horas em 8 gpus batem o estado da arte anterior. · núcleo
  3. 2017Deep Reinforcement Learning from Human Preferencesdá para treinar um agente sem nenhuma função de recompensa: basta um humano apontar qual de dois clipes de dois segundos é melhor, em menos de 1% das interações do agente com o ambiente · núcleo
  4. 2018Improving Language Understanding by Generative Pre-Trainingtreinar um transformer decoder para prever a próxima palavra em livros e depois ajustar por três épocas bate arquiteturas desenhadas à mão para cada tarefa — e o que muda por tarefa é o formato do input, não o modelo · núcleo
  5. 2019Language Models are Unsupervised Multitask Learnersum modelo treinado só para prever o próximo token em texto variado da web já executa tradução, resumo e leitura sem um único exemplo rotulado — a tarefa vira só mais um trecho do prompt · núcleo
  6. 2020Language Models are Few-Shot LearnersEscalar um modelo autoregressivo até 175 bilhões de parâmetros move a especificação da tarefa do gradiente para o prompt: exemplos no contexto substituem fine-tuning em boa parte dos benchmarks, sem atualizar um peso. · núcleo
  7. 2020Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksColar documento recuperado no contexto não é gambiarra: tratando o documento como variável latente e marginalizando sobre o top-k, dá para treinar retriever e gerador juntos — e 626M de parâmetros batem o T5 de 11B. · núcleo
  8. 2020Scaling Laws for Neural Language Modelsa loss de um modelo de linguagem é previsível: cai como lei de potência em parâmetros, dados e compute, a arquitetura quase não importa, e com orçamento fixo o certo é treinar um modelo grande e parar cedo. · núcleo
  9. 2022Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsOito exemplos escritos à mão com o raciocínio explícito, e nada mais: o PaLM 540B pula de 17,9% para 56,9% no GSM8K sem que um único peso seja tocado. · núcleo
  10. 2022Constitutional AI: Harmlessness from AI Feedbackdá para tirar o humano do rótulo de nocividade: 16 princípios em texto, mais o modelo criticando e revisando a si mesmo, treinam um assistente menos nocivo que o de feedback humano — e que não foge da pergunta. · núcleo
  11. 2022ReAct: Synergizing Reasoning and Acting in Language Modelspensamento é uma ação que não toca o ambiente: intercalar raciocínio e chamada de ferramenta no mesmo prompt ancora o modelo em fato externo e mata a alucinação — mas troca esse erro por outro · núcleo
  12. 2022Training Compute-Optimal Large Language Modelsnum orçamento fixo de compute, parâmetros e tokens têm que crescer na mesma proporção — os grandes modelos de 2022 estavam quatro vezes grandes demais e treinados com dados de menos · núcleo
  13. 2022Training language models to follow instructions with human feedbackpreferência humana rende mais que parâmetro: com demonstrações e rankings de labelers, um modelo de 1,3 bilhão de parâmetros passa a ser preferido ao gpt-3 de 175 bilhões — mesma arquitetura, só o ajuste muda. · núcleo
  14. 2023Direct Preference Optimization: Your Language Model is Secretly a Reward Modela política já é o reward model: dá para resolver o mesmo objetivo do rlhf com uma perda de classificação binária, sem treinar recompensa separada, sem amostrar do modelo e sem rl · núcleo
  15. 2023Efficient Memory Management for Large Language Model Serving with PagedAttentiono gargalo de servir llm não é flop, é fragmentação de memória: paginar o kv cache como um sistema operacional pagina ram rende 2 a 4 vezes mais throughput sem encostar no modelo · núcleo
  16. 2023Lost in the Middle: How Language Models Use Long Contextsmodelos de contexto longo não leem o contexto inteiro: mova a informação relevante para o meio da entrada e a acurácia despenca — às vezes para baixo do que o modelo acerta sem receber documento nenhum. · núcleo
  17. 2023SWE-bench: Can Language Models Resolve Real-World GitHub Issues?medir modelo em issue real de github derruba o placar: sobre 2.294 tarefas com teste de verdade, o melhor sistema avaliado resolve 1,96% — e o gargalo é achar o que editar, não escrever o código · núcleo
  18. 2024The Llama 3 Herd of Modelsescala e dados fazem o trabalho; a arquitetura pode ser chata de propósito — transformer denso, dpo no lugar de ppo — porque a 16 mil gpus o que mata um treino é instabilidade, não falta de ideia · núcleo
  19. 2025DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learningraciocínio não precisa ser ensinado com exemplos: pagando só pelo acerto verificável por regra, o modelo aprende sozinho a pensar mais tempo e a voltar atrás — e isso cabe num 7B via destilação. · núcleo

claude, na prática15 de 41

  1. Prompt engineering overviewprompt engineering é passo de otimização, não ponto de partida: sem critério de sucesso e sem eval, reescrever prompt é trocar uma opinião por outratutorial · núcleo
  2. Define your success criteriacritério vago é o que faz prompt engineering virar chute: antes de mexer no prompt, escreva a métrica, o número e o método de nota — inclusive para "segurança", que também cabe numa porcentagemtutorial · núcleo
  3. Tool use with Claudea pergunta útil sobre uma ferramenta não é o que ela faz, é onde o código roda: client tool devolve um bloco tool_use e para o turno esperando você; server tool volta com o resultado pronto na mesma respostatutorial · núcleo
  4. Writing effective tools for AI agentsferramenta para agente não é api com outro nome: o gargalo é o contexto do modelo, então poucas ferramentas grossas, resposta enxuta e descrição bem escrita rendem mais que cobertura de endpoint.post · · núcleo
  5. Advanced tool useo gargalo de um agente com muitas ferramentas não é o modelo: é definição e resultado intermediário ocupando contexto. a anthropic adia as definições, manda os resultados para um script e ensina o uso por exemplopost · · núcleo
  6. Prompt cachingO cache não procura conteúdo estável no seu prompt: ele só acha entradas que requisições anteriores escreveram no breakpoint. Errar a posição do cache_control custa uma escrita por requisição e leitura nenhuma.tutorial · núcleo
  7. Introducing Contextual Retrievalo chunk perde o referente quando você o corta do documento; colar de volta 50 a 100 tokens de contexto gerados por um llm antes de indexar derruba a taxa de falha de recuperação pela metadepost · · núcleo
  8. Effective context engineering for AI agentso gargalo saiu do prompt e foi para o orçamento de atenção: o trabalho do engenheiro agora é achar o menor conjunto de tokens de alto sinal por turno, não escrever a frase perfeita.post · · núcleo
  9. Building effective agentsquase todo "agente" devia ser um workflow: llm dentro de um caminho que você escreveu em código. agente de verdade — o llm escolhendo os próprios passos num loop — só quando é impossível prever quantos passos são.post · · núcleo
  10. Model Context Protocolo gargalo de um agente não é o modelo, é a integração: padronizar o encaixe entre aplicação de ia e sistema externo troca n×m conectores artesanais por n+m implementações reaproveitáveistutorial · núcleo
  11. How we built our multi-agent research systemsistema multi-agente de pesquisa funciona porque gasta token: no browsecomp, o volume de tokens sozinho explica 80% da variância de desempenho — e a conta sai 15× a de um chatpost · · núcleo
  12. Effective harnesses for long-running agentscompactação não sustenta agente que trabalha por dias: o que atravessa a troca de janela de contexto é estado escrito em disco — lista de features em json, arquivo de progresso e histórico do gitpost · · núcleo
  13. Claude Code overviewum assistente de código deixa de ser autocomplete quando ganha shell, git e sistema de arquivos: a unidade de trabalho vira a tarefa inteira, e o editor vira só uma das superfícies em que ela acontecetutorial · núcleo
  14. Claude Code: Best practices for agentic codingquase toda prática de agente sai de duas restrições: o contexto enche e degrada o desempenho, e o agente para quando o trabalho parece pronto — o resto é engenharia para gastar menos contexto e fechar o loop de verificaçãopost · · núcleo
  15. Demystifying evals for AI agentsavaliar agente é medir o estado do ambiente no fim, não o texto que ele produziu — e nenhum score vale nada antes de alguém ler as transcrições e confirmar que a tarefa não estava quebradapost · · núcleo

dados e armazenamento10 de 32

  1. A Relational Model of Data for Large Shared Data Banksprograma nenhum deveria saber como o dado está guardado: se o usuário só enxerga relações com colunas nomeadas, trocar ordenação, índice ou caminho de acesso deixa de quebrar a aplicação · núcleo
  2. The Log-Structured Merge-Tree (LSM-Tree)o índice fica dez vezes mais barato se você parar de colocar cada entrada nova no lugar definitivo na hora: uma fila em memória desce para o disco por merges sequenciais em blocos grandes · núcleo
  3. Dynamo: Amazon's Highly Available Key-value Storerecusar uma escrita é pior que guardar duas versões conflitantes: o dynamo fica sempre gravável e empurra a reconciliação para a leitura e para a aplicação, que é quem sabe fundir dois carrinhos · núcleo
  4. Dremel: Interactive Analysis of Web-Scale Datasetsconsulta interativa sobre petabytes não precisa virar job em lote: árvore de execução em vários níveis mais layout colunar para registros aninhados responde agregação em trilhão de linhas em segundos · núcleo · pelo resumo
  5. Gorilla: A Fast, Scalable, In-Memory Time Series Databasemonitoramento não precisa de acid nem de histórico: guardar só as últimas 26 horas em memória, comprimidas de 16 para 1,37 bytes por ponto, vale mais que garantir que nenhum ponto se perca · núcleo
  6. Amazon Aurora: Design Considerations for High Throughput Cloud-Native Relational Databasesnum banco em nuvem o recurso escasso deixou de ser cpu e disco e virou rede — a saída da aurora foi mandar só o redo log para a camada de storage e deixar ela materializar as páginas · núcleo
  7. Amazon DynamoDB: A Scalable, Predictably Performant, and Fully Managed NoSQL Database Serviceprevisibilidade vale mais que eficiência: o dynamodb desacopla o controle de admissão da partição, corta cada otimização que esconde trabalho e aceita gastar mais no caso normal para nunca ter um caso ruim · núcleo
  8. What Goes Around Comes Around... And Around...vinte anos depois, o placar é o mesmo: nenhum modelo de dados derrubou o relacional — o sql absorveu json, array e grafo, e quem começou gritando "nosql" terminou vendendo um dialeto de sql · núcleo
  9. C-Store: A Column-oriented DBMSnum mundo read-mostly vale gastar cpu para poupar disco: guardar coluna a coluna, comprimida, em várias ordens de ordenação — e jogar fora a tabela, ficando só com as projeções · núcleo
  10. The Snowflake Elastic Data Warehouseseparar storage de compute não é economia de infra: é o que deixa cache ficar frio de propósito, upgrade rodar lado a lado e o usuário desligar todo o cluster sem mover um byte de dado · núcleo

sistemas distribuídos17 de 33

  1. Time, Clocks, and the Ordering of Events in a Distributed Systemnum sistema distribuído não existe "a" ordem dos eventos: existe a ordem parcial do que pôde causar o quê, e um contador por processo mais um timestamp na mensagem bastam para estendê-la a uma ordem total qualquer · núcleo
  2. Paxos Made Simpleconsenso cabe em duas rodadas de mensagem: maiorias sempre se cruzam, então basta cada proposta nova prometer carregar o valor da proposta mais alta já aceita, e o resto é eleger um líder para não travar · núcleo
  3. The Google File Systemfalha de hardware é o regime normal, não o acidente: se o sistema assume isso e a aplicação aceita um append "pelo menos uma vez" no lugar de consistência forte, um master único e discos baratos aguentam centenas de terabytes. · núcleo
  4. MapReduce: Simplified Data Processing on Large Clustersrestringir o programador a duas funções, map e reduce, é o que paga a conta: se a computação é determinística sobre a entrada, re-executar a tarefa vira toda a tolerância a falha que o cluster precisa. · núcleo
  5. Bigtable: A Distributed Storage System for Structured Dataum mapa ordenado, esparso e versionado, com atomicidade só dentro da linha, sustenta sessenta produtos: o que o cliente ganha não é schema relacional, é controle sobre o layout físico dos dados · núcleo
  6. The Chubby lock service for loosely-coupled distributed systemsum serviço central de locks grosseiros resolve eleição de líder melhor que uma biblioteca de paxos — não por ser mais correto, mas porque cabe em duas linhas de código num sistema que já existe · núcleo
  7. Spanner: Google's Globally-Distributed Databaseexpor a incerteza do relógio em vez de escondê-la: se o banco sabe quanto pode estar errado sobre a hora, ele espera essa janela passar e entrega transação linearizável em escala planetária · núcleo
  8. Resilient Distributed Datasets: A Fault-Tolerant Abstraction for In-Memory Cluster Computingdá para ter memória distribuída tolerante a falha sem replicar nada: se a escrita só acontece em bloco, o sistema pode guardar a receita da computação e recomputar só a partição que caiu · núcleo
  9. The Tail at Scalea cauda da latência é problema de confiabilidade, não de otimização: quando uma requisição consulta milhares de servidores, o lento eventual vira o comportamento normal — e dá para tolerá-lo como se tolera falha · núcleo · pelo resumo
  10. In Search of an Understandable Consensus Algorithmcompreensibilidade dá para tratar como requisito de projeto: com líder forte e menos estado não-determinístico, raft entrega o mesmo que o multi-paxos usando só quatro tipos de mensagem · núcleo
  11. Large-scale cluster management at Google with Borgutilização alta num datacenter não vem do escalonador esperto: vem de admitir menos, empacotar melhor, prometer mais recurso do que existe e botar serviço e batch na mesma máquina · núcleo · pelo resumo
  12. Zanzibar: Google's Consistent, Global Authorization Systempermissão vira uma tupla só — objeto#relação@usuário, em que o usuário pode ser outra tupla — e todo o resto é regra de reescrita; o que segura a coisa é o timestamp que o cliente guarda junto com o conteúdo · núcleo
  13. Millions of Tiny Databasesconsistência forte e disponibilidade sob partição só brigam se você exigir disponibilidade para todos os clientes; cada chave precisa viver em três pontos da rede, então não construa um banco — construa milhões · núcleo
  14. Firecracker: Lightweight Virtualization for Serverless Applicationsdá para ter isolamento de vm com overhead de container: trocar o qemu por 50 mil linhas de rust rende cerca de 3mb de overhead por microvm e boot na casa de 125ms — é isso que roda o lambda · núcleo
  15. Brewer's Conjecture and the Feasibility of Consistent, Available, Partition-Tolerant Web Servicesquando a rede pode perder mensagem, nenhum algoritmo entrega consistência atômica e disponibilidade ao mesmo tempo — e no modelo assíncrono ele falha até nas execuções em que nada se perde · núcleo
  16. Dapper, a Large-Scale Distributed Systems Tracing Infrastructurerastrear um sistema distribuído inteiro sai barato se você desistir de rastrear tudo: uma amostra de 1 em 1.024 requisições, colhida dentro das bibliotecas de RPC e threading, basta — e o autor da aplicação nem fica sabendo · núcleo
  17. Kafka: a Distributed Messaging System for Log Processinglog é a abstração certa para dado de evento: com o broker sem estado de entrega e o offset guardado no consumidor, a vazão para de depender de quanto dado já está acumulado no disco · núcleo

estruturas e algoritmos6 de 17

  1. Probabilistic Counting Algorithms for Data Base Applicationsdá para contar quantos elementos distintos há num arquivo gigante sem guardar nenhum deles: os zeros à direita dos hashes já dizem a cardinalidade, com 64 palavras de memória e uma passada · núcleo
  2. Consistent Hashing and Random Trees: Distributed Caching Protocols for Relieving Hot Spots on the World Wide Webhash clássico remapeia quase tudo quando o número de buckets muda: dê a cada bucket pontos num círculo e mande o item ao mais próximo — entrar ou sair um bucket mexe só na fatia dele, e visões diferentes convergem sem conversa · núcleo
  3. HyperLogLog: the analysis of a near-optimal cardinality estimation algorithmtrocar a média geométrica pela harmônica no mesmo observável do loglog derruba o erro padrão para 1,04/√m: 1,5 kB de registradores estimam mais de 10⁹ elementos distintos com 2% de erro, numa passada só · núcleo
  4. Designing Access Methods: The RUM Conjecturetodo método de acesso paga em três moedas — leitura, escrita e espaço — e fixar um teto em duas delas cria um piso na terceira: não existe estrutura universalmente ótima, só escolha de dívida · núcleo
  5. SIEVE is Simpler than LRU: an Efficient Turn-Key Eviction Algorithm for Web Cacheso objeto que sobrevive à eviction não precisa voltar para a cabeça da fila: deixá-lo onde está transforma o clock numa peneira que despeja o objeto novo e impopular primeiro — e o hit vira a escrita de um bit, sem lock · núcleo
  6. Skip Lists: A Probabilistic Alternative to Balanced Treesdá para trocar rotação por sorteio: se cada nó decide no dado quantos ponteiros de atalho carrega, a busca continua logarítmica e a inserção deixa de ser um algoritmo — vira um splice de ponteiros · núcleo

busca e recuperação5 de 22

redes ponto a ponto4 de 6

trilha do julgamento1 de 1

marca, marketing e mídia4 de 8