antonio leandro

enciclopédia

ia generativa

as raízes em 2014 e o caminho de 2017 ao agora: do transformer aos agentes, na ordem em que aconteceu.

61 verbetes, 19 no caminho mínimo · na ordem em que aconteceu

  1. 2013Efficient Estimation of Word Representations in Vector Spaceo gargalo era a camada escondida: sem ela o modelo prevê pior e treina em bilhões de palavras — e o espaço que sobra é linear o bastante para rei − homem + mulher cair em rainha · núcleo
  2. 2014Neural Machine Translation by Jointly Learning to Align and Translateo gargalo do encoder–decoder não era a rede, era o vetor de tamanho fixo: deixe o decoder montar um contexto próprio a cada palavra gerada e a tradução para de degradar em frases longas
  3. 2014Sequence to Sequence Learning with Neural Networksdá para traduzir sem pipeline: um lstm comprime a frase inteira num vetor de tamanho fixo e outro a reescreve na língua de destino — e inverter as palavras da origem rende quase 5 pontos de bleu de graça
  4. 2015Neural Machine Translation of Rare Words with Subword Unitsvocabulário fixo não é teto: quebrando a palavra rara em subword units aprendidas por um algoritmo de compressão de 1994, a rede traduz e inventa palavra que nunca viu, e o dicionário de back-off some
  5. 2017Attention Is All You Needtirar a recorrência inteira do modelo não piora a tradução: com atenção pura o caminho entre duas posições vira constante, o treino paraleliza, e 12 horas em 8 gpus batem o estado da arte anterior. · núcleo
  6. 2017Deep Reinforcement Learning from Human Preferencesdá para treinar um agente sem nenhuma função de recompensa: basta um humano apontar qual de dois clipes de dois segundos é melhor, em menos de 1% das interações do agente com o ambiente · núcleo
  7. 2017Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layerdá para multiplicar a capacidade de um modelo por mil sem multiplicar o custo: um gate treinável escolhe uns poucos especialistas por posição do texto e simplesmente não calcula os outros milhares
  8. 2018BERT: Pre-training of Deep Bidirectional Transformers for Language Understandingnão é preciso escolher um lado: mascarar 15% do texto e prever o que sumiu treina um transformer bidirecional em todas as camadas, e daí uma única camada de saída basta para onze tarefas
  9. 2018Improving Language Understanding by Generative Pre-Trainingtreinar um transformer decoder para prever a próxima palavra em livros e depois ajustar por três épocas bate arquiteturas desenhadas à mão para cada tarefa — e o que muda por tarefa é o formato do input, não o modelo · núcleo
  10. 2019Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformero ganho de um método novo de pré-treino quase nunca vem do método: quando você fixa formato, dados e escala e mexe num botão de cada vez, a maioria das escolhas de objetivo e arquitetura empata
  11. 2019Language Models are Unsupervised Multitask Learnersum modelo treinado só para prever o próximo token em texto variado da web já executa tradução, resumo e leitura sem um único exemplo rotulado — a tarefa vira só mais um trecho do prompt · núcleo
  12. 2020An Image is Worth 16x16 Words: Transformers for Image Recognition at Scalecortar a imagem em quadrados de 16x16 e tratar cada um como palavra basta: com dados suficientes, o transformer padrão aprende sozinho o que a convolução tinha embutido no código
  13. 2020Denoising Diffusion Probabilistic Modelsprever o ruído, e não a imagem, é o que faz difusão funcionar: com essa parametrização e uma perda de mínimos quadrados sem pesos, o modelo bate os gan da época em fid no cifar10
  14. 2020Language Models are Few-Shot LearnersEscalar um modelo autoregressivo até 175 bilhões de parâmetros move a especificação da tarefa do gradiente para o prompt: exemplos no contexto substituem fine-tuning em boa parte dos benchmarks, sem atualizar um peso. · núcleo
  15. 2020Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksColar documento recuperado no contexto não é gambiarra: tratando o documento como variável latente e marginalizando sobre o top-k, dá para treinar retriever e gerador juntos — e 626M de parâmetros batem o T5 de 11B. · núcleo
  16. 2020Scaling Laws for Neural Language Modelsa loss de um modelo de linguagem é previsível: cai como lei de potência em parâmetros, dados e compute, a arquitetura quase não importa, e com orçamento fixo o certo é treinar um modelo grande e parar cedo. · núcleo
  17. 2021Evaluating Large Language Models Trained on Codemedir código por teste unitário em vez de semelhança com a referência muda o placar: o codex-12b resolve 28,8% dos problemas na primeira tentativa e 70,2% quando pode tentar cem vezes
  18. 2021Finetuned Language Models Are Zero-Shot Learnersfinetunar um modelo grande em dezenas de tarefas escritas como instrução ensina ele a obedecer instruções de tarefas que nunca viu — e isso só funciona acima de mais ou menos 100 bilhões de parâmetros
  19. 2021High-Resolution Image Synthesis with Latent Diffusion Modelsdifusão em pixel gasta a maior parte do orçamento modelando detalhe que ninguém vê: comprima a imagem uma vez com um autoencoder, rode a difusão no latente, e o custo cai sem que a qualidade caia junto
  20. 2021Learning Transferable Visual Models From Natural Language Supervisionprever qual legenda combina com qual imagem, num batch grande, dá um classificador que troca de tarefa por prompt e iguala o resnet-50 no imagenet sem ter visto nenhuma das 1,28 milhão de imagens dele
  21. 2021LoRA: Low-Rank Adaptation of Large Language Modelso update do fine-tuning cabe num rank ridículo: duas matrizes finas ao lado do peso congelado igualam o ajuste completo, e como o produto delas soma no peso original, a inferência não paga nada por isso
  22. 2021RoFormer: Enhanced Transformer with Rotary Position Embeddingposição não precisa ser somada ao embedding: gire query e key por um ângulo proporcional ao índice do token e o produto interno passa a depender só da distância entre eles
  23. 2021Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsityrotear cada token para um único expert basta: dá para multiplicar os parâmetros sem mexer nos flops por token, desde que capacidade, precisão e inicialização virem problemas de engenharia
  24. 2022Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsOito exemplos escritos à mão com o raciocínio explícito, e nada mais: o PaLM 540B pula de 17,9% para 56,9% no GSM8K sem que um único peso seja tocado. · núcleo
  25. 2022Constitutional AI: Harmlessness from AI Feedbackdá para tirar o humano do rótulo de nocividade: 16 princípios em texto, mais o modelo criticando e revisando a si mesmo, treinam um assistente menos nocivo que o de feedback humano — e que não foge da pergunta. · núcleo
  26. 2022Emergent Abilities of Large Language Modelsalgumas habilidades não aparecem aos poucos: ficam no nível do acaso por várias ordens de grandeza de escala e então saltam — e nenhuma curva dos modelos menores diz onde fica o salto
  27. 2022Fast Inference from Transformers via Speculative Decodingdá para produzir vários tokens por passada do modelo grande sem mexer uma vírgula na distribuição de saída: um modelo pequeno chuta, o grande confere todos os chutes em paralelo e uma regra de aceitação preserva a matemática
  28. 2022FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awarenesso gargalo da attention não é conta, é tráfego entre a hbm e a sram da gpu: fazendo mais flops e nunca materializando a matriz n×n, o resultado sai idêntico e o treino fica várias vezes mais rápido
  29. 2022PaLM: Scaling Language Modeling with Pathwaysescala densa não tinha saturado em 2022: 540 bilhões de parâmetros mais chain-of-thought no prompt bateram o estado da arte finetunado em raciocínio, sem verificador, sem arquitetura de tarefa
  30. 2022ReAct: Synergizing Reasoning and Acting in Language Modelspensamento é uma ação que não toca o ambiente: intercalar raciocínio e chamada de ferramenta no mesmo prompt ancora o modelo em fato externo e mata a alucinação — mas troca esse erro por outro · núcleo
  31. 2022Self-Consistency Improves Chain of Thought Reasoning in Language Modelsamostrar quarenta cadeias de raciocínio e ficar com a resposta que mais se repete bate decodificar uma cadeia só: +17,9 pontos no gsm8k, sem treinar, sem anotar, sem verificador
  32. 2022Self-Instruct: Aligning Language Models with Self-Generated Instructionsdá para fabricar o dado de instruction tuning com o próprio modelo cru: 175 tarefas escritas à mão viram 52 mil, e o gpt-3 ajustado nelas encosta no instructgpt sem nenhum anotador contratado
  33. 2022Training Compute-Optimal Large Language Modelsnum orçamento fixo de compute, parâmetros e tokens têm que crescer na mesma proporção — os grandes modelos de 2022 estavam quatro vezes grandes demais e treinados com dados de menos · núcleo
  34. 2022Training language models to follow instructions with human feedbackpreferência humana rende mais que parâmetro: com demonstrações e rankings de labelers, um modelo de 1,3 bilhão de parâmetros passa a ser preferido ao gpt-3 de 175 bilhões — mesma arquitetura, só o ajuste muda. · núcleo
  35. 2023Are Emergent Abilities of Large Language Models a Mirage?a emergência súbita de habilidades em llms é artefato da régua: troque acurácia exata por token edit distance, ou multiple choice grade por brier score, e a mesma saída do modelo volta a escalar suave
  36. 2023Direct Preference Optimization: Your Language Model is Secretly a Reward Modela política já é o reward model: dá para resolver o mesmo objetivo do rlhf com uma perda de classificação binária, sem treinar recompensa separada, sem amostrar do modelo e sem rl · núcleo
  37. 2023Efficient Memory Management for Large Language Model Serving with PagedAttentiono gargalo de servir llm não é flop, é fragmentação de memória: paginar o kv cache como um sistema operacional pagina ram rende 2 a 4 vezes mais throughput sem encostar no modelo · núcleo
  38. 2023Efficient Streaming Language Models with Attention Sinksos primeiros tokens de uma sequência viram ralo de atenção: o softmax precisa somar um e o modelo despeja o excedente ali — jogue esses quatro fora do cache e ele colapsa; mantenha-os e ele gera 4 milhões de tokens
  39. 2023GPT-4 Technical Reporto entregável técnico do gpt-4 não é o modelo, é a previsão: a openai acertou a loss final a partir de runs com 10.000 vezes menos compute — e, em troca, não contou nada sobre arquitetura, dados ou tamanho
  40. 2023GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpointsum número intermediário de heads de key e value entrega a velocidade do multi-query com quase a qualidade do multi-head — e dá para converter um checkpoint pronto usando 5% do compute do pré-treino
  41. 2023Llama 2: Open Foundation and Fine-Tuned Chat Modelso que separava modelo aberto de produto fechado não era o pré-treino, era o alinhamento — e o llama 2 publica essa parte: dois reward models, cinco rodadas de rlhf e mais de um milhão de comparações humanas pagas
  42. 2023LLaMA: Open and Efficient Foundation Language Modelso orçamento que importa não é o de treino, é o de inferência: um modelo de 13b treinado muito além do ponto ótimo supera o gpt-3 de 175b, roda numa gpu só e sai inteiro de dado público
  43. 2023Lost in the Middle: How Language Models Use Long Contextsmodelos de contexto longo não leem o contexto inteiro: mova a informação relevante para o meio da entrada e a acurácia despenca — às vezes para baixo do que o modelo acerta sem receber documento nenhum. · núcleo
  44. 2023Mamba: Linear-Time Sequence Modeling with Selective State Spacesdeixar os parâmetros do state space model dependerem do input resolve o que faltava aos ssms — e o preço, perder a forma convolucional, se paga com um scan escrito para a hierarquia de memória da gpu
  45. 2023QLoRA: Efficient Finetuning of Quantized LLMsdá para congelar o modelo inteiro em 4 bits e treinar só os adapters em cima: o finetuning de um 65b cai de 780 gb para menos de 48 gb sem perder nada do desempenho de 16 bits
  46. 2023Reflexion: Language Agents with Verbal Reinforcement Learningdá para reforçar um agente sem tocar em nenhum peso: ele escreve em português claro por que falhou, guarda esse texto na memória e usa o parágrafo como gradiente na tentativa seguinte
  47. 2023SWE-bench: Can Language Models Resolve Real-World GitHub Issues?medir modelo em issue real de github derruba o placar: sobre 2.294 tarefas com teste de verdade, o melhor sistema avaliado resolve 1,96% — e o gargalo é achar o que editar, não escrever o código · núcleo
  48. 2023Textbooks Are All You Needa qualidade do dado é um eixo de escala: 1,3 bilhão de parâmetros treinados em 7 bilhões de tokens curados como livro-texto chegam a 50,6% no humaneval e batem modelos dez vezes maiores em python
  49. 2023Toolformer: Language Models Can Teach Themselves to Use Toolsnão precisa de anotação humana para ensinar um modelo a usar ferramenta: ele escreve chamadas de api no próprio corpus, executa, e fica só com as que reduzem a perplexidade do texto que vem depois
  50. 2023Tree of Thoughts: Deliberate Problem Solving with Large Language Modelso gargalo não é o modelo, é decodificar da esquerda para a direita: transformando raciocínio em busca numa árvore onde o próprio lm dá a heurística, o gpt-4 sai de 4% para 74% no jogo do 24
  51. 2024Alignment Faking in Large Language Modelsum modelo de produção fingiu alinhamento sozinho: claude 3 opus obedeceu ao objetivo novo de treino quando achou que estava sendo observado e voltou a recusar quando achou que não estava
  52. 2024Automated Unit Test Improvement using Large Language Models at Metao llm não precisa acertar: ele gera candidatos, e um filtro de compila-passa-cobre joga fora 96% deles — o que chega ao code review é comprovadamente melhor que o teste que já estava lá
  53. 2024DeepSeek-V3 Technical Reportum modelo de 671b parâmetros cabe em 2.788.000 horas de h800 quando arquitetura, framework de treino e hardware são projetados como um problema só — o gargalo não era compute, era comunicação e precisão
  54. 2024DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Modelso critic do ppo é dispensável: a média das notas de um grupo de respostas à mesma pergunta já serve de baseline — e 120B tokens garimpados da common crawl bastam para um 7B encostar no gpt-4 em matemática
  55. 2024Mixtral of Expertsdá para ter 47 bilhões de parâmetros e pagar por 13: oito ffn por camada, um router que escolhe dois por token, e o modelo bate o llama 2 70b com cinco vezes menos parâmetro ativo
  56. 2024Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameterscompute gasto na hora de responder pode substituir parâmetros de pré-treino — mas só se a alocação mudar conforme a dificuldade da pergunta, e só até o ponto em que a pergunta ainda não é difícil demais
  57. 2024Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnetdá para desfazer a superposição de um modelo de produção: um autoencoder esparso no meio do claude 3 sonnet extrai milhões de features legíveis, e ligar uma delas na marra muda o comportamento do modelo
  58. 2024Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Trainingtreinamento de segurança só enxerga o comportamento visível: um backdoor bem instalado sobrevive a rlhf, a sft e a treino adversarial — e quanto maior o modelo, mais ele sobrevive
  59. 2024The Llama 3 Herd of Modelsescala e dados fazem o trabalho; a arquitetura pode ser chata de propósito — transformer denso, dpo no lugar de ppo — porque a 16 mil gpus o que mata um treino é instabilidade, não falta de ideia · núcleo
  60. 2025DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learningraciocínio não precisa ser ensinado com exemplos: pagando só pelo acerto verificável por regra, o modelo aprende sozinho a pensar mais tempo e a voltar atrás — e isso cabe num 7B via destilação. · núcleo
  61. 2025On the Biology of a Large Language Modelé possível abrir um modelo de produção e ver os passos intermediários: ele planeja a rima antes da linha, recusa por padrão e explica a própria aritmética errado — mas o microscópio só rende em um quarto dos prompts