o que esta fonte defende
Se há uma tese que atravessa quase duzentos textos em nove anos, é esta: o modelo quase nunca é o gargalo. Yan volta obsessivamente ao mesmo argumento por caminhos diferentes — comece sem machine learning e só adicione inteligência quando a heurística falhar; construa a baseline antes da arquitetura nova; desconfie de complexidade, porque ela vende melhor do que funciona mas entrega pior. Ele chega a nomear isso diretamente num texto de 2022 sobre simplicidade ser vantagem e complexidade ser produto comercial. O corolário é organizacional, não técnico: o que trava um projeto é rótulo mal definido, processo sem mecanismo, time que não consegue explicar o que fez. Daí a insistência em design doc, revisão de metodologia, timeboxing, relato semanal de quinze minutos — rituais baratos que ele trata como infraestrutura de engenharia.
A espinha do arquivo é a avaliação, e ela tem uma linhagem clara. Começa em 2021-2023 no mundo clássico — como escrever diretrizes de anotação, como arrancar rótulos do nada com supervisão fraca, como medir sumarização e detectar alucinação — e migra inteira para LLM sem trocar de premissa. Em 2024 ele constrói o AlignEval, um app cujo primeiro passo é literalmente olhar e rotular os próprios dados, e escreve o levantamento mais citado sobre a eficácia dos LLM-evaluators. Em 2025 vem a correção mais interessante do arquivo: num texto de abril ele argumenta que um LLM-as-judge não salva o produto, e que o que precisa ser consertado é o processo. Vindo de quem passou dois anos defendendo juízes automáticos, é uma limitação da própria posição, não um recuo — o juiz vira instrumento de um método científico maior, não o método. Em 2026 a mesma receita reaparece aplicada a segurança: um alvo em sandbox, entradas que controlam dificuldade, ferramentas e um grader.
Onde ele mudou de ideia de verdade: em recsys e em autonomia. De 2020 a 2022 o desenho que ele ensina é o canônico — offline e online, recuperação de candidatos e ranqueamento, bandits, avaliação contrafactual, viés de posição. Em 2024-2025 ele documenta a convergência entre recsys, busca e LLM até chegar, em setembro de 2025, a um híbrido que conversa em inglês e em IDs de item e recomenda sem recuperação e sem ferramentas — o oposto arquitetural do que ele defendia quatro anos antes, e ele diz isso. A segunda virada é sobre trabalhar com IA: em 2023 ele publicava que chat não deveria ser a UX principal e que dava para fazer melhor; em 2025 está automatizando fluxos agênticos com CLI, MCP e tmux; em maio de 2026 escreve o texto mais programático da série, tratando contexto como infraestrutura, gosto como configuração e verificação como condição para dar autonomia à máquina. A ponte entre o cético de 2023 e o delegador de 2026 é exatamente a avaliação: ele só entrega autonomia depois de saber medir. Há ainda uma virada de carreira que o arquivo registra sem alarde — de VP de data science na Lazada em 2017-2018 para IC sênior na Amazon, com um texto de 2025 dirigido a quem vira principal técnico.
Duas honestidades sobre o conjunto. Primeira: mais ou menos metade do arquivo não é técnica. São textos sobre escrever, contratar, sobreviver à síndrome do impostor, revisões de disciplinas do mestrado da Georgia Tech, retrospectivas de ano, uma história curta sobre adagas voadoras. Quem chega esperando só engenharia vai achar que a fonte se dispersa; a leitura mais justa é que ele trata carreira e escrita como problemas de engenharia, com o mesmo vocabulário de mecanismo e iteração. Segunda: ele não comenta a indústria. Em nove anos praticamente não há previsão sobre AGI, política de IA, movimento de laboratório ou disputa entre empresas. O ponto de vista é sempre o de quem tem um sistema em produção na segunda-feira, e é isso que faz o material envelhecer bem — e também o que ele não serve.
por tema
evals antes do modelo (12 textos)
É o eixo mais forte e mais contínuo do arquivo. A sequência começa em diretrizes de anotação e bootstrap de rótulos — como conseguir dados etiquetados quando não existe nenhum, como calcular recall quando você não sabe quais documentos são relevantes — e chega a receitas fechadas para avaliar sumarização, tradução, classificação, alucinação e sistemas de pergunta e resposta com contexto longo. A regra que ele repete: métrica genérica de benchmark não diz nada sobre a sua tarefa; alinhe um avaliador aos seus próprios rótulos e rode o harness a cada mudança.
O subconjunto sobre LLM-as-judge é o mais consultado e o mais tenso. Em 2024 ele levanta técnicas, alinhamento, finetuning e também as críticas contra juízes automáticos, e constrói o AlignEval — um app cujo primeiro passo é olhar e rotular os dados na mão. Em 2025 ele mesmo puxa o freio: o juiz não conserta o produto, o processo conserta. Em 2026 a mesma estrutura reaparece em avaliação de cibersegurança, com alvo isolado, dificuldade controlada por entrada e um grader — sinal de que ele considera o método portátil para domínios novos.
- Patterns for Building Cybersecurity Evals · 2026-06-21
- Product Evals in Three Simple Steps · 2025-11-23
- Evaluating Long-Context Question & Answer Systems · 2025-06-22
- An LLM-as-Judge Won’t Save The Product—Fixing Your Process Will · 2025-04-20
- AlignEval: Building an App to Make Evals Easy, Fun, and Automated · 2024-10-27
- Weights & Biases LLM-Evaluator Hackathon - Hackathon Judge · 2024-09-22
- Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge) · 2024-08-18
- Task-Specific LLM Evals that Do & Don’t Work · 2024-03-31
- Out-of-Domain Finetuning to Bootstrap Hallucination Detection · 2023-11-05
- Evaluation & Hallucination Detection for Abstractive Summaries · 2023-09-03
- How to Write Data Labeling/Annotation Guidelines · 2023-03-12
- Mailbag: How to Bootstrap Labels for Relevant Docs in Search · 2021-07-20
recsys e busca como um sistema só (23 textos)
A área em que ele tem mais quilometragem industrial. O desenho canônico que ele ensinou por anos separa ambiente offline e online e divide o problema em recuperação de candidatos e ranqueamento — arquitetura que ele detalha com exemplos de empresas chinesas e americanas, sempre com uma versão mínima viável no fim. Em volta disso vem o repertório completo: bandits, aprendizado por reforço para recompensa de longo prazo, correspondência de consulta por métodos léxicos, de grafo e de embedding, e as armadilhas de medição — viés de posição, avaliação contrafactual, ponderação por propensão inversa, e a defesa incômoda de que acurácia sozinha produz recomendação chata (daí a insistência em diversidade, novidade e serendipidade).
A partir de 2024 o eixo vira. Ele passa a documentar a convergência entre recsys, busca e modelos de linguagem — IDs semânticos, aumento de dados sintéticos, modelos de fundação unificados — e em 2025 treina um híbrido que conversa em inglês e em IDs de item e recomenda sem recuperação e sem ferramentas. Vale ler junto com os textos de 2020-2021 para ver o tamanho da mudança de posição.
- Training an LLM-RecSys Hybrid for Steerable Recs with Semantic IDs · 2025-09-14
- AI Engineer 2025 - Improving RecSys & Search with LLM techniques · 2025-06-04
- Improving Recommendation Systems & Search in the Age of LLMs · 2025-03-16
- Netflix PRS 2024 - Applying LLMs to Recommendation Experiences · 2024-05-31
- Push Notifications: What to Push, What Not to Push, and How Often · 2023-12-24
- RecSys 2022: Recap, Favorite Papers, and Lessons · 2022-10-02
- RecSys 2022 Keynote - Is the Juice Worth the Squeeze? · 2022-09-23
- Bandits for Recommender Systems · 2022-05-08
- How to Measure and Mitigate Position Bias · 2022-04-17
- Counterfactual Evaluation for Recommendation Systems · 2022-04-10
- RecSys 2021 - Papers and Talks to Chew on · 2021-10-03
- MLOps Community - System Design for RecSys & Search · 2021-09-15
- Reinforcement Learning for Recommendations and Search · 2021-09-05
- SF Big Analytics - System Design for RecSys & Search · 2021-07-13
- System Design for Recommendations and Search · 2021-06-27
- Patterns for Personalization in Recommendations and Search · 2021-06-13
- Search: Query Matching via Lexical, Graph, and Embedding Methods · 2021-04-25
- Real-time Machine Learning For Recommendations · 2021-01-10
- RecSys 2020: Takeaways and Notable Papers · 2020-09-27
- Serendipity: Accuracy’s Unpopular Best Friend in Recommenders · 2020-04-26
- DataScience SG Meetup - RecSys, Beyond the Baseline · 2020-01-14
- Beating the Baseline Recommender with Graph & NLP in Pytorch · 2020-01-13
- Building a Strong Baseline Recommender in PyTorch, on a Laptop · 2020-01-06
o que quebra depois do deploy (23 textos)
O bloco mais útil para quem opera. A premissa é que o modelo em produção é a parte fácil: o difícil é manter vários deles vivos ao longo de meses. Ele cataloga os problemas que só aparecem depois — deriva, dependências de dados, pipelines que dão resultado diferente na segunda execução — e propõe hábitos de acompanhamento pós-projeto para que o resultado seja reproduzível. Há também um conjunto de padrões de projeto tratados como vocabulário: humano no circuito, mineração de exemplos difíceis, reenquadramento do problema, cascata de heurísticas e modelos, camada de regras de negócio, volante de dados.
A parte sobre teste é a mais opinativa e a que mais contraria a prática comum de software. Ele defende testar implementação, comportamento aprendido e desempenho como três coisas distintas, argumenta contra usar mock em modelos dentro de teste unitário e conclui, depois de se queimar, que escreveu testes de integração demais. Completam o eixo a hierarquia de necessidades de feature store — use só o nível de que você precisa — plataformas de descoberta de dados, e a defesa de que cientista de dados deveria ser mais ponta a ponta, com os contra-argumentos incluídos.
- Don’t Mock Machine Learning Models In Unit Tests · 2024-02-25
- More Design Patterns For Machine Learning Systems · 2023-04-23
- Content Moderation & Fraud Detection - Patterns in Industry · 2023-02-26
- Writing Robust Tests for Data & Machine Learning Pipelines · 2022-09-04
- Design Patterns in Machine Learning Code and Systems · 2022-06-12
- The First Rule of Machine Learning: Start without Machine Learning · 2021-09-19
- Bootstrapping Labels via ___ Supervision & Human-In-The-Loop · 2021-08-01
- How to Write Design Docs for Machine Learning Systems · 2021-03-07
- Feature Stores: A Hierarchy of Needs · 2021-02-21
- Data Discovery Platforms and Their Open Source Solutions · 2020-10-25
- How to Test Machine Learning Code and Systems · 2020-09-06
- Mailbag: Parsing Fields from PDFs—When to Use Machine Learning? · 2020-09-04
- NLP for Supervised Learning - A Brief Survey · 2020-08-16
- Unpopular Opinion: Data Scientists Should be More End-to-End · 2020-08-09
- Why You Need to Follow Up After Your Data Science Project · 2020-07-19
- What I Do During A Data Science Project To Deliver Success · 2020-07-12
- How to Set Up a Python Project For Automation and Collaboration · 2020-06-21
- What I Do Before a Data Science Project to Ensure Success · 2020-06-15
- A Practical Guide to Maintaining Machine Learning in Production · 2020-05-25
- 6 Little-Known Challenges After Deploying Machine Learning · 2020-05-18
- Simpler Experimentation with Jupyter, Papermill, and MLflow · 2020-03-15
- DataScience SG x ODSC Meetup - Applying ML to Healthcare · 2019-10-09
- DATAx - A Production ML system for SEA’s Biggest Hospital Group · 2019-03-06
padrões para sistemas com llm (11 textos)
Em julho de 2023 ele publicou o texto que virou referência de vocabulário para a área: sete padrões para construir produtos com LLM — avaliação, geração aumentada por recuperação, finetuning, cache, guardrails, UX defensiva e coleta de feedback do usuário. O texto seguinte ensina a escolher entre eles, separando problemas com modelo externo e interno, com e sem dados próprios. O fundamento de prompting está num artigo de 2024 sobre entrada e saída estruturadas, prefill, poucos exemplos, cadeia de raciocínio e redução de alucinação, e o gargalo de anotação humana é atacado com dados sintéticos para ajuste por instrução e por preferência.
O documento coletivo mais influente é o retrospecto de um ano construindo com LLM, escrito com mais cinco autores e apresentado como keynote — dividido em tático, operacional e estratégico, com uma parte considerável dedicada a quando não usar LLM. Os textos de 2026 mostram para onde a linha vai: usar modelos para modelar ameaças, achar e corrigir vulnerabilidade em código, e um manifesto sobre trabalhar com IA em que contexto é infraestrutura, gosto é configuração e verificação é o que compra autonomia.
- Using LLMs to Secure Source Code · 2026-05-27
- How to Work and Compound with AI · 2026-05-03
- NVIDIA GTC 2025 - Building LLM-Powered Applications · 2025-03-18
- AI Engineer 2024 Keynote - What We Learned from a Year of LLMs · 2024-06-27
- Prompting Fundamentals and How to Apply them Effectively · 2024-05-26
- What We’ve Learned From A Year of Building with LLMs · 2024-05-12
- How to Generate and Use Synthetic Data for Finetuning · 2024-02-11
- Reflections on AI Engineer Summit 2023 · 2023-10-15
- AI Engineer 2023 Keynote - Building Blocks for LLM Systems · 2023-10-09
- How to Match LLM Patterns to Problems · 2023-08-13
- Patterns for Building LLM-based Systems & Products · 2023-07-30
aprender fazendo e publicar as notas (43 textos)
Um terço do arquivo é ele aprendendo em público. Constrói um copiloto de escrita em cima do Obsidian que puxa dos próprios diários, um treinador pessoal por voz com telefone virtual, um clube de leitura com IA, uma versão do mesmo app em cinco frameworks web para comparar como assistentes de código enviesam a escolha da ferramenta, um Raspberry Pi que inventa manchetes. Faz LLMs escreverem biografias só para medir o quanto memorizam e regurgitam. Quando não constrói, explica: a intuição de query, key e value na atenção, autoencoders comparados a difusores, os fundamentos de texto para imagem. Nenhum desses textos tem pretensão de originalidade de pesquisa — a função é entender destruindo o brinquedo.
A mesma disposição aparece na forma como ele estuda: lista de papers fundamentais para começar um clube de leitura, um guia de como rodar esse clube toda semana, um argumento sobre por que ler papers deixa você mais eficaz, e a posição de que você não precisa de mais um MOOC — aprenda na hora da necessidade e saia do caminho feliz. As resenhas das disciplinas do mestrado a distância da Georgia Tech, escritas entre 2017 e 2020, são um serviço público sem glamour; junto com notas de conferência e migrações de site e setup de máquina, formam a camada mais utilitária do arquivo.
- Building News Agents for Daily News Recaps with MCP, Q, and tmux · 2025-05-04
- Building AI Reading Club: Features & Behind the Scenes · 2025-01-12
- How to Run a Weekly Paper Club (and Build a Learning Community) · 2024-11-24
- My Minimal MacBook Pro Setup Guide · 2024-11-17
- Building the Same App Using Various Web Frameworks · 2024-09-08
- Building an AI Coach to Help Tame My Monkey Mind · 2024-04-07
- Language Modeling Reading List (to Start Your Paper Club) · 2024-01-07
- Obsidian-Copilot: An Assistant for Writing & Reflecting · 2023-06-11
- Some Intuition on Attention and the Transformer · 2023-05-21
- Open-LLMs - A list of LLMs for Commercial Use · 2023-05-07
- Interacting with LLMs with Minimal Chat · 2023-04-30
- Raspberry-LLM - Making My Raspberry Pico a Little Smarter · 2023-04-16
- Experimenting with LLMs to Research, Reflect, and Plan · 2023-04-09
- LLM-powered Biographies · 2023-03-19
- Goodbye Roam Research, Hello Obsidian · 2023-01-15
- Autoencoders and Diffusers: A Brief Comparison · 2022-12-11
- Text-to-Image: Diffusion, Text Conditioning, Guidance, Latent Space · 2022-11-27
- Uncommon Uses of Python in Commonly Used Libraries · 2022-07-31
- How to Keep Learning about Machine Learning · 2022-01-19
- You Don’t Really Need Another MOOC · 2021-01-24
- Mailbag: What’s the Architecture for your Blog? · 2020-11-24
- Why I switched from Netlify back to GitHub Pages · 2020-10-21
- How to Install Google Scalable Nearest Neighbors (ScaNN) on Mac · 2020-10-14
- Migrating Site Comments to Utterances · 2020-09-07
- How Reading Papers Helps You Be a More Effective Data Scientist · 2020-08-30
- Embrace Beginner’s Mind; Avoid The Wrong Way To Be An Expert · 2020-08-23
- Adding a Checkbox & Download Button to a FastAPI-HTML app · 2020-08-05
- Georgia Tech’s OMSCS FAQ (based on my experience) · 2020-07-26
- How to Set Up a HTML App with FastAPI, Jinja, Forms & Templates · 2020-07-23
- How to Update a GitHub Profile README Automatically · 2020-07-11
- My Notes From Spark+AI Summit 2020 (Application-Specific Talks) · 2020-07-05
- My Notes From Spark+AI Summit 2020 (Application-Agnostic Talks) · 2020-06-28
- OMSCS CS6200 (Introduction to OS) Review and Tips · 2019-12-15
- OMSCS CS6750 (Human Computer Interaction) Review and Tips · 2019-09-03
- Goodbye Wordpress, Hello Jekyll! · 2019-08-25
- OMSCS CS6440 (Intro to Health Informatics) Review and Tips · 2019-08-04
- OMSCS CS7646 (Machine Learning for Trading) Review and Tips · 2019-05-11
- OMSCS CS6601 (Artificial Intelligence) Review and Tips · 2018-12-20
- OMSCS CS6460 (Education Technology) Review and Tips · 2018-08-25
- OMSCS CS7642 (Reinforcement Learning) Review and Tips · 2018-07-30
- OMSCS CS7641 (Machine Learning) Review and Tips · 2017-12-27
- OMSCS CS6300 (Software Development Process) Review and Tips · 2017-08-13
- OMSCS CS6476 (Computer Vision) Review and Tips · 2017-05-15
escrever é o método (14 textos)
Ele trata escrita como parte do trabalho técnico, não como divulgação. O framework que mais reaproveita é o porquê, o quê, como, aplicado a três documentos concretos — a página única, o documento de design e a revisão pós-ação. A defesa é direta: escrever é a forma barata de descobrir que você não entendeu o problema, e num ambiente onde documento circula mais que pessoa, é o que faz a ideia sobreviver sem você na sala.
O conselho para quem quer começar é deliberadamente antiperfeccionista — escreva antes de estar pronto, escreva para si mesmo, priorize quantidade sobre qualidade — e ele reconhece a contradição num texto sobre as regras paradoxais da escrita, em que várias das próprias recomendações se anulam. Há também o aparato de método: zettelkasten no lugar de notas soltas, escrita como ciclo de ler, anotar e produzir, e um FAQ de 2025 que responde como começou, para quem escreve e por quê. Vários desses textos são entrevistas ou posts convidados, o que dá contraponto a uma seção que poderia virar monólogo.
- Frequently Asked Questions about My Writing Process · 2025-03-30
- Seemingly Paradoxical Rules of Writing · 2024-12-01
- Why You Should Write Weekly 15-5s · 2022-06-26
- 5 Lessons I Learned from Writing Online (Guest post by Susan Shu) · 2021-11-07
- What I Learned from Writing Online - For Fellow Non-Writers · 2021-10-17
- Amazon Science - Eugene Yan and the Art of Writing about Science · 2021-08-02
- Towards Data Science - Author Spotlight with Eugene Yan · 2021-06-02
- How to Write Better with The Why, What, How Framework · 2021-02-28
- DataTalksClub - The Importance Of Writing In A Tech Career · 2021-01-17
- Is Writing as Important as Coding? · 2020-10-04
- What I Did Not Learn About Writing In School · 2020-08-02
- How to Write: Advice from David Perell and Sahil Lavingia · 2020-05-09
- Stop Taking Regular Notes; Use a Zettelkasten Instead · 2020-04-05
- Writing is Learning: How I Learned an Easier Way to Write · 2020-03-28
carreira, times e mecanismos (74 textos)
A metade menos técnica do arquivo, e a mais pessoal. O núcleo é a ideia de mecanismo: rituais que produzem o comportamento certo sem depender de disciplina individual — debrief de fim de semana, revisão semanal do negócio, sessão mensal de aprendizado, revisão trimestral, plano de cem dias para quem entra. A metáfora que ele mais empresta é a de comando, soldado e polícia, usada tanto para escolher entre ofertas de emprego quanto para descrever estilos de liderança. Sobre influência, a posição é que cientista de dados raramente tem autoridade formal: mostre o dado, use o método socrático, construa protótipo quando o roadmap e o documento de design falharem, e conquiste confiança antes de pedir.
O resto é a matéria bruta de uma carreira contada em tempo real, de graduado em psicologia a líder de dados na Lazada e depois a IC sênior na Amazon: como entrevistar e contratar, sinais de alerta ao entrar num time, o que fazer quando o time do qual você depende não ajuda, o descompasso entre título e função, agile e scrum adaptados a ciência de dados — primeiro criticados, depois defendidos. Atravessando tudo, a linha mais humana: dois textos sobre viver com síndrome do impostor crônica, a regra dos 85% contra o esforço máximo, a lei de Crocker para receber crítica dura, sete hábitos de uma década e as retrospectivas anuais que ele publica desde 2020.
- 2025 Year in Review · 2025-12-14
- Advice for New Principal Tech ICs (i.e., Notes to Myself) · 2025-10-19
- Exceptional Leadership: Some Qualities, Behaviors, and Styles · 2025-05-18
- 2024 Year in Review · 2024-12-22
- 39 Lessons on Building ML Systems, Scaling, Execution, and More · 2024-11-03
- How to Interview and Hire ML/AI Engineers · 2024-07-07
- 2023 Year in Review · 2023-12-31
- Mechanisms for Effective Technical Teams · 2023-02-05
- Mechanisms for Effective Machine Learning Projects · 2023-01-22
- What To Do If Dependency Teams Can’t Help · 2023-01-08
- 2022 in Review & 2023 Goals · 2022-12-24
- Simplicity is An Advantage but Sadly Complexity Sells Better · 2022-08-14
- What I Wish I Knew About Onboarding Effectively · 2022-05-22
- Traversing High-Level Intent and Low-Level Requirements · 2022-03-20
- Data Science Project Quick-Start · 2022-03-06
- Mailbag: How to Define a Data Team’s Vision and Roadmap · 2022-02-18
- Red Flags to Look Out for When Joining a Data Team · 2022-02-13
- The Data Scientist Show - Building end-to-end ML systems · 2021-12-02
- 2021 Year in Review · 2021-11-28
- Informal Mentors Grew into ApplyingML.com! · 2021-11-25
- Influencing without Authority for Data Scientists · 2021-07-04
- The Metagame of Applying Machine Learning · 2021-05-02
- My Impostor Syndrome Stories (Guest Post by Susan Shu) · 2021-04-18
- How to Live with Chronic Imposter Syndrome · 2021-04-11
- Planning Your Career: Values and Superpowers · 2021-04-04
- Bukalapak - Fireside Chat with the Data Science team · 2021-03-28
- TalkPython - What ML can Teach Us About Life · 2021-03-26
- Choosing Problems in Data Science and Machine Learning · 2021-03-21
- Seven Habits that Shaped My Last Decade · 2021-03-14
- How to Win a Data Hackathon (Hacklytics 2021) · 2021-02-14
- DataTalksClub - Building an ML System; Behind the Scenes · 2021-02-07
- Growing and Running Your Data Science Team · 2021-01-31
- Mailbag: How to Get Experienced DS Resume Noticed by Recruiters? · 2021-01-16
- 2021 Roadmap: Sharing, Helping, and Living More · 2021-01-03
- 2020 Retrospective: New Country, New Role, New Habit · 2020-12-20
- Catch the Flying Daggers · 2020-12-11
- How I’m Reflecting on 2020 and Planning for 2021 · 2020-12-06
- Alexey Grigorev on His Career, Data Science, and Writing · 2020-11-29
- What Machine Learning Can Teach Us About Life - 7 Lessons · 2020-11-22
- How to Prevent or Deal with a Data Science Role or Title Mismatch · 2020-11-15
- Applied / Research Scientist, ML Engineer: What’s the Difference? · 2020-11-08
- Chip Huyen on Her Career, Writing, and Machine Learning · 2020-11-01
- Why Have a Data Science Portfolio and What It Shows · 2020-10-18
- How Prototyping Can Help You to Get Buy-In · 2020-10-11
- Appreciating the Present · 2020-09-26
- CareerFair - Day-to-day as an Applied Scientist at Amazon · 2020-09-21
- Routines and Tools to Optimize My Day (Guest Post by Susan Shu) · 2020-09-20
- How to Accomplish More with Less - Useful Tools & Routines · 2020-09-13
- Datacast Podcast - Effective Data Science with Eugene Yan · 2020-09-03
- Mailbag: I’m Now a Senior DS—How should I Approach this? · 2020-08-27
- The 85% Rule: When Giving It Your 100% Gets You Less than 85% · 2020-07-09
- Mailbag: Qns on the Intersection of Data Science and Business · 2020-06-21
- Why Are My Airflow Jobs Running “One Day Late”? · 2020-06-17
- What I Love about Scrum for Data Science · 2020-06-07
- How to Apply Crocker’s Law for Feedback and Growth · 2020-05-31
- A Hackathon Where the Dinkiest Idea Won. Why? · 2020-05-03
- How to Give a Kick-Ass Data Science Talk · 2020-04-18
- Commando, Soldier, Police and Your Career Choices · 2020-04-12
- My Journey from Psych Grad to Leading Data Science at Lazada · 2020-02-27
- OLX Prod Tech 2019 Keynote - Asia’s Tech Giants & SuperApps · 2019-10-03
- What does a Data Scientist really do? · 2019-04-30
- Data Science and Agile (Frameworks for Effectiveness) · 2019-02-02
- Data Science and Agile (What Works, and What Doesn’t) · 2019-01-26
- DataScience SG Meetup - Panel On the Different Roles in Data · 2019-01-17
- GovTech Conference - Data Science and Agile—Can or Not? · 2018-10-28
- Big Data & Analytics Summit - Data Science Challenges @ Lazada · 2018-06-21
- Building a Strong Data Science Team Culture · 2018-05-12
- INSEAD Lunchtime Talks - How Lazada uses Data · 2018-04-25
- My first 100 days as Data Science Lead · 2017-09-25
- SMU - What is Data Analytics and How do I get into it? · 2017-08-26
- Tech in Asia - My Journey in Data Science and Advice for others · 2017-07-26
- SMU Masters in IT - How to get started in Data Science · 2017-06-26
- How to get started in Data Science · 2017-06-25
- One way to help a data science team innovate successfully · 2017-02-19
onde ela discorda de outras fontes do acervo
Onde ele contraria o discurso dominante da indústria, contraria de dentro. Em abril de 2025 escreveu que um LLM-as-judge não salva o produto — um mês depois de o setor inteiro ter adotado juízes automáticos como atalho para não olhar dados; o alvo é a ideia de que dá para terceirizar avaliação para outro modelo e pular a etapa de rotular na mão. Em 2022, num texto sobre simplicidade, acusa diretamente o mercado de vender complexidade porque complexidade é mais fácil de vender, o que o coloca contra fornecedores de plataforma e contra o incentivo acadêmico à arquitetura nova. E em abril de 2023, quando chat virou a interface padrão de tudo, publicou que chat não deveria ser a UX principal de LLM — posição que ele próprio depois relativizou ao construir fluxos agênticos, mas que continua sendo a objeção mais bem formulada do arquivo contra o consenso de produto da época.
linha do tempo
- 2026-06-21 — Patterns for Building Cybersecurity Evals
- 2026-05-27 — Using LLMs to Secure Source Code
- 2026-05-03 — How to Work and Compound with AI
- 2025-12-14 — 2025 Year in Review
- 2025-11-23 — Product Evals in Three Simple Steps
- 2025-10-19 — Advice for New Principal Tech ICs (i.e., Notes to Myself)
- 2025-09-14 — Training an LLM-RecSys Hybrid for Steerable Recs with Semantic IDs
- 2025-06-22 — Evaluating Long-Context Question & Answer Systems
- 2025-06-04 — AI Engineer 2025 - Improving RecSys & Search with LLM techniques
- 2025-05-18 — Exceptional Leadership: Some Qualities, Behaviors, and Styles
- 2025-05-04 — Building News Agents for Daily News Recaps with MCP, Q, and tmux
- 2025-04-20 — An LLM-as-Judge Won’t Save The Product—Fixing Your Process Will
- 2025-03-30 — Frequently Asked Questions about My Writing Process
- 2025-03-18 — NVIDIA GTC 2025 - Building LLM-Powered Applications
- 2025-03-16 — Improving Recommendation Systems & Search in the Age of LLMs
- 2025-01-12 — Building AI Reading Club: Features & Behind the Scenes
- 2024-12-22 — 2024 Year in Review
- 2024-12-01 — Seemingly Paradoxical Rules of Writing
- 2024-11-24 — How to Run a Weekly Paper Club (and Build a Learning Community)
- 2024-11-17 — My Minimal MacBook Pro Setup Guide
- 2024-11-03 — 39 Lessons on Building ML Systems, Scaling, Execution, and More
- 2024-10-27 — AlignEval: Building an App to Make Evals Easy, Fun, and Automated
- 2024-09-22 — Weights & Biases LLM-Evaluator Hackathon - Hackathon Judge
- 2024-09-08 — Building the Same App Using Various Web Frameworks
- 2024-08-18 — Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)
- 2024-07-07 — How to Interview and Hire ML/AI Engineers
- 2024-06-27 — AI Engineer 2024 Keynote - What We Learned from a Year of LLMs
- 2024-05-31 — Netflix PRS 2024 - Applying LLMs to Recommendation Experiences
- 2024-05-26 — Prompting Fundamentals and How to Apply them Effectively
- 2024-05-12 — What We’ve Learned From A Year of Building with LLMs
- 2024-04-07 — Building an AI Coach to Help Tame My Monkey Mind
- 2024-03-31 — Task-Specific LLM Evals that Do & Don’t Work
- 2024-02-25 — Don’t Mock Machine Learning Models In Unit Tests
- 2024-02-11 — How to Generate and Use Synthetic Data for Finetuning
- 2024-01-07 — Language Modeling Reading List (to Start Your Paper Club)
- 2023-12-31 — 2023 Year in Review
- 2023-12-24 — Push Notifications: What to Push, What Not to Push, and How Often
- 2023-11-05 — Out-of-Domain Finetuning to Bootstrap Hallucination Detection
- 2023-10-15 — Reflections on AI Engineer Summit 2023
- 2023-10-09 — AI Engineer 2023 Keynote - Building Blocks for LLM Systems
- 2023-09-03 — Evaluation & Hallucination Detection for Abstractive Summaries
- 2023-08-13 — How to Match LLM Patterns to Problems
- 2023-07-30 — Patterns for Building LLM-based Systems & Products
- 2023-06-11 — Obsidian-Copilot: An Assistant for Writing & Reflecting
- 2023-05-21 — Some Intuition on Attention and the Transformer
- 2023-05-07 — Open-LLMs - A list of LLMs for Commercial Use
- 2023-04-30 — Interacting with LLMs with Minimal Chat
- 2023-04-23 — More Design Patterns For Machine Learning Systems
- 2023-04-16 — Raspberry-LLM - Making My Raspberry Pico a Little Smarter
- 2023-04-09 — Experimenting with LLMs to Research, Reflect, and Plan
- 2023-03-19 — LLM-powered Biographies
- 2023-03-12 — How to Write Data Labeling/Annotation Guidelines
- 2023-02-26 — Content Moderation & Fraud Detection - Patterns in Industry
- 2023-02-05 — Mechanisms for Effective Technical Teams
- 2023-01-22 — Mechanisms for Effective Machine Learning Projects
- 2023-01-15 — Goodbye Roam Research, Hello Obsidian
- 2023-01-08 — What To Do If Dependency Teams Can’t Help
- 2022-12-24 — 2022 in Review & 2023 Goals
- 2022-12-11 — Autoencoders and Diffusers: A Brief Comparison
- 2022-11-27 — Text-to-Image: Diffusion, Text Conditioning, Guidance, Latent Space