antonio leandro

enciclopédia

busca e recuperação

achar o parecido em escala: idf, deduplicação, ranqueamento, banco vetorial.

22 verbetes, 5 no caminho mínimo, 13 lidos na íntegra · do que mais pesa para o que menos

muda como você pensa

  1. The Anatomy of a Large-Scale Hypertextual Web Search Enginea qualidade de uma página não está dentro dela: está em quem aponta para ela e no texto usado para apontar — e isso dá para calcular em escala de web com hardware comum · núcleo
  2. Detecting Near-Duplicates for Web Crawlingquase-duplicata é problema do crawler, não do buscador: a decisão sobre uma página praticamente igual a outra custa banda e disco antes de qualquer índice existir · núcleo · pelo resumo
  3. The Probabilistic Relevance Framework: BM25 and Beyondordenar por probabilidade de relevância é o ótimo possível, e a conta feita até o fim desemboca numa soma de pesos por termo que satura, normaliza por tamanho e cabe num índice invertido · núcleo
  4. Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphsbusca vetorial não precisa de índice auxiliar para saber por onde começar: basta empilhar grafos de vizinhança e sortear em qual camada cada ponto entra · núcleo

vale o tempo

  1. Google News Personalization: Scalable Online Collaborative Filteringdá para fazer filtragem colaborativa online, no clique e na escala do google news: notícia expira rápido demais para esperar o batch da madrugada · pelo resumo
  2. Scaling Up All Pairs Similarity Searchachar todos os pares parecidos de uma coleção é quadrático por definição, e o trabalho aposta em escalar a resposta exata em vez de trocá-la por aproximação · pelo resumo
  3. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networkso embedding que o bert entrega de graça é pior que média de glove; um fine-tune siamês de 20 minutos conserta isso e derruba de 65 horas para 5 segundos achar o par mais parecido em 10.000 frases
  4. Dense Passage Retrieval for Open-Domain Question Answeringretrieval denso não precisava de pré-treino especial: dois encoders bert, os pares de pergunta e passagem que já existiam e negativos tirados do próprio batch bastam para enterrar o bm25 · núcleo

para aprofundar

  1. Indexing Dataspacesnum dataspace não existe esquema mediado para consultar — sobra o índice, e é ele que decide se a integração pay-as-you-go responde alguma coisa no dia zero · pelo resumo
  2. Efficient Search Ranking in Social Networksranking de busca dentro de uma rede social não é o da web aberta: a resposta certa muda conforme quem pergunta — e o título deste paper aponta o custo, não a relevância, como o problema · pelo resumo
  3. Web-Scale Extraction of Structured Dataextrair dado estruturado da web inteira é um problema diferente de raspar um site: a escala troca o método, e é isso que o título de 2008 nomeia · pelo resumo
  4. Scalable blocking for very large databasesraridade é o sinal: em vez de escolher a chave de bloco antes, quebre os blocos grandes pela interseção de valores até sobrar pouca gente — e conte bloco com sketch, não com dado materializado
  5. ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERTdá para ter precisão de bert em busca sem pagar o cross-encoder: encode query e documento separados, guarde um vetor por token e adie a interação até um max seguido de uma soma
  6. A flexible large-scale similar product identification system in e-commercenão existe "produto similar": similaridade é uma escolha da aplicação, e o que escala em catálogo de bilhões de itens é um serviço só que atende todas as definições em vez de um pipeline por caso de uso
  7. ROSE: Robust caches for Amazon product searchcache de busca não precisa casar string exata: com hashing randomizado dá para acertar o pedido do cliente mesmo com typo, em memória constante e no mesmo custo de lookup de um cache comum
  8. The Faiss librarybusca vetorial não tem método vencedor: tem um eixo de compressão e um eixo de poda, e o índice certo é a combinação que cabe no orçamento de memória, latência e recall que você aceitou
  9. Near-duplicate Question Detectionduas perguntas podem ser a mesma pergunta sem dividir uma palavra: quase-duplicata de pergunta se decide pela resposta que ela pede, não pelo texto que ela usa — e é por isso que hash de texto não resolve

de nicho

  1. Query logs alone are not enoughlog de busca grava rastro, não objetivo: ele mede frequência e sequência com precisão e intenção com precisão nenhuma, e nenhuma quantidade de linhas conserta isso · pelo resumo
  2. Talking in Circles: Selective Sharing in Google+segmentar audiência não é recurso de privacidade: quem usa circles separa público porque tem várias vidas ao mesmo tempo, e cada post só faz sentido dentro de uma delas · pelo resumo
  3. Classifying YouTube Channels: a Practical Systemclassificar canal do youtube em escala não é escolher um classificador: é enfiar uma camada de entidades entre o texto do vídeo e a taxonomia, e só então agregar vídeo em canal · pelo resumo
  4. Query Attribute Recommendation at Amazon Searchconsulta de busca de produto tem três ou quatro palavras: em vez de extrair melhor o pouco que está escrito, o buscador passa a recomendar o atributo que o usuário não digitou
  5. Striking the right chord: A comprehensive approach to Amazon Music search spell correctioncorretor ortográfico de busca musical não é dicionário: a correção certa depende do resto da consulta e do catálogo desta semana, então vira modelo generativo com adaptador barato por mercado e feedback do usuário em tempo real