busca e recuperação
achar o parecido em escala: idf, deduplicação, ranqueamento, banco vetorial.
muda como você pensa
- The Anatomy of a Large-Scale Hypertextual Web Search Engine
- Detecting Near-Duplicates for Web Crawling
- The Probabilistic Relevance Framework: BM25 and Beyond
- Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs
vale o tempo
- Google News Personalization: Scalable Online Collaborative Filtering
- Scaling Up All Pairs Similarity Search
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- Dense Passage Retrieval for Open-Domain Question Answering
para aprofundar
- Indexing Dataspaces
- Efficient Search Ranking in Social Networks
- Web-Scale Extraction of Structured Data
- Scalable blocking for very large databases
- ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT
- A flexible large-scale similar product identification system in e-commerce
- ROSE: Robust caches for Amazon product search
- The Faiss library
- Near-duplicate Question Detection