Réduire la latence p99 d'un index vectoriel
Pourquoi la queue de distribution se dégrade avant la médiane : efSearch, filtrage par métadonnées, réindexation et effets de la mémoire sur les latences hautes.
Lire l'articleNos articles sur la recherche vectorielle, les pipelines RAG, la performance des index et l'architecture interne de Vela.
Ce que BM25 sait faire, ce qu'il ne sait pas faire, et pourquoi la recherche par similarité vectorielle complète plutôt qu'elle ne remplace l'index lexical.
Lire l'articleCoût mémoire par vecteur, effet de la dimension sur le rappel, quantification et troncature : comment arbitrer avant d'indexer un gros corpus.
Lire l'articlePourquoi la queue de distribution se dégrade avant la médiane : efSearch, filtrage par métadonnées, réindexation et effets de la mémoire sur les latences hautes.
Lire l'article