Performance
Choisir la dimension de ses embeddings
Coût mémoire par vecteur, effet de la dimension sur le rappel, quantification et troncature : comment arbitrer avant d'indexer un gros corpus.
Latence, débit et empreinte mémoire des index
Mesure et réduction des latences de queue, dimensionnement mémoire et arbitrages entre rappel et vitesse.
Coût mémoire par vecteur, effet de la dimension sur le rappel, quantification et troncature : comment arbitrer avant d'indexer un gros corpus.
Pourquoi la queue de distribution se dégrade avant la médiane : efSearch, filtrage par métadonnées, réindexation et effets de la mémoire sur les latences hautes.