Recherche vectorielle managée — palier gratuit
Cherchez le sens, pas les mots
Vela indexe vos embeddings et répond par similarité en quelques millisecondes. Une seule API pour la recherche sémantique, le RAG et la recommandation, jusqu'au milliard de vecteurs.
- Latence p99
- 0 ms
- Rappel cible
- 0,2 %
- Dimensions maximales
- 0
- Régions de déploiement
- 0
Un index par mots-clés ne retrouve que ce que vous avez déjà su nommer. Il ignore les synonymes, les reformulations, les autres langues.
Un index vectoriel compare des sens. Même requête, mais elle ramène ce que vous cherchiez.
Ce que fait le moteur
Un index vectoriel, sans le cluster
Vous gardez la main sur vos modèles et vos données. Nous prenons en charge l'indexation, le parcours du graphe et la tenue des latences.
-
Une seule API
Créez un index, envoyez vos vecteurs, interrogez-les. Aucune infrastructure à dimensionner ni à opérer.
-
Latence prévisible
Le p99 reste sous 12 ms sur un index d'un milliard de vecteurs, y compris quand une requête porte un filtre.
-
Filtres par métadonnées
Restreignez une recherche à un client, une langue ou une période. Le filtre s'applique pendant le parcours du graphe, pas après.
-
Écritures interrogeables
Un vecteur inséré devient consultable en quelques secondes. Aucune fenêtre de réindexation à planifier.
-
Résidence des données
La région se choisit à la création de l'index, parmi huit. La réplication multi-région reste optionnelle.
-
Vos modèles, vos vecteurs
Jusqu'à 4096 dimensions, similarité cosinus ou produit scalaire. Vela n'impose aucun modèle d'embedding.
La recherche par similarité
Deux vecteurs voisins, deux idées voisines
Un embedding place un texte, une image ou un produit dans un espace à plusieurs milliers de dimensions. Deux contenus qui parlent de la même chose s'y retrouvent côte à côte.
Vela parcourt cet espace avec un graphe HNSW et vous rend les k plus proches voisins d'une requête, sans jamais la comparer au milliard d'autres vecteurs.
Mise en production
De l'index à la première requête
Quatre étapes, dans cet ordre, pour passer d'un index vide à des réponses en production.
- 01
Indexation
Créez un index en fixant ses dimensions, sa mesure de similarité et sa région de stockage.
- 02
Ingestion
Envoyez vos vecteurs par lots, accompagnés des métadonnées qui serviront ensuite aux filtres.
- 03
Requête
Demandez les k plus proches voisins d'un vecteur, avec ou sans filtre, et récupérez les scores.
- 04
Exploitation
Suivez le rappel et la latence en production, puis ajustez les paramètres du graphe si besoin.
Nos partis pris
Trois arbitrages assumés
Une base vectorielle se juge sur ce qu'elle sacrifie. Voici ce que nous avons choisi.
Le p99 compte davantage que la moyenne. Un index qui répond en 3 ms neuf fois sur dix, puis en 400 ms la dixième, est inutilisable derrière un assistant conversationnel.
Un filtre très sélectif fait chuter le rappel bien avant la latence. Nous filtrons pendant le parcours du graphe plutôt qu'après, pour que la liste des voisins reste pertinente.
Un vecteur de 1536 dimensions occupe de l'ordre de 6 Ko en mémoire, graphe compris. La quantification réduit ce coût, un reclassement final rattrape la précision perdue.
Journal d'ingénierie
Derniers articles
Ce que nous apprenons en exploitant des index vectoriels en production.
- Pourquoi la recherche par mots-clés atteint ses limites Ce que BM25 sait faire, ce qu'il ne sait pas faire, et pourquoi la recherche par similarité vectorielle complète plutôt qu'elle ne remplace l'index lexical.
- Choisir la dimension de ses embeddings Coût mémoire par vecteur, effet de la dimension sur le rappel, quantification et troncature : comment arbitrer avant d'indexer un gros corpus.
- Réduire la latence p99 d'un index vectoriel Pourquoi la queue de distribution se dégrade avant la médiane : efSearch, filtrage par métadonnées, réindexation et effets de la mémoire sur les latences hautes.
Votre premier index en cinq minutes
Le palier Découverte est gratuit : un index, un million de vecteurs, sans carte bancaire. Vous changez de palier quand vos requêtes le demandent, sans réindexation.