Recherche vectorielle managée — palier gratuit

Cherchez le sens, pas les mots

Vela indexe vos embeddings et répond par similarité en quelques millisecondes. Une seule API pour la recherche sémantique, le RAG et la recommandation, jusqu'au milliard de vecteurs.


Latence p99
0 ms
Rappel cible
0,2 %
Dimensions maximales
0
Régions de déploiement
0

Un index par mots-clés ne retrouve que ce que vous avez déjà su nommer. Il ignore les synonymes, les reformulations, les autres langues.

Un index vectoriel compare des sens. Même requête, mais elle ramène ce que vous cherchiez.

Un index vectoriel, sans le cluster

Vous gardez la main sur vos modèles et vos données. Nous prenons en charge l'indexation, le parcours du graphe et la tenue des latences.

  • Une seule API

    Créez un index, envoyez vos vecteurs, interrogez-les. Aucune infrastructure à dimensionner ni à opérer.

  • Latence prévisible

    Le p99 reste sous 12 ms sur un index d'un milliard de vecteurs, y compris quand une requête porte un filtre.

  • Filtres par métadonnées

    Restreignez une recherche à un client, une langue ou une période. Le filtre s'applique pendant le parcours du graphe, pas après.

  • Écritures interrogeables

    Un vecteur inséré devient consultable en quelques secondes. Aucune fenêtre de réindexation à planifier.

  • Résidence des données

    La région se choisit à la création de l'index, parmi huit. La réplication multi-région reste optionnelle.

  • Vos modèles, vos vecteurs

    Jusqu'à 4096 dimensions, similarité cosinus ou produit scalaire. Vela n'impose aucun modèle d'embedding.

Deux vecteurs voisins, deux idées voisines

Un embedding place un texte, une image ou un produit dans un espace à plusieurs milliers de dimensions. Deux contenus qui parlent de la même chose s'y retrouvent côte à côte.

Vela parcourt cet espace avec un graphe HNSW et vous rend les k plus proches voisins d'une requête, sans jamais la comparer au milliard d'autres vecteurs.

De l'index à la première requête

Quatre étapes, dans cet ordre, pour passer d'un index vide à des réponses en production.

  1. 01

    Indexation

    Créez un index en fixant ses dimensions, sa mesure de similarité et sa région de stockage.

    • Jusqu'à 4096 dimensions
    • Cosinus ou produit scalaire
    • Huit régions
  2. 02

    Ingestion

    Envoyez vos vecteurs par lots, accompagnés des métadonnées qui serviront ensuite aux filtres.

    • Import par lots
    • Métadonnées typées
    • Namespaces isolés
  3. 03

    Requête

    Demandez les k plus proches voisins d'un vecteur, avec ou sans filtre, et récupérez les scores.

    • Recherche k-NN
    • Filtres combinables
    • Scores de similarité
  4. 04

    Exploitation

    Suivez le rappel et la latence en production, puis ajustez les paramètres du graphe si besoin.

    • Latences p50 et p99
    • Rappel par requête
    • Réindexation à chaud

Trois arbitrages assumés

Une base vectorielle se juge sur ce qu'elle sacrifie. Voici ce que nous avons choisi.

Le p99 compte davantage que la moyenne. Un index qui répond en 3 ms neuf fois sur dix, puis en 400 ms la dixième, est inutilisable derrière un assistant conversationnel.

Latence Le p99, pas la moyenne

Un filtre très sélectif fait chuter le rappel bien avant la latence. Nous filtrons pendant le parcours du graphe plutôt qu'après, pour que la liste des voisins reste pertinente.

Rappel Filtrer sans dégrader

Un vecteur de 1536 dimensions occupe de l'ordre de 6 Ko en mémoire, graphe compris. La quantification réduit ce coût, un reclassement final rattrape la précision perdue.

Coût Mémoire par vecteur

Votre premier index en cinq minutes

Le palier Découverte est gratuit : un index, un million de vecteurs, sans carte bancaire. Vous changez de palier quand vos requêtes le demandent, sans réindexation.