Moteur de recherche sémantique

Vela indexe vos embeddings et répond aux requêtes par similarité en quelques millisecondes, jusqu'au milliard de vecteurs par index.

Un index toujours à jour

Vous envoyez des vecteurs, Vela construit et maintient l'index. La recherche par k plus proches voisins reste disponible pendant les écritures.

L'index repose sur un graphe HNSW réparti en shards. Chaque écriture devient interrogeable sans réindexation manuelle. Les namespaces isolent vos jeux de données à l'intérieur d'un même index.

12 ms latence p99
1 Md vecteurs par index
99,2 % rappel

Index HNSW

Graphe de voisinage construit en continu

Similarité cosinus

Recherche k-NN jusqu'à 4096 dimensions

Résidence des données

8 régions au choix pour chaque index

Filtres par métadonnées

Requêtes combinant vecteurs et attributs

Explorer par fonction

Le détail du moteur, de l'ingestion des vecteurs jusqu'à la requête.

Indexation des vecteurs

Ingestion des embeddings, construction du graphe HNSW et mise à jour continue

Ingestion

  • Envoi par lots, jusqu'à 4096 dimensions
  • Insertion, mise à jour, suppression
  • Écritures interrogeables sans réindexation
  • Namespaces par jeu de données

Structure de l'index

  • Graphe HNSW multi-couches
  • Répartition automatique en shards
  • Jusqu'à 1 milliard de vecteurs par index
  • Compaction en arrière-plan

Modèles d'embedding

  • Compatible avec tout fournisseur d'embeddings
  • Dimensions déclarées à la création
  • Normalisation optionnelle des vecteurs
  • Réindexation en place au changement de modèle

Requêtes par similarité

Recherche k plus proches voisins, scores et contrôle du compromis rappel/latence

Recherche k-NN

  • Similarité cosinus par défaut
  • Produit scalaire et distance euclidienne
  • Valeur de k définie par requête
  • Score de similarité sur chaque résultat

Contrôle du rappel

  • Rappel mesuré à 99,2 %
  • Paramètre d'exploration ajustable
  • Compromis rappel/latence par requête
  • Jeux de validation pour comparer

Format des réponses

  • Identifiants et scores
  • Métadonnées renvoyées à la demande
  • Vecteurs bruts optionnels
  • Pagination par curseur

Filtres par métadonnées

Combiner contraintes structurées et recherche vectorielle dans une seule requête

Types de champs

  • Chaînes et listes de chaînes
  • Entiers et nombres flottants
  • Booléens
  • Horodatages

Opérateurs

  • Égalité et appartenance à une liste
  • Comparaisons numériques
  • Combinaisons ET / OU
  • Négation

Exécution

  • Filtrage pendant le parcours du graphe
  • Rappel préservé sur les filtres sélectifs
  • Index secondaires sur les champs fréquents
  • Namespace comme premier niveau de partition

Performances

Latences mesurées, capacité d'un index et montée en charge

Latence

  • p50 et p99 mesurés en continu
  • p99 à 12 ms
  • Mesures prises côté serveur
  • Budget de latence défini par requête

Capacité

  • 1 milliard de vecteurs par index
  • Jusqu'à 4096 dimensions
  • Shards ajoutés sans interruption
  • Débit d'écriture soutenu pendant les requêtes

Montée en charge

  • Réplicas de lecture par région
  • Adaptation automatique au volume de requêtes
  • Isolation par namespace
  • Quotas par clé d'API

Exploitation

Régions, sécurité et intégration dans vos traitements existants

Régions

  • 8 régions disponibles
  • Résidence des données au choix
  • Réplication inter-régions optionnelle
  • Recherche multilingue sur 40 langues

Sécurité

  • Chiffrement au repos et en transit
  • Clés d'API à portée limitée
  • Journaux d'accès exportables
  • Accès réseau privé

Intégration

  • API HTTP et gRPC
  • Bibliothèques Python, TypeScript et Go
  • RAG, recherche produit, recommandation, déduplication
  • Documentation sur docs.vela.dev

Ce que nous mesurons

Valeurs relevées sur nos index de démonstration.

12 ms

Latence p99

Temps de réponse d'une recherche k-NN avec filtre par métadonnées, mesuré côté serveur.

1 Md

Vecteurs par index

Capacité d'un index unique, réparti automatiquement en shards à mesure des écritures.

99,2 %

Rappel

Part des voisins exacts retrouvés par le graphe HNSW sur nos jeux de validation.

40

Langues

Recherche multilingue sur des embeddings couvrant 40 langues dans un même namespace.

Créez votre premier index

Ouvrez un compte, envoyez vos premiers vecteurs et lancez une requête par similarité. La documentation détaille chaque appel.