À propos de Vela

Un moteur de recherche sémantique managé, conçu pour interroger des vecteurs à grande échelle sans opérer d'infrastructure

Un constat technique

La recherche par mots-clés atteint ses limites dès qu'il faut retrouver du sens. Deux formulations proches ne partagent pas toujours un seul terme commun.

Les modèles d'embeddings résolvent ce problème. Ils projettent textes, images ou signaux dans un espace vectoriel où la proximité traduit la similarité. Reste à interroger ces vecteurs vite, et à l'échelle.

C'est le rôle de Vela. Vous envoyez vos embeddings, nous les indexons, et nous répondons aux requêtes par similarité en quelques millisecondes, jusqu'au milliard de vecteurs par index. Une seule API, aucun cluster à administrer.

2021 Premier index en production
2022 Ouverture de la deuxième région
2024 Passage au milliard de vecteurs par index
2026 Huit régions et filtrage hybride généralisé

Une seule API

Indexation, filtrage et requêtes derrière un même point d'entrée

Service managé

Aucun cluster à dimensionner, à répliquer ni à mettre à jour

Mesure

Latence et rappel publiés, vérifiables sur vos propres jeux

Coûts lisibles

Une facturation liée aux vecteurs stockés et aux requêtes servies

Nos principes d'ingénierie

Trois engagements qui guident chaque décision technique

01

Latence prévisible

12 ms au p99 sur un index d'un milliard de vecteurs. La latence est tenue sous charge, pas seulement en moyenne.

02

Rappel mesuré

99,2 % de rappel face à une recherche exhaustive. Le compromis vitesse-précision reste réglable index par index.

03

Coûts lisibles

Une seule unité de facturation, vecteurs stockés et requêtes servies. Pas de machines à provisionner à l'avance.

Interfaces disponibles dans votre pile

Comment le service est construit

Trois choix d'architecture qui expliquent le comportement du moteur

Index isolés

STOCKAGE

Chaque index possède ses propres ressources et son propre schéma de métadonnées, jusqu'à 4096 dimensions par vecteur.

Filtrage hybride

REQUÊTES

Les filtres sur métadonnées sont appliqués pendant le parcours du graphe, pas après. Le rappel reste stable même très filtré.

Réplication régionale

EXPLOITATION

Les données restent dans la région choisie. Les mises à jour de version sont progressives et sans interruption de service.

12 ms Latence p99
99,2 % Rappel mesuré
40 Langues indexées
8 Régions disponibles

Vela en chiffres

0 milliard de vecteurs par index
0 max dimensions par vecteur
0 ms de latence au p99
0 régions de déploiement

Envie d'aller plus loin ?

Réservez une session technique avec notre équipe ou écrivez-nous pour discuter de votre cas d'usage.