Déroulé en 9 étapes : Client, puis API FastAPI, puis Isolation tenant, puis Pipeline RAG, puis Qdrant · pgvector, puis PostgreSQL, puis Inférence LLM, puis Streaming, puis Monitoring · logs. Utilisez les flèches du clavier pour passer d'une étape à l'autre.
Le logiciel métier consomme le moteur IA via API. Les données restent dans l'infrastructure de l'entreprise.
Point d'entrée unique : authentification JWT, validation des requêtes et endpoints d'intégration.
Chaque requête est confinée au périmètre de son tenant : contrôles d'accès et isolation des données entre clients.
Recherche sémantique dans la base de connaissances métier, puis construction du contexte et du prompt envoyés au modèle.
Index des documents découpés et vectorisés (embeddings), interrogé par similarité pour la recherche sémantique.
Données relationnelles de l'application, consultées par le pipeline en complément de la recherche vectorielle.
Modèle de langage servi localement avec vLLM : aucune donnée n'est envoyée à un service cloud externe.
La réponse est renvoyée au client au fil de la génération, ce qui réduit fortement la latence perçue.
Supervision de toute la chaîne : logs, performances et événements de sécurité.