À propos du projet
LLM Router est un service backend basé sur FastAPI conçu pour router dynamiquement les invites utilisateurs vers le modèle de langage large (LLM) le plus adapté parmi OpenAI, Google Gemini et Mistral. Il évalue les modèles à l'aide d'un système de notation qui équilibre utilité, coût et fiabilité — pas seulement les performances brutes. Le système prend en charge trois modes de routage : automatique complet (le système sélectionne le meilleur modèle), semi-automatique (l'utilisateur choisit le fournisseur, le système choisit le modèle) et manuel (l'utilisateur spécifie les deux). Il inclut la Génération Augmentée par Récupération (RAG) alimentée par les embeddings Mistral et la récupération par similarité cosinus, prenant en charge les fichiers .txt, .md et .pdf. Les utilisateurs peuvent téléverser des documents via /upload et effacer les données via /clear-data. Chaque utilisateur conserve une mémoire de conversation sur 2 tours pour des réponses contextuelles. L'architecture sépare la prise de décision de l'exécution : la logique de routage choisit le modèle, tandis que les modules client gèrent les appels API réels. Les modèles sont disqualifiés s'ils dépassent les limites de tokens. Les réponses incluent des métadonnées telles que le fournisseur, le modèle, la confiance, les tokens utilisés et une estimation du coût. La prise en charge de WebSocket permet le streaming en temps réel. Les futurs plans incluent le réglage basé sur les retours, l'intégration de LLM locaux et les tests A/B. Le projet est activement en développement, avec des fonctionnalités principales comme le routage conscient de l'intention, l'optimisation des coûts et RAG déjà implémentées.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.