À propos du projet
Smart SLM Router est un proxy local asynchrone conçu pour réduire les coûts d'API en routant intelligemment les requêtes LLM. Il est entièrement compatible avec la spécification de l'API OpenAI, ce qui lui permet de servir de remplacement direct pour les applications utilisant le SDK OpenAI via la simple mise à jour de l'URL de base.
Les capacités clés incluent :
- Classification locale des intentions : utilise des heuristiques de longueur, des modèles regex de jetons et des indicateurs d'appels d'outils pour décider du routage en moins de 15 ms sans latence réseau.
- Routage dynamique : dirige les requêtes simples vers des SLM (par exemple, via Ollama ou vLLM) et escalade les requêtes complexes, techniques ou multi-étapes vers des modèles de pointe de Tier-1 (par exemple, GPT-4o, Claude).
- Repli transparent : tente automatiquement de renvoyer et d'escalader les requêtes vers un modèle de pointe si le SLM renvoie un échec de connexion, un refus du modèle ou une erreur d'analyse JSON.
- Support API complet : prend en charge les réponses non-streaming et streaming (SSE).
- Observabilité : fournit un point de terminaison `/metrics` pour suivre en temps réel les économies de coûts en USD, le nombre de requêtes et la latence de décision.
Le système est construit avec Python 3.12+ et FastAPI, utilisant des variables d'environnement pour la configuration des URL d'arrière-plan, des noms de modèles et des seuils de jetons.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.