À propos du projet
llm-router est un proxy inverse léger en binaire unique conçu pour optimiser les coûts lors de l'utilisation d'API LLM comme Claude. Il se place entre votre application et les fournisseurs de LLM, acheminant intelligemment chaque requête vers le modèle le moins cher capable de la traiter — Haiku pour les requêtes simples, Sonnet pour les tâches modérées, ou Opus pour le raisonnement complexe. Il inclut un cache sémantique (utilisant la similarité Jaccard sans embeddings externes), la déduplication des requêtes concurrentes identiques, et l'exécution de workflows multi-étapes définis comme des DAG avec suivi des dépendances et exécution parallèle. Le système suit en temps réel la santé et la charge des backends, évitant automatiquement les modèles dégradés ou surchargés. Il prend en charge un routage assisté par ML avec calibration par feedback et fournit des rapports détaillés de coûts et d'économies. Configurables via YAML, il fonctionne avec Anthropic, Ollama, vLLM ou tout backend compatible OpenAI. Construit à partir de techniques issues de 7 articles de recherche et de systèmes open source, il ne nécessite aucune dépendance externe et comprend 57 tests. Idéal pour réduire les dépenses API tout en maintenant performance et résilience en environnement de production.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.