À propos du projet

llm-router-gate est une CLI Python et un SDK conçus pour les développeurs qui ont besoin d’une visibilité précise sur les appels d’API LLM en une seule requête. Il achemine les requêtes vers Anthropic, OpenRouter ou des serveurs locaux llama.cpp, diffuse les réponses tout en exposant la couche HTTP complète — y compris les en‑têtes, les événements SSE bruts et la charge utile finale. Il fournit le nombre de tokens et des estimations de coût avec provenance, aidant les utilisateurs à comparer les fournisseurs, déboguer les réponses vides ou valider les coûts des prompts avant le déploiement. L’outil évite délibérément l’historique de chat, les nouvelles tentatives ou les prompts système, fonctionnant comme « curl -v » pour les LLMs avec une calculatrice intégrée. Il prend en charge des bascules de raisonnement à trois états, distingue les canaux de réponse et de raisonnement dans le flux, et rapporte l’utilisation des tokens à partir des champs serveur autoritaires ou de heuristiques de secours. Note de sécurité : il journalise tous les en‑têtes, y compris les clés API — les masquer avant de les partager. Nécessite Python ≥3.14 et utilise uv pour la gestion des dépendances. Idéal pour le débogage, le benchmarking ou la validation du comportement des LLMs à travers différents back‑ends sans couches d’abstraction.