À propos du projet

llm-failover-proxy fournit un point d'accès local unique (compatible OpenAI) qui gère une chaîne priorisée de fournisseurs de LLM. Si le modèle principal échoue en raison de limites de taux, d'erreurs ou de délais d'attente, le proxy bascule invisiblement vers le modèle suivant disponible dans la chaîne sans interrompre l'application. Principales fonctionnalités : - Course parallèle : si le modèle préféré répond lentement (défaut 5 secondes), le proxy interroge le modèle suivant en parallèle, acceptant la première réponse exploitable pour minimiser la latence. - Listes de modèles : prend en charge plusieurs listes nommées pour différents usages, comme des chaînes séparées pour le chat et les embeddings. - Gestion des fournisseurs : inclut une interface utilisateur terminale pour configurer les clés API, gérer la priorité des modèles et surveiller les statistiques de performance. - Surveillance de santé : fournit des points d'accès (/health, /stats) pour vérifier la disponibilité du service et suivre les taux de succès/échec par modèle. - Fonctionnement en arrière‑plan : peut être installé comme service en arrière‑plan qui démarre automatiquement à la connexion du système sous Windows, macOS et Linux. - Compatibilité : prend en charge le streaming, l’appel d’outils/fonctions, la vision et le mode JSON en les transmettant directement aux fournisseurs.