Об этом проекте

llm-failover-proxy предоставляет единую локальную точку доступа (совместимую с OpenAI), которая управляет приоритетной цепочкой провайдеров LLM. Если основная модель выходит из строя из‑за ограничений по частоте запросов, ошибок или тайм‑аутов, прокси незаметно переключается на следующую доступную модель в цепочке без прерывания работы приложения. Ключевые возможности включают: - Параллельные гонки: если предпочтительная модель отвечает медленно (по умолчанию 5 секунд), прокси запрашивает следующую модель параллельно, принимая первый пригодный ответ для минимизации задержки. - Списки моделей: поддерживает несколько именованных списков для разных целей, например отдельные цепочки для чата и эмбеддингов. - Управление провайдерами: включает терминальный UI для настройки API‑ключей, управления приоритетом моделей и мониторинга статистики производительности. - Мониторинг состояния: предоставляет эндпоинты (/health, /stats) для проверки живости сервиса и отслеживания коэффициентов успеха/неудач по каждой модели. - Фоновая работа: может устанавливаться как фоновый сервис, автоматически запускающийся при входе в систему на Windows, macOS и Linux. - Совместимость: поддерживает потоковую передачу, вызов инструментов/функций, работу с визуальными данными и JSON‑режим, передавая их напрямую провайдерам.