Об этом проекте
llm-failover-proxy предоставляет единую локальную точку доступа (совместимую с OpenAI), которая управляет приоритетной цепочкой провайдеров LLM. Если основная модель выходит из строя из‑за ограничений по частоте запросов, ошибок или тайм‑аутов, прокси незаметно переключается на следующую доступную модель в цепочке без прерывания работы приложения.
Ключевые возможности включают:
- Параллельные гонки: если предпочтительная модель отвечает медленно (по умолчанию 5 секунд), прокси запрашивает следующую модель параллельно, принимая первый пригодный ответ для минимизации задержки.
- Списки моделей: поддерживает несколько именованных списков для разных целей, например отдельные цепочки для чата и эмбеддингов.
- Управление провайдерами: включает терминальный UI для настройки API‑ключей, управления приоритетом моделей и мониторинга статистики производительности.
- Мониторинг состояния: предоставляет эндпоинты (/health, /stats) для проверки живости сервиса и отслеживания коэффициентов успеха/неудач по каждой модели.
- Фоновая работа: может устанавливаться как фоновый сервис, автоматически запускающийся при входе в систему на Windows, macOS и Linux.
- Совместимость: поддерживает потоковую передачу, вызов инструментов/функций, работу с визуальными данными и JSON‑режим, передавая их напрямую провайдерам.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.