Sobre o projeto
O llm-failover-proxy fornece um único endpoint local (compatível com OpenAI) que gerencia uma cadeia priorizada de provedores de LLM. Se o modelo principal falhar devido a limites de taxa, erros ou timeouts, o proxy troca invisivelmente para o próximo modelo disponível na cadeia sem interromper a aplicação.
- Corrida Paralela: Se o modelo preferido estiver lento para responder (padrão 5 segundos), o proxy solicita o próximo modelo em paralelo, aceitando a primeira resposta utilizável para minimizar a latência.
- Listas de Modelos: Suporta várias listas nomeadas para diferentes finalidades, como cadeias separadas para chat e embeddings.
- Gerenciamento de Provedores: Inclui uma UI de terminal para configurar chaves de API, gerenciar a prioridade dos modelos e monitorar estatísticas de desempenho.
- Monitoramento de Saúde: Fornece endpoints (/health, /stats) para verificar a disponibilidade do serviço e rastrear as taxas de sucesso/falha por modelo.
- Operação em Segundo Plano: Pode ser instalado como um serviço de fundo que inicia automaticamente no login do sistema em Windows, macOS e Linux.
- Compatibilidade: Suporta streaming, chamadas de ferramenta/função, visão e modo JSON, encaminhando-as diretamente para os provedores.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.