Sobre el proyecto

llm-failover-proxy ofrece un único punto final local (compatible con OpenAI) que gestiona una cadena priorizada de proveedores de LLM. Si el modelo principal falla por límites de velocidad, errores o tiempos de espera, el proxy cambia invisiblemente al siguiente modelo disponible en la cadena sin interrumpir la aplicación. Capacidades clave incluyen: - Carrera paralela: Si un modelo preferido responde lentamente (por defecto 5 segundos), el proxy solicita el siguiente modelo en paralelo, aceptando la primera respuesta utilizable para minimizar la latencia. - Listas de modelos: Soporta múltiples listas nombradas para diferentes propósitos, como cadenas separadas para chat y embeddings. - Gestión de proveedores: Incluye una UI de terminal para configurar claves API, gestionar la prioridad de los modelos y monitorizar estadísticas de rendimiento. - Monitoreo de salud: Proporciona endpoints (/health, /stats) para comprobar la disponibilidad del servicio y rastrear tasas de éxito/fallo por modelo. - Operación en segundo plano: Puede instalarse como un servicio de fondo que se inicia automáticamente al iniciar sesión en Windows, macOS y Linux. - Compatibilidad: Soporta streaming, llamadas a herramientas/funciones, visión y modo JSON al pasarlos directamente a los proveedores.