Sobre el proyecto

Smart SLM Router es un proxy local asíncrono diseñado para reducir los costos de API mediante el enrutamiento inteligente de solicitudes de LLM. Es totalmente compatible con la especificación de la API de OpenAI, lo que permite que funcione como un reemplazo directo para las aplicaciones existentes del SDK de OpenAI simplemente actualizando la URL base. Las capacidades clave incluyen: - Clasificación de Intenciones Local: Utiliza heurísticas de longitud, patrones de regex de tokens e indicadores de llamadas a herramientas para decidir el enrutamiento en menos de 15 ms sin incurrir en latencia de red. - Enrutamiento Dinámico: Dirige consultas simples a SLMs (por ejemplo, a través de Ollama o vLLM) y escala consultas complejas, técnicas o de múltiples pasos a modelos frontera de Nivel 1 (por ejemplo, GPT-4o, Claude). - Respaldo Transparente: Reintenta y escala automáticamente las solicitudes a un modelo frontera si el SLM devuelve un fallo de conexión, un rechazo del modelo o un error de análisis de JSON. - Soporte Completo de API: Soporta respuestas tanto no transmitidas como transmitidas (SSE). - Observabilidad: Proporciona un endpoint `/metrics` para rastrear el ahorro de costos en USD en tiempo real, el recuento de solicitudes y la latencia de decisión. El sistema está construido con Python 3.12+ y FastAPI, utilizando variables de entorno para la configuración de URLs de backend, nombres de modelos y umbrales de tokens.