Sobre el proyecto

Este repositorio proporciona una implementación lista para producción de un enrutador en cascada de LLM por niveles, diseñado para reducir los gastos de API hasta en un 65%. El sistema emplea un clasificador ligero (Claude Haiku) para analizar las consultas entrantes y dirigirlas a uno de tres niveles de rendimiento: Gemini 2.5 Flash-Lite para formateo y extracción simples, Claude Sonnet para análisis y codificación moderados, y Claude Opus para razonamiento complejo. El paquete incluye un motor de enrutamiento central, un entorno de evaluación para medir la precisión de la clasificación y un script de modo shadow para monitorear el tráfico de producción sin afectar las respuestas en vivo. Es compatible con las API de Anthropic y Google Gemini, y proporciona desgloses detallados del uso de tokens y costos para cada solicitud enrutada. La implementación está diseñada para desarrolladores que buscan equilibrar el rendimiento del modelo con las restricciones presupuestarias en aplicaciones de IA de alto volumen.