Sobre el proyecto
LLM Router es un servicio backend basado en FastAPI diseñado para enrutar dinámicamente los prompts de los usuarios al modelo de lenguaje grande (LLM) más adecuado entre OpenAI, Google Gemini y Mistral. Evalúa los modelos mediante un sistema de puntuación que equilibra utilidad, costo y fiabilidad, no solo el rendimiento bruto.
El sistema admite tres modos de enrutamiento: auto completo (el sistema selecciona el mejor modelo), semi-auto (el usuario elige el proveedor y el sistema selecciona el modelo) y manual (el usuario especifica ambos).
Incluye Generación Aumentada con Recuperación (RAG) impulsada por embeddings de Mistral y recuperación por similitud coseno, con soporte para archivos .txt, .md y .pdf. Los usuarios pueden cargar documentos a través de /upload y borrar datos mediante /clear-data. Cada usuario mantiene una memoria de conversación de 2 turnos para respuestas con conciencia del contexto.
La arquitectura separa la toma de decisiones de la ejecución: la lógica de enrutamiento elige el modelo, mientras que los módulos cliente gestionan las llamadas API reales. Los modelos se descalifican si superan los límites de tokens. Las respuestas incluyen metadatos como proveedor, modelo, confianza, tokens utilizados y estimación de costo. El soporte WebSocket permite streaming en tiempo real.
Los planes futuros incluyen ajuste basado en retroalimentación, integración de LLM locales y pruebas A/B. El proyecto está en desarrollo activo, con funcionalidades principales como enrutamiento consciente de intenciones, optimización de costos y RAG ya implementadas.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.