Sobre o projeto
LLM Router é um serviço backend baseado em FastAPI projetado para rotear dinamicamente prompts de usuário para o Modelo de Linguagem de Grande Escala (LLM) mais adequado entre OpenAI, Google Gemini e Mistral. Ele avalia os modelos usando um sistema de pontuação que equilibra utilidade, custo e confiabilidade — não apenas desempenho bruto.
O sistema suporta três modos de roteamento: totalmente automático (o sistema seleciona o melhor modelo), semiautomático (o usuário escolhe o provedor, o sistema escolhe o modelo) e manual (o usuário especifica ambos). Ele inclui Geração Aumentada por Recuperação (RAG) alimentada por embeddings do Mistral e recuperação por similaridade cosseno, suportando arquivos .txt, .md e .pdf. Os usuários podem fazer upload de documentos via /upload e limpar dados via /clear-data.
Cada usuário mantém uma memória de conversa de 2 turnos para respostas contextualizadas. A arquitetura separa a tomada de decisão da execução: a lógica de roteamento escolhe o modelo, enquanto os módulos de cliente lidam com as chamadas de API reais. Os modelos são desqualificados se excederem os limites de tokens. As respostas incluem metadados como provedor, modelo, confiança, tokens usados e estimativa de custo. O suporte a WebSocket permite streaming em tempo real.
Planos futuros incluem ajuste baseado em feedback, integração de LLM local e testes A/B. O projeto está ativamente em desenvolvimento, com recursos principais como roteamento consciente de intenção, otimização de custos e RAG já implementados.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.