Sobre o projeto

O Smart SLM Router é um proxy local assíncrono projetado para reduzir os custos de API roteando inteligentemente as solicitações de LLM. Ele é totalmente compatível com a especificação da API da OpenAI, permitindo que sirva como um substituto direto para aplicações existentes do SDK da OpenAI apenas atualizando a URL base. As principais capacidades incluem: - Classificação de Intenção Local: Utiliza heurísticas de comprimento, padrões de regex de tokens e indicadores de chamadas de ferramentas para decidir o roteamento em menos de 15ms, sem incorrer em latência de rede. - Roteamento Dinâmico: Direciona consultas simples para SLMs (por exemplo, via Ollama ou vLLM) e escala consultas complexas, técnicas ou de múltiplas etapas para modelos de fronteira Tier-1 (por exemplo, GPT-4o, Claude). - Fallback Transparente: Tenta automaticamente e escala as solicitações para um modelo de fronteira se o SLM retornar uma falha de conexão, recusa do modelo ou erro de análise de JSON. - Suporte Total de API: Suporta respostas tanto não-streaming quanto streaming (SSE). - Observabilidade: Fornece um endpoint `/metrics` para rastrear a economia de custos em USD em tempo real, contagem de solicitações e latência de decisão. O sistema é construído com Python 3.12+ e FastAPI, utilizando variáveis de ambiente para a configuração de URLs de backend, nomes de modelos e limites de tokens.