Sobre o projeto
O Smart SLM Router é um proxy local assíncrono projetado para reduzir os custos de API roteando inteligentemente as solicitações de LLM. Ele é totalmente compatível com a especificação da API da OpenAI, permitindo que sirva como um substituto direto para aplicações existentes do SDK da OpenAI apenas atualizando a URL base.
As principais capacidades incluem:
- Classificação de Intenção Local: Utiliza heurísticas de comprimento, padrões de regex de tokens e indicadores de chamadas de ferramentas para decidir o roteamento em menos de 15ms, sem incorrer em latência de rede.
- Roteamento Dinâmico: Direciona consultas simples para SLMs (por exemplo, via Ollama ou vLLM) e escala consultas complexas, técnicas ou de múltiplas etapas para modelos de fronteira Tier-1 (por exemplo, GPT-4o, Claude).
- Fallback Transparente: Tenta automaticamente e escala as solicitações para um modelo de fronteira se o SLM retornar uma falha de conexão, recusa do modelo ou erro de análise de JSON.
- Suporte Total de API: Suporta respostas tanto não-streaming quanto streaming (SSE).
- Observabilidade: Fornece um endpoint `/metrics` para rastrear a economia de custos em USD em tempo real, contagem de solicitações e latência de decisão.
O sistema é construído com Python 3.12+ e FastAPI, utilizando variáveis de ambiente para a configuração de URLs de backend, nomes de modelos e limites de tokens.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.