Sobre o projeto

llm-router-gate é um CLI e SDK em Python projetado para desenvolvedores que precisam de visibilidade precisa em chamadas de API LLM de única execução. Ele encaminha solicitações para Anthropic, OpenRouter ou servidores locais llama.cpp, transmitindo respostas enquanto expõe toda a camada HTTP — incluindo cabeçalhos, eventos SSE brutos e payloads finais. Fornece contagem de tokens e estimativas de custo com procedência, ajudando os usuários a comparar provedores, depurar respostas vazias ou validar custos de prompts antes da implantação. A ferramenta evita deliberadamente histórico de chat, tentativas de nova chamada ou prompts de sistema, funcionando como um "curl -v" para LLMs mais uma calculadora integrada. Suporta alternâncias de raciocínio em três estados, distingue entre canais de resposta e raciocínio na saída em streaming e relata o uso de tokens a partir de campos autoritativos do servidor ou heurísticas de fallback. Nota de segurança: registra todos os cabeçalhos, inclusive chaves de API — remova antes de compartilhar. Requer Python ≥3.14 e usa uv para gerenciamento de dependências. Ideal para depuração, benchmarking ou validação do comportamento de LLMs em diferentes back‑ends sem camadas de abstração.