Sobre el proyecto

llm-router-gate es una CLI y SDK de Python diseñada para desarrolladores que necesitan visibilidad precisa de llamadas API de LLM de un solo disparo. Enruta solicitudes a Anthropic, OpenRouter o servidores locales de llama.cpp, transmitiendo respuestas mientras expone toda la capa HTTP — incluidos encabezados, eventos SSE sin procesar y la carga útil final. Proporciona recuentos de tokens y estimaciones de costos con procedencia, ayudando a los usuarios a comparar proveedores, depurar respuestas vacías o validar los costos de los prompts antes del despliegue. La herramienta evita deliberadamente el historial de chat, reintentos o prompts del sistema, funcionando como "curl -v" para LLMs más una calculadora incorporada. Soporta conmutadores de razonamiento de tres estados, distingue entre canales de respuesta y razonamiento en la salida en streaming, y reporta el uso de tokens a partir de campos autoritativos del servidor o heurísticas de respaldo. Nota de seguridad: registra todos los encabezados, incluidas las claves API — redacte antes de compartir. Requiere Python ≥3.14 y usa uv para la gestión de dependencias. Ideal para depurar, hacer benchmarking o validar el comportamiento de LLMs a través de diferentes backends sin capas de abstracción.