프로젝트 소개

llm-router-gate는 단일 LLM API 호출에 대한 정확한 가시성이 필요한 개발자를 위한 Python CLI 및 SDK입니다. Anthropic, OpenRouter 또는 로컬 llama.cpp 서버로 요청을 라우팅하며 스트리밍 응답을 제공하면서 헤더, 원시 SSE 이벤트, 최종 페이로드를 포함한 전체 HTTP 계층을 노출합니다. provenance와 함께 토큰 수 및 비용 추정치를 제공해 프로바이더 비교, 빈 응답 디버깅, 배포 전 프롬프트 비용 검증에 도움을 줍니다. 채팅 기록, 재시도, 시스템 프롬프트를 의도적으로 배제하고 'curl -v'를 LLM용으로 실행하는 동시에 내장 계산기를 제공합니다. 삼진법 추론 전환을 지원하고, 스트리밍 출력에서 답변과 추론 채널을 구분하며, 권위 있는 서버 필드 또는 폴백 휴리스틱에서 토큰 사용량을 보고합니다. 보안 주의: 모든 헤더(API 키 포함)를 로깅하므로 공유 전 적색 처리가 필요합니다. Python ≥3.14가 필요하며 의존성 관리에 uv를 사용합니다. 추상화 레이어 없이 백엔드 간 LLM 동작을 디버깅, 벤치마킹 또는 검증하는 데 이상적입니다.