프로젝트 소개

Smart SLM Router는 LLM 요청을 지능적으로 라우팅하여 API 비용을 절감하도록 설계된 비동기 로컬 프록시입니다. OpenAI API 사양과 완전히 호환되므로, 베이스 URL을 업데이트하는 것만으로 기존 OpenAI SDK 애플리케이션을 즉시 대체하여 사용할 수 있습니다. 주요 기능은 다음과 같습니다: - 로컬 의도 분류: 길이 휴리스틱, 토큰 정규식 패턴, 도구 호출 지표를 사용하여 네트워크 지연 없이 15ms 미만으로 라우팅을 결정합니다. - 동적 라우팅: 단순한 쿼리는 SLM(예: Ollama 또는 vLLM)으로 전달하고, 복잡하거나 기술적이거나 다단계 쿼리는 Tier-1 프런티어 모델(예: GPT-4o, Claude)로 에스컬레이션합니다. - 투명한 폴백: SLM이 연결 실패, 모델 거부 또는 JSON 파싱 오류를 반환할 경우 자동으로 요청을 재시도하고 프런티어 모델로 에스컬레이션합니다. - 전체 API 지원: 비스트리밍 및 스트리밍(SSE) 응답을 모두 지원합니다. - 관찰 가능성: 실시간 USD 비용 절감액, 요청 횟수 및 결정 지연 시간을 추적할 수 있는 `/metrics` 엔드포인트를 제공합니다. 이 시스템은 Python 3.12+ 및 FastAPI로 구축되었으며, 백엔드 URL, 모델 이름 및 토큰 임계값 설정을 위해 환경 변수를 활용합니다.