프로젝트 소개
이 저장소는 API 비용을 최대 65%까지 절감하도록 설계된 프로덕션 준비 완료 단계의 계층형 LLM cascade router 구현체를 제공합니다. 이 시스템은 경량 분류기(Claude Haiku)를 사용하여 들어오는 쿼리를 분석하고, 이를 세 가지 성능 계층 중 하나로 라우팅합니다. 단순 포맷팅 및 추출을 위한 Gemini 2.5 Flash-Lite, 중간 수준의 분석 및 코딩을 위한 Claude Sonnet, 그리고 복잡한 추론을 위한 Claude Opus가 그 대상입니다. 이 패키지에는 핵심 라우팅 엔진, 분류 정확도를 측정하기 위한 평가 하네스, 그리고 실제 응답에 영향을 주지 않고 프로덕션 트래픽을 모니터링할 수 있는 shadow mode 스크립트가 포함되어 있습니다. Anthropic 및 Google Gemini API를 지원하며, 라우팅된 각 요청에 대해 상세한 토큰 사용량과 비용 분석을 제공합니다. 이 구현체는 대량의 AI 애플리케이션에서 모델 성능과 예산 제약 사이의 균형을 맞추고자 하는 개발자를 위해 설계되었습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.