프로젝트 소개

Council Router는 Ollama, OpenAI, Anthropic, Gemini 및 LiteLLM을 통한 100개 이상의 기타 백엔드를 포함한 여러 대규모 언어 모델(LLM) 백엔드에 대한 액세스를 단일 OpenAI 호환 API 엔드포인트를 통해 통합하도록 설계된 지능형 프록시 서버입니다. 이 시스템은 우선순위 기반 선택, 라운드 로빈 부하 분산, 자동 모델 폴백 체인과 같은 기능을 통해 이기종 LLM 서버 간의 원활한 라우팅을 가능하게 합니다. 또한 지연 시간을 최소화하기 위해 요청된 모델이 이미 VRAM에 로드된 백엔드를 지능적으로 선호합니다. 돋보이는 기능은 "LLM Council" 모드로, 여러 모델이나 페르소나가 사용자의 쿼리에 대해 병렬로 심의한 후 최종 답변을 합성할 수 있게 하여 복잡한 의사 결정이나 코드 리뷰 시나리오에 유용합니다. 내장 템플릿에는 다양한 분석, 코드 리뷰 및 토론 모드가 포함되어 있으며, 사용자 정의 YAML 정의 카운슬을 지원합니다. 모든 응답은 중간 사고 토큰을 포함하여 오프라인 분석을 위해 압축된 SQLite에 선택적으로 저장됩니다. Prometheus 메트릭은 요청 속도, 지연 시간, 토큰 사용량 및 백엔드 상태를 추적하며, Docker Compose를 통해 사전 구성된 Grafana 대시보드를 사용할 수 있습니다. 또한 이 서비스는 OpenAI 엔드포인트와 함께 네이티브 Ollama 엔드포인트를 노출하여 Open WebUI와 같은 도구와 호환됩니다. 보안 측면에서 추론 엔드포인트는 기본적으로 인증되지 않으며(신뢰할 수 있는 네트워크용), 관리자 엔드포인트는 Bearer 토큰이 필요합니다. 응답 저장은 기본적으로 활성화되어 있지만 암호화되지 않으므로 민감한 프롬프트는 주의해서 다뤄야 합니다. 이 프로젝트는 FastAPI로 구축되었으며 Python 3.12 이상에서 실행되고 전체 테스트 커버리지(127개 테스트 통과)를 포함합니다. Docker Compose는 모니터링 기능이 포함된 즉시 실행 가능한 스택을 제공합니다. 구성은 YAML을 통해 관리되며 환경 변수 주입을 지원합니다. 개발 도구로는 린팅, 포맷팅 및 테스트 스크립트가 포함되어 있습니다.