프로젝트 소개

LLM Router는 FastAPI 기반 백엔드 서비스로, 사용자의 프롬프트를 OpenAI, Google Gemini, Mistral 중 가장 적합한 대규모 언어 모델(LLM)에 동적으로 라우팅합니다. 시스템은 단순한 성능뿐만 아니라 유용성, 비용, 신뢰성을 균형을 맞추는 평가 체계를 사용합니다. 세 가지 라우팅 모드를 지원합니다: 완전 자동(시스템이 최적 모델 선택), 반자동(사용자가 공급업체 선택, 시스템이 모델 선택), 수동(사용자가 둘 다 지정). Mistral 임베딩과 코사인 유사성 기반 Retrieval-Augmented Generation(RAG)을 지원하며 .txt, .md, .pdf 파일을 처리합니다. /upload와 /clear-data 엔드포인트를 통해 문서 업로드 및 데이터 관리를 제공하며, 각 사용자는 컨텍스트 인식 응답을 위한 2턴 대화 메모리를 유지합니다. 아키텍처는 결정과 실행을 분리하여 라우팅 로직이 모델을 선택하면 클라이언트 모듈이 실제 API 호출을 처리합니다. 토큰 제한을 초과하는 모델은 disqualified됩니다. 응답에는 제공업체, 모델, 신뢰도, 사용된 토큰, 비용 추정치 등 메타데이터가 포함되며, WebSocket을 통한 실시간 스트리밍도 지원합니다. 향후 계획으로는 피드백 기반 튜닝, 로컬 LLM 통합, A/B 테스트가 있으며, 현재 의도 인식 라우팅, 비용 최적화, RAG 등 핵심 기능이 구현되어 활발히 개발 중입니다.