프로젝트 소개
llm-failover-proxy는 단일 로컬 엔드포인트(OpenAI 호환)를 제공하여 우선순위가 지정된 LLM 제공자 체인을 관리합니다. 기본 모델이 rate limit, 오류, 타임아웃 등으로 실패하면, 프록시는 애플리케이션을 중단하지 않고 체인의 다음 사용 가능한 모델로 자동 전환합니다.
주요 기능:
- 병렬 레이싱: 선호하는 모델이 응답이 느릴 경우(기본 5초), 프록시는 다음 모델을 병렬로 요청하여 첫 번째 사용 가능한 답변을 받아들여 지연 시간을 최소화합니다.
- 모델 목록: 다양한 목적을 위한 여러 이름 붙은 목록을 지원하며, 예를 들어 채팅과 임베딩용 별도 체인을 가질 수 있습니다.
- 제공자 관리: API 키 구성, 모델 우선순위 관리, 성능 통계 모니터링을 위한 터미널 UI를 포함합니다.
- 헬스 모니터링: 서비스 생존 여부를 확인하고 모델별 성공/실패율을 추적할 수 있는 /health, /stats 엔드포인트를 제공합니다.
- 백그라운드 운영: Windows, macOS, Linux에서 시스템 로그인 시 자동으로 시작되는 백그라운드 서비스로 설치할 수 있습니다.
- 호환성: 스트리밍, 툴/함수 호출, 비전, JSON 모드를 제공자에게 직접 전달하여 지원합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.