프로젝트 소개
LLM Cache Proxy는 FastAPI로 구축된 OpenAI API용 캐싱 계층입니다. OpenAI 채팅 완료 엔드포인트로의 요청을 가로채고 동일한 요청에 대해 캐시된 응답을 제공하므로, 개발 중 API 비용 절감 및 응답 지연 시간 개선에 도움이 됩니다.
주요 기능은 다음과 같습니다:
- 스트리밍 및 비스트리밍 모드 모두 지원되는 OpenAI API 응답 캐싱
- 채팅 완료 엔드포인트에 대한 OpenAI API 호환성
- 재시작 후에도 데이터를 유지하는 영구 캐시 저장소
- Python 또는 Docker를 통한 배포 옵션
- 캐시된 요청용 `/cache/chat/completions`과 비캐시된 요청용 `/chat/completions` 두 가지 별도의 엔드포인트
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.