프로젝트 소개

LLM Cache Proxy는 FastAPI로 구축된 OpenAI API용 캐싱 계층입니다. OpenAI 채팅 완료 엔드포인트로의 요청을 가로채고 동일한 요청에 대해 캐시된 응답을 제공하므로, 개발 중 API 비용 절감 및 응답 지연 시간 개선에 도움이 됩니다. 주요 기능은 다음과 같습니다: - 스트리밍 및 비스트리밍 모드 모두 지원되는 OpenAI API 응답 캐싱 - 채팅 완료 엔드포인트에 대한 OpenAI API 호환성 - 재시작 후에도 데이터를 유지하는 영구 캐시 저장소 - Python 또는 Docker를 통한 배포 옵션 - 캐시된 요청용 `/cache/chat/completions`과 비캐시된 요청용 `/chat/completions` 두 가지 별도의 엔드포인트