프로젝트 소개

LLM Gateway는 Redis에서 반복되거나 의미상 유사한 질문을 서빙하여 비용을 절감하는 OpenAI 채팅 완료 API용 캐싱 역방향 프록시입니다. 프롬프트 정규화를 통한 정확 일치, Redis Stack을 사용한 벡터 검색 기반 의미적 일치라는 두 가지 캐시 계층을 지원합니다. 이어지는 질문들은 임베딩 전 독립형 문장으로 재작성되어 대화 간 매칭을 가능하게 합니다. FastAPI와 Redis Stack으로 구축되었으며, 각 요청이 어느 계층에서 처리되었는지 확인하기 위해 응답에 X-Cache 헤더를 추가합니다. 로컬 설정에는 Python 3.12+, Docker, OpenAI 키가 필요합니다. 데모 플레이그라운드, 부하 테스트, 그리고 정확 일치 약 2ms, 의미적 일치 약 250ms, 미스 시 1~4초의 성능 메트릭스를 포함합니다. Redis Stack과 함께 무상태 컨테이너로 배포하도록 설계되었으며, 공개 데모 시 비예산 제어, 속도 제한, 중재 기능을 지원합니다. 캐시 항목은 1시간 후 만료되며, 스트리밍 지원이나 인증 레이어는 포함되어 있지 않습니다.