프로젝트 소개
LLM Context Squeezer는 FastAPI로 구축된 로컬 API 프록시로, 애플리케이션과 OpenAI 호환 LLM 제공업체 간의 중개자 역할을 합니다. 몇 가지 자동화된 최적화 기법을 통해 토큰 소비와 API 비용을 줄이는 것을 목표로 합니다:
- **동적 컨텍스트 압축**: 대화 기록이 설정된 임계값을 초과하면, 프록시는 저렴한 모델(예: gpt-4o-mini)을 사용해 채팅의 가장 오래된 부분을 요약하고, 압축된 요약을 시스템 프롬프트에 주입합니다.
- **중복 제거**: 두 번의 패스를 거치는 엔진은 코드 블록의 경우 SHA-256 해시를, 거의 유사한 텍스트의 경우 Jaccard 유사도를 사용해 정확한 및 fuzz 매칭을 수행한 후, 반복되는 내용을 압축된 마커로 대체합니다.
- **의미 기반 캐싱**: WAL 모드의 SQLite를 활용해 정확 및 fuzzy 프롬프트 매칭을 제공하여, 캐시된 응답을 반환함으로써 중복 API 호출을 제거합니다.
- **드롭인 통합**: OpenAI /v1/chat/completions 계약 방식을 구현하여, base URL만 변경하면 OpenAI Python SDK, LangChain, AutoGen, CrewAI와 바로 호환됩니다.
프록시는 `x-squeezer-tokens-saved`, `x-squeezer-cache-hit`과 같은 응답 필드를 주입하여 관찰 가능성을 제공하고, 헬스 체크 및 런타임 통계용 엔드포인트도 포함합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.