这个项目能做什么
LLM Cache Proxy 是一个基于 FastAPI 构建的 OpenAI API 缓存层。它拦截发往 OpenAI chat completion 端点的请求,并为相同请求提供缓存响应,从而在开发过程中帮助降低 API 成本并改善响应延迟。
主要功能包括:
- 缓存 OpenAI API 响应,支持流式和非流式模式。
- 兼容 OpenAI API 的 chat completion 端点。
- 持久化缓存存储,可在重启后保留数据。
- 支持通过 Python 或 Docker 部署。
- 提供两个独立端点:/cache/chat/completions 用于缓存请求,/chat/completions 用于未缓存请求。
评论
0 评分人数达到10人后显示
登录后参与讨论。