这个项目能做什么

LLM Cache Proxy 是一个基于 FastAPI 构建的 OpenAI API 缓存层。它拦截发往 OpenAI chat completion 端点的请求,并为相同请求提供缓存响应,从而在开发过程中帮助降低 API 成本并改善响应延迟。 主要功能包括: - 缓存 OpenAI API 响应,支持流式和非流式模式。 - 兼容 OpenAI API 的 chat completion 端点。 - 持久化缓存存储,可在重启后保留数据。 - 支持通过 Python 或 Docker 部署。 - 提供两个独立端点:/cache/chat/completions 用于缓存请求,/chat/completions 用于未缓存请求。