这个项目能做什么

LLM Gateway 是一个针对 OpenAI 聊天补全 API 的缓存反向代理,通过从 Redis 服务重复或语义相似的请求来降低成本。它支持两个缓存层级:精确匹配(标准化提示词)和语义匹配(通过 Redis Stack 使用向量搜索)。在嵌入之前,后续问题会被改写为独立形式,以实现跨对话匹配。该项目基于 FastAPI 和 Redis Stack 构建,并在响应中添加 X-Cache 头,让用户可以验证每个请求由哪个层级提供服务。本地设置需要 Python 3.12+、Docker 和 OpenAI API 密钥。它包含演示游乐场、负载测试和指标数据:精确命中约 2ms,语义命中约 250ms,未命中在 1–4 秒之间。设计为与 Redis Stack 配合以无状态容器方式部署,在公共演示中启用时支持预算控制、速率限制和内容审核。缓存条目一小时后过期;目前不支持流式传输,也不含身份验证层。