这个项目能做什么
LLM Context Squeezer是一个使用FastAPI构建的本地API代理,充当应用程序与OpenAI兼容的LLM提供商之间的中间层。它通过多种自动化优化技术旨在降低token消耗和API成本:
- **动态上下文压缩**:当对话历史超过设定阈值时,代理会使用更便宜的模型(如gpt-4o-mini)对最早的聊天内容进行摘要,并将紧凑摘要注入系统提示词。
- **冗余剥离**:双遍处理引擎使用SHA-256哈希对代码块进行精确匹配,并使用Jaccard相似度对近乎重复的文本进行模糊匹配,将重复内容替换为紧凑标记。
- **语义缓存**:利用WAL模式的SQLite实现精确和模糊的提示词匹配,返回缓存响应以消除冗余的API调用。
- **即插即用集成**:实现OpenAI /v1/chat/completions协议,只需更改base URL即可与OpenAI Python SDK、LangChain、AutoGen和CrewAI兼容。
代理通过注入响应字段(如`x-squeezer-tokens-saved`和`x-squeezer-cache-hit`)提供可观测性,并提供健康检查和运行时统计端点。
评论
0 评分人数达到10人后显示
登录后参与讨论。