Об этом проекте
LLM Context Squeezer — это локальный API-прокси, созданный на FastAPI, который выступает посредником между приложениями и провайдерами LLM, совместимыми с OpenAI. Его главная цель — сократить потребление токенов и снизить затраты на API благодаря ряду автоматизированных методов оптимизации.
Динамическое сжатие контекста. Когда история диалога превышает заданный порог, прокси использует более дешёвую модель (например, gpt-4o-mini) для суммаризации самой старой части чата, внедряя компактное резюме в системный промпт.
Удаление избыточности. Двухпроходный движок применяет хэширование SHA-256 для точного сопоставления блоков кода и сходство Джардвика для нечёткого поиска почти идентичных текстовых фрагментов, заменяя повторяющиеся участки компактными маркерами.
Семантическое кэширование. Использует SQLite в режиме WAL для обеспечения точного и нечёткого сопоставления промптов, возвращая ответ из кэша и исключая лишние вызовы API.
Интеграция без изменений. Прокси реализует контракт OpenAI /v1/chat/completions, что позволяет работать с OpenAI Python SDK, LangChain, AutoGen и CrewAI — достаточно просто изменить base URL.
Прокси обеспечивает наблюдаемость через внедрённые поля в ответах, такие как x-squeezer-tokens-saved и x-squeezer-cache-hit, а также включает конечные точки для проверки работоспособности и статистики во время выполнения.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.