Об этом проекте

LLM Context Squeezer — это локальный API-прокси, созданный на FastAPI, который выступает посредником между приложениями и провайдерами LLM, совместимыми с OpenAI. Его главная цель — сократить потребление токенов и снизить затраты на API благодаря ряду автоматизированных методов оптимизации. Динамическое сжатие контекста. Когда история диалога превышает заданный порог, прокси использует более дешёвую модель (например, gpt-4o-mini) для суммаризации самой старой части чата, внедряя компактное резюме в системный промпт. Удаление избыточности. Двухпроходный движок применяет хэширование SHA-256 для точного сопоставления блоков кода и сходство Джардвика для нечёткого поиска почти идентичных текстовых фрагментов, заменяя повторяющиеся участки компактными маркерами. Семантическое кэширование. Использует SQLite в режиме WAL для обеспечения точного и нечёткого сопоставления промптов, возвращая ответ из кэша и исключая лишние вызовы API. Интеграция без изменений. Прокси реализует контракт OpenAI /v1/chat/completions, что позволяет работать с OpenAI Python SDK, LangChain, AutoGen и CrewAI — достаточно просто изменить base URL. Прокси обеспечивает наблюдаемость через внедрённые поля в ответах, такие как x-squeezer-tokens-saved и x-squeezer-cache-hit, а также включает конечные точки для проверки работоспособности и статистики во время выполнения.