このプロジェクトについて

LLM Context SqueezerはFastAPIで構築されたローカルAPIプロキシであり、アプリケーションとOpenAI互換のLLMプロバイダー間の仲介役として機能します。以下のいくつかの自動化された最適化手法を通じて、トークン消費量とAPIコストの削減を目指しています: - **動的コンテキスト圧縮**: 会話履歴が設定された閾値を超えた場合、プロキシはより安価なモデル(例:gpt-4o-mini)を使用してチャットの最も古い部分を要約し、高密度な要約をシステムプロンプトに注入します。 - **冗長性除去**: 2段階のエンジンがSHA-256ハッシュを使用してコードブロックの完全一致を検出し、Jaccard類似度を使用してほぼ重複するテキストのあいまい一致を行い、繰り返しをコンパクトなマーカーに置換します。 - **セマンティックキャッシング**: WALモードのSQLiteを利用して完全一致およびあいまいなプロンプトマッチングを提供し、キャッシュされた応答を返すことで冗長なAPI呼び出しをeliminateします。 - **ドロップイン統合**: OpenAIの/v1/chat/completions契約を実装しており、ベースURLを変更するだけでOpenAI Python SDK、LangChain、AutoGen、CrewAIと連携できます。 プロキシは`x-squeezer-tokens-saved`や`x-squeezer-cache-hit`などの応答フィールドを注入して可観測性を提供し、ヘルスチェックやランタイム統計用のエンドポイントも含んでいます。