इस प्रोजेक्ट के बारे में
LLM Context Squeezer एक लोकल API प्रॉक्सी है जिसे FastAPI के साथ बनाया गया है जो ऐप्स और OpenAI-कम्पैटिबल LLM प्रोवाइडर्स के बीच एक मध्यस्थ के रूप में कार्य करता है। यह कई स्वचालित ऑप्टिमाइजेशन तकनीकों के माध्यम से टोकन उपभोग और API लागत को कम करने का लक्ष्य रखता है:
- **डायनेमिक कॉन्टेक्स्ट कंप्रेशन**: जब बातचीत का इतिहास एक निर्धारित थ्रेसहोल्ड से अधिक हो जाता है, तो प्रॉक्सी एक सस्ते मॉडल (जैसे gpt-4o-mini) का उपयोग सबसे पुराने चैट हिस्से का सारांश बनाने के लिए करता है, जो एक सघन सारांश को सिस्टम प्रॉम्प्ट में इंजेक्ट करता है।
- **रिडंडेंसी स्ट्रिपिंग**: एक दो-पास इंजन शॉर्ट-कोड ब्लॉक्स के बिल्कुल मिलते-जुलते मेल के लिए SHA-256 हैशिंग और लगभग दोहराए गए टेक्स्ट के फजी मैचिंग के लिए Jaccard सिमिलैरिटी का उपयोग करता है, दोहराव को कॉम्पैक्ट मार्कर्स से बदल देता है।
- **सेमान्टिक कैशिंग**: SQLite को WAL मोड में उपयोग करके यह एक्सैक्ट और फजी प्रॉम्प मैचिंग प्रदान करता है, अनावश्यक API कॉल को खत्म करने के लिए कैश किए गए रिस्पॉन्स लौटाता है।
- **Drop-in इंटीग्रेशन**: यह OpenAI /v1/chat/completions अनुबंध को लागू करता है, जिससे OpenAI Python SDK, LangChain, AutoGen, और CrewAI के साथ बस बेस URL बदलने पर काम करना संभव हो जाता है।
प्रॉक्सी `x-squeezer-tokens-saved` और `x-squeezer-cache-hit` जैसे इंजेक्टेड रिस्पॉन्स फ़ील्ड्स के माध्यम से अवलोकनशीलता प्रदान करता है, और हेल्थ चेक तथा रनटाइम सांख्यिकी के लिए एंडपॉइंट्स भी शामिल हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.