منصوبے کے بارے میں
LLM Context Squeezer ایک مقامی API پراکسی ہے جسے FastAPI کے ساتھ بنایا گیا ہے جو ایپلی کیشنز اور OpenAI کے مطابق LLM فراہم کنندگان کے درمیان واسطے کے طور پر کام کرتا ہے۔ یہ متعدد خودکار بہترکاری کے طریقوں کے ذریعے ٹوکن کی کھپت اور API لاگتیں کم کرنے کا مقصد رکھتا ہے:
- **متحرک سیاق و سباق کمپریشن**: جب بات چیت کی تاریخ کسی مقررہ حد سے تجاوز کر جائے تو، پراکسی ایک سستے ماڈل (جیسے gpt-4o-mini) کا استعمال کرتے ہوئے چیٹ کے قدیم حصے کا خلاصہ تیار کرتا ہے، جسے نظام کے حکم نامے میں شامل کیا جاتا ہے。
- ** redundانسی ہٹانا**: ایک دو مرحلہ انجن SHA-256 hashing کا استعمال کوڈ بلاکس کے دقیق میچز کے لیے کرتا ہے اور Jaccard similarity کا استعمال تقریباً ڈپلیکیٹ متن کے لیے کرتا ہے، دہرائے جانے والے مواد کو منظم نشانوں سے بدل دیتا ہے۔
- **سیمیینٹک کیچنگ**: SQLite کو WAL mode میں استعمال کرتے ہوئے دقیق اور فزی prompt میچنگ فراہم کرتا ہے، redundant API کالز کو ختم کرنے کے لیے کیچ شدہ جوابات لوٹاتا ہے۔
- **Drop-in انضمام**: یہ OpenAI /v1/chat/completions معاہدہ نافذ کرتا ہے، جس سے یہ OpenAI Python SDK، LangChain، AutoGen اور CrewAI کے ساتھ صرف base URL تبدیل کر کے کام کرتا ہے。
پراکسی `x-squeezer-tokens-saved` اور `x-squeezer-cache-hit` جیسے injected response فیلڈز کے ذریعے observability فراہم کرتا ہے، اور health checks اور runtime statistics کے لیے endpoints بھی شامل ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.