منصوبے کے بارے میں
Smart SLM Router ایک asynchronous لوکل پراکسی ہے جسے LLM درخواستوں کو ذہانت کے ساتھ راؤٹ کر کے API کے اخراجات کو کم کرنے کے لیے ڈیزائن کیا گیا ہے۔ یہ مکمل طور پر OpenAI API کی تفصیلات کے ساتھ ہم آہنگ ہے، جس کی وجہ سے بیس URL کو اپ ڈیٹ کر کے اسے موجودہ OpenAI SDK ایپلی کیشنز کے لیے ایک ڈراپ ان متبادل کے طور پر استعمال کیا جا سکتا ہے۔
اہم صلاحیتوں میں شامل ہیں:
- لوکل Intent Classification: نیٹ ورک لیٹنسی کے بغیر 15ms سے کم وقت میں راؤٹنگ کا فیصلہ کرنے کے لیے length heuristics، token regex patterns، اور tool-call indicators کا استعمال کرتا ہے۔
- Dynamic Routing: سادہ سوالات کو SLMs (مثلاً Ollama یا vLLM کے ذریعے) کی طرف بھیجتا ہے اور پیچیدہ، تکنیکی، یا کثیر مرحلہ وار سوالات کو Tier-1 فرنٹیر ماڈلز (مثلاً GPT-4o, Claude) تک پہنچاتا ہے۔
- Transparent Fallback: اگر SLM کنکشن کی ناکامی، ماڈل کے انکار، یا JSON parse error واپس کرتا ہے تو یہ خود بخود درخواستوں کو دوبارہ کوشش کرتا ہے اور فرنٹیر ماڈل تک پہنچاتا ہے۔
- Full API Support: یہ non-streaming اور streaming (SSE) دونوں جوابات کو سپورٹ کرتا ہے۔
- Observability: ریئل ٹائم USD لاگت کی بچت، درخواستوں کی تعداد، اور فیصلے کی لیٹنسی کو ٹریک کرنے کے لیے ایک `/metrics` اینڈ پوائنٹ فراہم کرتا ہے۔
یہ سسٹم Python 3.12+ اور FastAPI کے ساتھ بنایا گیا ہے، اور بیک اینڈ URLs، ماڈل کے ناموں، اور ٹوکن تھریشولڈز کی کنفیگریشن کے لیے environment variables کا استعمال کرتا ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.