منصوبے کے بارے میں
جانو ایک کم از کم، OpenAI-compatible HTTP راؤٹر ہے جو صارفین کے لیے ڈیزائن کیا گیا ہے جو ایک GPU پر ایک سے زیادہ مقامی LLMs چلا رہے ہوں۔ یہ گرِڈی بیچنگ نفاذ کر کے اوور ہیڈ کم کرتا ہے: ہر درخواست تبدیلی پر ماڈلز تبدیل کرنے کے بجائے، یہ فی الحال لوڈ شدہ ماڈل کے لیے تمام انتظار کی جا رہی درخواستیں پہلے پیش کرتا ہے، صرف ضرورت پڑنے پر ہی سوئپ کرتا ہے۔ اس سے ماڈل سوئپس کئی سے کم ہو کر صرف ایک فی بسٹ رہ جاتی ہیں، جس سے مقامی ہارڈ ویئر پر قابلِ ذکر وقت (30 سیکنڈ سے 3 منٹ) بچتا ہے۔ جانو مقامی بیک اینڈز (جیسے llama-server یا vLLM) اور ریموٹ APIs (مثلاً DeepSeek) دونوں کی حمایت کرتا ہے، جس میں ریموٹ فراہم کنندگان کے لیے خودکار ماڈل نام ری رائٹنگ شامل ہے۔ اس میں /health، /status، اور Prometheus metrics endpoints کے ذریعے بلٹ ان ٹیلی میٹریکس موجود ہیں، جو قطار کی گہرائی، سوئپ کا دورانیہ، ٹوکن throughput، اور بیک اینڈ صحت کو ٹریک کرتے ہیں۔ تشکیل کو ماحول متغیرات اور models.json فائل کے ذریعے سنبھالا جاتا ہے، جہاں صارفین ماڈل نام، URLs، الحاقی نام، اور اختیاری سوئپ اسکرپٹس کی تعریف کرتے ہیں۔ سوئپ اسکرپٹ کا معاہدہ سادہ ہے: کسی ماڈل نام دیا جائے تو اسے فعال کرنا ہوگا اور صاف ستھرے طریقے سے باہر نکلنا ہوگا؛ اختیاری حالت کی اطلاع ابتدائی حالت کا پتہ لگانے میں مدد دیتی ہے۔ جانو منطق کو سادہ رکھنے کے لیے ہر بیک اینڈ کے لیے تمام درخواستوں کو سیریلائز کرتا ہے، جس سے یہ ذاتی یا چھوٹے پیمانے کے سیٹ اپ کے لیے موزوں ہے نہ کہ ملکی ٹیننٹ سروسز کے لیے۔ یہ GPU درجہ حرارت یا نظام کے وسائل کا انتظام نہیں کرتا — وہ اس کی حدود کے باہر رہتے ہیں۔ جانو موجودہ اوزاروں کے اوپر ایک باریک تہہ کے طور پر ڈیزائن کیا گیا ہے، جس میں ماڈل سوئچنگ پر واضح کنٹرول، کسی بھی OpenAI-انداز بیک اینڈ کے ساتھ ہم آہنگی، اور اسٹریمنگ اور ٹول کالز کی شفاف پاس تھرو شامل ہے۔ اگر آپ Ollama یا ایک واحد ماڈل استعمال کر رہے ہیں تو یہ ضروری نہیں؛ یہ ان صارفین کے لیے بہترین ہے جن کے پاس پہلے سے ہی کسٹم بیک اینڈز ہیں اور وہ روٹنگ اور سوئپنگ پر باریک کنٹرول چاہتے ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.