منصوبے کے بارے میں

LLM Systems Manager ایک سیلف ہوسٹڈ آپریشنز پلیٹ فارم ہے جو LLM انفراسٹرکچر کے لیے مانیٹرنگ، ریموٹ کنٹرول، ٹیوننگ، روٹنگ اور الرٹنگ کو ایک ہی جگہ فراہم کرتا ہے۔ یہ llama.cpp، vLLM، LM Studio، stable-diffusion.cpp اور OpenClaw سیشن ٹیلی میٹری کو یکجا کرتا ہے، جبکہ اس کا ایجنٹ کسی بھی Linux یا macOS مشین کے لیے عمومی ہوسٹ میٹرکس رپورٹ کرتا ہے؛ Ollama انٹیگریشن روڈ میپ میں شامل ہے۔ انسٹالیشن کے طریقوں میں ایک انٹرایکٹو اسکرپٹ انسٹالر (ترجیحی طریقہ، جو پیشگی تقاضے، InfluxDB، کنفیگ، TLS اور ایجنٹس سنبھالتا ہے)، نیٹو .deb/.rpm پیکجز، کنٹینرائزڈ کنٹرول پلین کے لیے Docker Compose، macOS Apple Silicon اور Linux کے لیے Homebrew فارمولے، اور Python کے بغیر ہوسٹس کے لیے اسٹینڈalone ایجنٹ بائنری ٹاربال شامل ہیں۔ انسٹالر تازہ ترین GitHub Release کو SHA-256 تصدیق کے ساتھ ڈیپلائے کرتا ہے اور systemd یونٹس کو خودکار طور پر سروسز شروع کیے بغیر فعال کرتا ہے۔ README میں بیان کردہ نمایاں صلاحیتیں: - Model Autopilot: ہوسٹ میموری (VRAM یا RAM) پر مشروط ماڈل پلیسمنٹ، ہوسٹ کے گرنے پر فیل اوور، اور ڈیمانڈ کے مطابق ریپلیکا اسکیلنگ۔ بطور ڈیفالٹ بند؛ یہ تجویز کرتا ہے اور آپریٹر منظوری دیتا ہے۔ - OpenAI کے ساتھ مطابقت رکھنے والا انفرنس گیٹ وے: llama.cpp، LM Studio اور vLLM کے سامنے ایک اینڈ پوائنٹ، ایک ضم شدہ /v1/models کیٹلاگ اور فی ماڈل پن، پول راؤنڈ روبن، یا فیل اوور کے ذریعے روٹنگ۔ - GPU Report Card: ایک معیاری بینچ مارک جو موازنہ کے قابل کارڈز تیار کرتا ہے، جس میں ٹائم ٹو فرسٹ ٹوکن، پریفِل اور جنریشن تھروپٹ، ٹوکنز/جول، ماپا گیا $/Mtok اور استعمال شدہ GPU شامل ہیں۔ - توانائی اور لاگت کی ذہانت: حقیقی بجلی کی کھپت سے ماپا گیا $/Mtok، ہوسٹڈ-API قیمتوں کے مقابل ماہانہ بچت، آئیڈل پاور کا حساب، اور فی ہوسٹ پرفارمنس مینیجر جو CPU گورنر اور کولنگ پروفائلز کو لوڈ کے مطابق ایڈجسٹ کرتا ہے۔ - بینچ مارکنگ اور آٹو ٹیوننگ: لائبریری بھر میں بینچ مارکس کے علاوہ llama.cpp کانٹیکسٹ/سلاٹ کنفیگریشن اور vLLM max-model-len کے لیے آٹو ٹیونرز۔ - ماڈل مینجمنٹ: Hugging Face ڈاؤن لوڈز اور پروننگ، نیز ایک کلک ری لوڈ کے لیے نامزد پروفائلز (چیٹ/کوڈ/جنرل)۔ - SSH کے بغیر ریموٹ کنٹرول: سرورز چلائیں، ماڈلز ہاٹ-سواپ کریں، کنفیگز ایڈٹ کریں، llama.cpp اپ ڈیٹ کریں، لاگز ٹیل کریں، اور براؤزر میں ٹرمینل کھولیں؛ ایک Discord بوٹ اسی طرح کے کمانڈز فراہم کرتا ہے۔ - LLM سے آگاہ ٹیلی میٹری اور الرٹنگ: سلاٹس، ٹوکنز/سیکنڈ، پرامپٹ پروسیسنگ، KV کیش اور کانٹیکسٹ کے ساتھ GPU، PSU، UPS اور کولنگ کے اعداد و شمار؛ ایک اسٹینڈalone الارم انجن نمونوں کو InfluxDB میں محفوظ کرتا ہے، تھریش ہولڈ اور اینوملی رولز کا جائزہ لیتا ہے، ای میل/ٹوسٹ/ویب ہک/Discord کے ذریعے اطلاع دیتا ہے، آؤٹیجز کے دوران بفر کرتا ہے، اور متعلقہ الرٹس کو واقعات میں مربوط کرتا ہے۔ اضافی خصوصیات میں ایک Tools لانچر (Report Card، Benchmark، Autotune مع فلیٹ وائڈ رن لیجر)، لے آؤٹ اور ظاہری شکل کے اختیارات (Grid یا Flow انجنز، رول پریسیٹس، کمپیکٹ ڈینسٹی، سات تھیمز)، پش الرٹس کے ساتھ انسٹال کے قابل PWA فون کمپینین، ایڈمن آڈٹ لاگ کے ساتھ ملٹی یوزر رولز، انکرپٹڈ شیڈولڈ بیک اپس، OpenClaw لاگت/بجٹ تجزیات، ایک امیج جنریشن ٹیب، اور تمام کنکشنز پر TLS/mTLS مع اپنا سرٹیفکیٹ لانے کی سہولت شامل ہیں۔