منصوبے کے بارے میں

GLM-4.5، GLM-4.6 اور GLM-4.7 Zhipu AI (zai-org) کے اوپن سورس فاؤنڈیشن ماڈلز کا خاندان بناتے ہیں، جو ایجنٹک، ریزننگ اور کوڈنگ کے کاموں کے لیے ہیں۔ ریپوزٹری ماڈل ورژنز، ڈاؤن لوڈ لنکس، ہارڈویئر ضروریات، ڈیپلائمنٹ کمانڈز اور تشخیصی رہنمائی کی دستاویز کرتی ہے۔ ماڈل خاندان - GLM-4.5: 355B کل پیرامیٹرز کے ساتھ 32B فعال (MoE)، ہائبرڈ ریزننگ جس میں سوچنے اور نہ سوچنے کے طریقے شامل ہیں۔ - GLM-4.5-Air: 106B کل، 12B فعال، زیادہ کمپیکٹ ڈیزائن۔ - GLM-4.5-Base اور GLM-4.5-Air-Base: بیس ماڈلز۔ - ہائبرڈ ریزننگ ماڈلز کے FP8 ورژن فراہم کیے گئے ہیں۔ - GLM-4.6: سیاق و سباق کی ونڈو کو 128K سے 200K ٹوکنز تک بڑھاتا ہے اور کوڈنگ، ریزننگ، ٹول استعمال اور تحریر کے بہتر رویے کی اطلاع دیتا ہے۔ - GLM-4.7: Interleaved Thinking، Preserved Thinking اور Turn-level Thinking شامل کرتا ہے، جس میں کوڈنگ، ٹرمینل اور ٹول استعمال کے بینچ مارکس پر بہتری کی اطلاع ہے۔ - GLM-4.7-Flash: ہلکے ڈیپلائمنٹ کے لیے ایک ہلکا 30B-A3B ماڈل۔ لائسنسنگ اور دستیابی ماڈلز تجارتی استعمال اور ثانوی ترقی کے لیے MIT لائسنس کے تحت جاری کیے گئے ہیں۔ وزن Hugging Face اور ModelScope کے ذریعے تقسیم کیے جاتے ہیں۔ ماڈل کوڈ، ٹول پارسرز اور ریزننگ پارسرز transformers، vLLM اور SGLang میں ضم کیے گئے ہیں۔ ڈیپلائمنٹ - transformers، vLLM اور SGLang کے لیے انفرنس مثالیں دی گئی ہیں، بشمول ٹول کال اور ریزننگ پارسر جھنڈے (مثلاً glm47 اور glm45)۔ - SGLang مثالیں PD-علیحدگی کو prefill/decode علیحدگی اور روٹر کے ساتھ کور کرتی ہیں۔ - Thinking موڈ vLLM اور SGLang میں بطور ڈیفالٹ فعال ہے؛ اسے chat_template_kwargs کے ذریعے فی درخواست غیر فعال کیا جا سکتا ہے۔ - ایجنٹک کاموں کے لیے Preserved Thinking chat_template_kwargs (صرف SGLang) کے ذریعے ترتیب دیا جاتا ہے۔ - ہارڈویئر ٹیبلز BF16 اور FP8 کے لیے کم از کم اور مکمل سیاق و سباق GPU کنفیگریشنز دکھاتی ہیں، مثلاً GLM-4.5 FP8 8x H100 پر اور GLM-4.5-Air FP8 2x H100 پر، مکمل 128K سیاق و سباق کے لیے زیادہ تعداد کے ساتھ۔ - گائیڈز xLLM کے ذریعے Ascend NPU ڈیپلائمنٹ اور AMD GPU ڈیپلائمنٹ کور کرتی ہیں۔ فائن ٹیوننگ فائن ٹیوننگ کنفیگریشنز Llama Factory اور ms-swift کے لیے دستاویز کی گئی ہیں، بشمول LoRA، SFT اور RL سیٹ اپس H100 اور H20 GPU گنتی کے ساتھ۔ تشخیص اور ٹولنگ ریپوزٹری ایک ٹول انٹیگریٹڈ ریزننگ گائیڈ اور سرچ ایجنٹ ٹریجیکٹری ٹیمپلیٹ سے لنک کرتی ہے، اور OpenAI طرز کے ٹول کالنگ کے لیے API درخواست کی مثال فراہم کرتی ہے۔ ایک تکنیکی رپورٹ arXiv پر دستیاب ہے، اور API خدمات Z.ai پلیٹ فارم کے ذریعے پیش کی جاتی ہیں۔