इस प्रोजेक्ट के बारे में

GLM-4.5, GLM-4.6 और GLM-4.7 Zhipu AI (zai-org) से ओपन-सोर्स फाउंडेशन मॉडल का एक परिवार बनाते हैं, जो एजेंटिक, रीज़निंग और कोडिंग वर्कलोड के लिए लक्षित हैं। रिपॉजिटरी में मॉडल वेरिएंट, डाउनलोड लिंक, हार्डवेयर आवश्यकताएँ, डिप्लॉयमेंट कमांड और मूल्यांकन मार्गदर्शन का दस्तावेज़ीकरण है। मॉडल परिवार - GLM-4.5: 355B कुल पैरामीटर, 32B सक्रिय (MoE), सोच और गैर-सोच मोड के साथ हाइब्रिड रीज़निंग। - GLM-4.5-Air: 106B कुल, 12B सक्रिय, अधिक कॉम्पैक्ट डिज़ाइन। - GLM-4.5-Base और GLM-4.5-Air-Base: बेस मॉडल। - हाइब्रिड रीज़निंग मॉडल के FP8 संस्करण प्रदान किए गए हैं। - GLM-4.6: संदर्भ विंडो को 128K से 200K टोकन तक विस्तारित करता है और बेहतर कोडिंग, रीज़निंग, टूल-उपयोग और लेखन व्यवहार की रिपोर्ट करता है। - GLM-4.7: इंटरलीव्ड थिंकिंग, प्रिज़र्व्ड थिंकिंग और टर्न-लेवल थिंकिंग जोड़ता है, जिसमें कोडिंग, टर्मिनल और टूल-उपयोग बेंचमार्क पर लाभ की रिपोर्ट है। - GLM-4.7-Flash: हल्के डिप्लॉयमेंट के लिए एक हल्का 30B-A3B मॉडल। लाइसेंसिंग और उपलब्धता मॉडल व्यावसायिक उपयोग और द्वितीयक विकास के लिए MIT लाइसेंस के तहत जारी किए गए हैं। वेट Hugging Face और ModelScope के माध्यम से वितरित किए जाते हैं। मॉडल कोड, टूल पार्सर और रीज़निंग पार्सर transformers, vLLM और SGLang में एकीकृत हैं। डिप्लॉयमेंट - transformers, vLLM और SGLang के लिए इन्फ़रेंस उदाहरण दिए गए हैं, जिनमें टूल-कॉल और रीज़निंग पार्सर फ्लैग (जैसे glm47 और glm45) शामिल हैं। - SGLang उदाहरण प्रीफिल/डिकोड पृथक्करण और राउटर के साथ PD-डिसएग्रीगेशन को कवर करते हैं। - थिंकिंग मोड vLLM और SGLang में डिफ़ॉल्ट रूप से सक्षम है; इसे chat_template_kwargs के माध्यम से प्रति अनुरोध अक्षम किया जा सकता है। - एजेंटिक कार्यों के लिए प्रिज़र्व्ड थिंकिंग chat_template_kwargs (केवल SGLang) के माध्यम से कॉन्फ़िगर की जाती है। - हार्डवेयर तालिकाएँ BF16 और FP8 के लिए न्यूनतम और पूर्ण-संदर्भ GPU कॉन्फ़िगरेशन सूचीबद्ध करती हैं, उदाहरण के लिए 8x H100 पर GLM-4.5 FP8 और 2x H100 पर GLM-4.5-Air FP8, पूर्ण 128K संदर्भ के लिए बड़ी संख्या के साथ। - गाइड xLLM के माध्यम से Ascend NPU डिप्लॉयमेंट और AMD GPU डिप्लॉयमेंट को कवर करते हैं। फाइन-ट्यूनिंग फाइन-ट्यूनिंग कॉन्फ़िगरेशन Llama Factory और ms-swift के लिए दस्तावेज़ित हैं, जिनमें H100 और H20 GPU संख्या के साथ LoRA, SFT और RL सेटअप शामिल हैं। मूल्यांकन और टूलिंग रिपॉजिटरी एक टूल-एकीकृत रीज़निंग गाइड और एक सर्च-एजेंट ट्रैजेक्टरी टेम्पलेट से लिंक करती है, और OpenAI-शैली टूल कॉलिंग के लिए एक API अनुरोध उदाहरण प्रदान करती है। एक तकनीकी रिपोर्ट arXiv पर उपलब्ध है, और API सेवाएँ Z.ai प्लेटफ़ॉर्म के माध्यम से प्रदान की जाती हैं।