عن المشروع

تشكل GLM-4.5 وGLM-4.6 وGLM-4.7 عائلة مفتوحة المصدر من النماذج الأساسية من Zhipu AI (zai-org) تستهدف أعباء العمل الوكيلة والاستدلال والبرمجة. يوثق المستودع متغيرات النماذج وروابط التنزيل ومتطلبات الأجهزة وأوامر النشر وإرشادات التقييم. عائلة النماذج - GLM-4.5: 355B معلمة إجمالية مع 32B نشطة (MoE)، استدلال هجين مع أوضاع التفكير وعدم التفكير. - GLM-4.5-Air: 106B إجمالية، 12B نشطة، تصميم أكثر إحكاما. - GLM-4.5-Base وGLM-4.5-Air-Base: نماذج أساسية. - يتم توفير إصدارات FP8 من نماذج الاستدلال الهجين. - GLM-4.6: يوسع نافذة السياق من 128K إلى 200K رمز ويحسن سلوك البرمجة والاستدلال واستخدام الأدوات والكتابة. - GLM-4.7: يضيف التفكير المتداخل والتفكير المحفوظ والتفكير على مستوى الدور، مع تحسينات مبلغ عنها في معايير البرمجة والطرفية واستخدام الأدوات. - GLM-4.7-Flash: نموذج خفيف 30B-A3B لنشر أخف. الترخيص والتوفر يتم إصدار النماذج تحت رخصة MIT للاستخدام التجاري والتطوير الثانوي. يتم توزيع الأوزان عبر Hugging Face وModelScope. يتم دمج كود النموذج ومحللات الأدوات ومحللات الاستدلال في transformers وvLLM وSGLang. النشر - يتم تقديم أمثلة الاستدلال لـ transformers وvLLM وSGLang، بما في ذلك استدعاء الأدوات وأعلام محلل الاستدلال (مثل glm47 وglm45). - تغطي أمثلة SGLang فصل PD مع فصل التعبئة/فك التشفير وموجه. - يتم تمكين وضع التفكير افتراضيا في vLLM وSGLang؛ يمكن تعطيله لكل طلب عبر chat_template_kwargs. - يتم تكوين التفكير المحفوظ للمهام الوكيلة عبر chat_template_kwargs (SGLang فقط). - تسرد جداول الأجهزة تكوينات GPU الدنيا والكاملة للسياق لـ BF16 وFP8، على سبيل المثال GLM-4.5 FP8 على 8x H100 وGLM-4.5-Air FP8 على 2x H100، مع أعداد أكبر لسياق 128K الكامل. - تغطي الأدلة نشر Ascend NPU عبر xLLM ونشر GPU AMD. الضبط الدقيق يتم توثيق تكوينات الضبط الدقيق لـ Llama Factory وms-swift، بما في ذلك إعدادات LoRA وSFT وRL مع أعداد GPU H100 وH20. التقييم والأدوات يربط المستودع دليلا متكاملا للأدوات للاستدلال وقالب مسار وكيل البحث، ويوفر مثالا لطلب API لنمط استدعاء الأدوات بأسلوب OpenAI. يتوفر تقرير فني على arXiv، وتقدم خدمات API عبر منصة Z.ai.