这个项目能做什么

GLM-4.5、GLM-4.6和GLM-4.7构成智谱AI(zai-org)的开源基础模型系列,面向智能体、推理和编码工作负载。该仓库记录了模型变体、下载链接、硬件要求、部署命令和评估指南。 模型系列 - GLM-4.5:总参数355B,激活参数32B(MoE),混合推理,支持思考和非思考模式。 - GLM-4.5-Air:总参数106B,激活参数12B,更紧凑的设计。 - GLM-4.5-Base和GLM-4.5-Air-Base:基础模型。 - 提供混合推理模型的FP8版本。 - GLM-4.6:将上下文窗口从128K扩展到200K个token,并报告了编码、推理、工具使用和写作行为的改进。 - GLM-4.7:新增交错思考、保留思考和回合级思考,在编码、终端和工具使用基准上报告了改进。 - GLM-4.7-Flash:轻量级30B-A3B模型,适用于更轻量的部署。 许可和可用性 模型在MIT许可证下发布,允许商业使用和二次开发。权重通过Hugging Face和ModelScope分发。模型代码、工具解析器和推理解析器已集成到transformers、vLLM和SGLang中。 部署 - 提供了transformers、vLLM和SGLang的推理示例,包括工具调用和推理解析器标志(例如glm47和glm45)。 - SGLang示例涵盖PD分离(预填充/解码分离)和路由器。 - vLLM和SGLang中默认启用思考模式;可通过chat_template_kwargs按请求禁用。 - 针对智能体任务的保留思考通过chat_template_kwargs配置(仅SGLang)。 - 硬件表列出了BF16和FP8的最小和全上下文GPU配置,例如GLM-4.5 FP8在8x H100上,GLM-4.5-Air FP8在2x H100上,全128K上下文需要更多GPU。 - 指南涵盖通过xLLM的昇腾NPU部署和AMD GPU部署。 微调 微调配置已记录用于Llama Factory和ms-swift,包括LoRA、SFT和RL设置,并指定了H100和H20 GPU数量。 评估和工具 该仓库链接了工具集成推理指南和搜索智能体轨迹模板,并提供OpenAI风格工具调用的API请求示例。技术报告可在arXiv上获取,API服务通过Z.ai平台提供。