Об этом проекте

GLM-4.5, GLM-4.6 и GLM-4.7 образуют открытое семейство базовых моделей от Zhipu AI (zai-org), предназначенное для агентных, рассуждающих и кодовых нагрузок. В репозитории задокументированы варианты моделей, ссылки для скачивания, требования к оборудованию, команды развертывания и рекомендации по оценке. Семейство моделей - GLM-4.5: 355B общих параметров с 32B активными (MoE), гибридное рассуждение с режимами мышления и без мышления. - GLM-4.5-Air: 106B общих, 12B активных, более компактная конструкция. - GLM-4.5-Base и GLM-4.5-Air-Base: базовые модели. - Предоставляются FP8-версии гибридных моделей-рассуждателей. - GLM-4.6: расширяет контекстное окно с 128K до 200K токенов и сообщает об улучшенном поведении в кодировании, рассуждении, использовании инструментов и написании текстов. - GLM-4.7: добавляет перемежающееся мышление, сохраненное мышление и мышление на уровне поворотов, с заявленными улучшениями в бенчмарках кодирования, терминала и использования инструментов. - GLM-4.7-Flash: облегченная модель 30B-A3B для более легкого развертывания. Лицензирование и доступность Модели выпущены под лицензией MIT для коммерческого использования и вторичной разработки. Веса распространяются через Hugging Face и ModelScope. Код моделей, парсеры инструментов и парсеры рассуждений интегрированы в transformers, vLLM и SGLang. Развертывание - Примеры инференса приведены для transformers, vLLM и SGLang, включая флаги вызова инструментов и парсеров рассуждений (например, glm47 и glm45). - Примеры SGLang охватывают PD-разделение с разделением prefill/decode и маршрутизатором. - Режим мышления включен по умолчанию в vLLM и SGLang; его можно отключить для каждого запроса через chat_template_kwargs. - Сохраненное мышление для агентных задач настраивается через chat_template_kwargs (только SGLang). - Таблицы оборудования перечисляют минимальные и полноконтекстные конфигурации GPU для BF16 и FP8, например GLM-4.5 FP8 на 8x H100 и GLM-4.5-Air FP8 на 2x H100, с большими количествами для полного контекста 128K. - Руководства охватывают развертывание на Ascend NPU через xLLM и GPU AMD. Тонкая настройка Конфигурации тонкой настройки задокументированы для Llama Factory и ms-swift, включая настройки LoRA, SFT и RL с количеством GPU H100 и H20. Оценка и инструменты Репозиторий содержит ссылки на руководство по интегрированному рассуждению с инструментами и шаблон траектории поискового агента, а также пример API-запроса для вызова инструментов в стиле OpenAI. Технический отчет доступен на arXiv, а API-сервисы предлагаются через платформу Z.ai.