Об этом проекте
GLM-4.5, GLM-4.6 и GLM-4.7 образуют открытое семейство базовых моделей от Zhipu AI (zai-org), предназначенное для агентных, рассуждающих и кодовых нагрузок. В репозитории задокументированы варианты моделей, ссылки для скачивания, требования к оборудованию, команды развертывания и рекомендации по оценке.
Семейство моделей
- GLM-4.5: 355B общих параметров с 32B активными (MoE), гибридное рассуждение с режимами мышления и без мышления.
- GLM-4.5-Air: 106B общих, 12B активных, более компактная конструкция.
- GLM-4.5-Base и GLM-4.5-Air-Base: базовые модели.
- Предоставляются FP8-версии гибридных моделей-рассуждателей.
- GLM-4.6: расширяет контекстное окно с 128K до 200K токенов и сообщает об улучшенном поведении в кодировании, рассуждении, использовании инструментов и написании текстов.
- GLM-4.7: добавляет перемежающееся мышление, сохраненное мышление и мышление на уровне поворотов, с заявленными улучшениями в бенчмарках кодирования, терминала и использования инструментов.
- GLM-4.7-Flash: облегченная модель 30B-A3B для более легкого развертывания.
Лицензирование и доступность
Модели выпущены под лицензией MIT для коммерческого использования и вторичной разработки. Веса распространяются через Hugging Face и ModelScope. Код моделей, парсеры инструментов и парсеры рассуждений интегрированы в transformers, vLLM и SGLang.
Развертывание
- Примеры инференса приведены для transformers, vLLM и SGLang, включая флаги вызова инструментов и парсеров рассуждений (например, glm47 и glm45).
- Примеры SGLang охватывают PD-разделение с разделением prefill/decode и маршрутизатором.
- Режим мышления включен по умолчанию в vLLM и SGLang; его можно отключить для каждого запроса через chat_template_kwargs.
- Сохраненное мышление для агентных задач настраивается через chat_template_kwargs (только SGLang).
- Таблицы оборудования перечисляют минимальные и полноконтекстные конфигурации GPU для BF16 и FP8, например GLM-4.5 FP8 на 8x H100 и GLM-4.5-Air FP8 на 2x H100, с большими количествами для полного контекста 128K.
- Руководства охватывают развертывание на Ascend NPU через xLLM и GPU AMD.
Тонкая настройка
Конфигурации тонкой настройки задокументированы для Llama Factory и ms-swift, включая настройки LoRA, SFT и RL с количеством GPU H100 и H20.
Оценка и инструменты
Репозиторий содержит ссылки на руководство по интегрированному рассуждению с инструментами и шаблон траектории поискового агента, а также пример API-запроса для вызова инструментов в стиле OpenAI. Технический отчет доступен на arXiv, а API-сервисы предлагаются через платформу Z.ai.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.