Sobre el proyecto
GLM-4.5, GLM-4.6 y GLM-4.7 forman una familia de modelos base de código abierto de Zhipu AI (zai-org) dirigida a cargas de trabajo de agente, razonamiento y codificación. El repositorio documenta variantes de modelos, enlaces de descarga, requisitos de hardware, comandos de implementación y guías de evaluación.
Familia de modelos
- GLM-4.5: 355B parámetros totales con 32B activos (MoE), razonamiento híbrido con modos de pensamiento y no pensamiento.
- GLM-4.5-Air: 106B totales, 12B activos, un diseño más compacto.
- GLM-4.5-Base y GLM-4.5-Air-Base: modelos base.
- Se proporcionan versiones FP8 de los modelos de razonamiento híbrido.
- GLM-4.6: amplía la ventana de contexto de 128K a 200K tokens y reporta mejoras en codificación, razonamiento, uso de herramientas y escritura.
- GLM-4.7: añade Pensamiento Intercalado, Pensamiento Preservado y Pensamiento a Nivel de Turno, con mejoras reportadas en codificación, terminal y benchmarks de uso de herramientas.
- GLM-4.7-Flash: un modelo ligero 30B-A3B para implementación más sencilla.
Licencia y disponibilidad
Los modelos se publican bajo la licencia MIT para uso comercial y desarrollo secundario. Los pesos se distribuyen a través de Hugging Face y ModelScope. El código de modelos, parsers de herramientas y parsers de razonamiento están integrados en transformers, vLLM y SGLang.
Implementación
- Se dan ejemplos de inferencia para transformers, vLLM y SGLang, incluyendo llamadas a herramientas y flags de parser de razonamiento (por ejemplo, glm47 y glm45).
- Los ejemplos de SGLang cubren desagregación PD con separación de prefill/decode y un router.
- El modo de pensamiento está habilitado por defecto en vLLM y SGLang; se puede deshabilitar por solicitud mediante chat_template_kwargs.
- El Pensamiento Preservado para tareas de agente se configura a través de chat_template_kwargs (solo SGLang).
- Las tablas de hardware listan configuraciones mínimas y de contexto completo de GPU para BF16 y FP8, por ejemplo GLM-4.5 FP8 en 8x H100 y GLM-4.5-Air FP8 en 2x H100, con recuentos mayores para contexto completo de 128K.
- Las guías cubren implementación en Ascend NPU mediante xLLM e implementación en GPU AMD.
Ajuste fino
Las configuraciones de ajuste fino se documentan para Llama Factory y ms-swift, incluyendo configuraciones LoRA, SFT y RL con recuentos de GPU H100 y H20.
Evaluación y herramientas
El repositorio enlaza una guía de razonamiento integrado con herramientas y una plantilla de trayectoria de agente de búsqueda, y proporciona un ejemplo de solicitud API para llamadas de herramientas estilo OpenAI. Hay un informe técnico disponible en arXiv, y los servicios API se ofrecen a través de la plataforma Z.ai.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.