Sobre el proyecto

GLM-4.5, GLM-4.6 y GLM-4.7 forman una familia de modelos base de código abierto de Zhipu AI (zai-org) dirigida a cargas de trabajo de agente, razonamiento y codificación. El repositorio documenta variantes de modelos, enlaces de descarga, requisitos de hardware, comandos de implementación y guías de evaluación. Familia de modelos - GLM-4.5: 355B parámetros totales con 32B activos (MoE), razonamiento híbrido con modos de pensamiento y no pensamiento. - GLM-4.5-Air: 106B totales, 12B activos, un diseño más compacto. - GLM-4.5-Base y GLM-4.5-Air-Base: modelos base. - Se proporcionan versiones FP8 de los modelos de razonamiento híbrido. - GLM-4.6: amplía la ventana de contexto de 128K a 200K tokens y reporta mejoras en codificación, razonamiento, uso de herramientas y escritura. - GLM-4.7: añade Pensamiento Intercalado, Pensamiento Preservado y Pensamiento a Nivel de Turno, con mejoras reportadas en codificación, terminal y benchmarks de uso de herramientas. - GLM-4.7-Flash: un modelo ligero 30B-A3B para implementación más sencilla. Licencia y disponibilidad Los modelos se publican bajo la licencia MIT para uso comercial y desarrollo secundario. Los pesos se distribuyen a través de Hugging Face y ModelScope. El código de modelos, parsers de herramientas y parsers de razonamiento están integrados en transformers, vLLM y SGLang. Implementación - Se dan ejemplos de inferencia para transformers, vLLM y SGLang, incluyendo llamadas a herramientas y flags de parser de razonamiento (por ejemplo, glm47 y glm45). - Los ejemplos de SGLang cubren desagregación PD con separación de prefill/decode y un router. - El modo de pensamiento está habilitado por defecto en vLLM y SGLang; se puede deshabilitar por solicitud mediante chat_template_kwargs. - El Pensamiento Preservado para tareas de agente se configura a través de chat_template_kwargs (solo SGLang). - Las tablas de hardware listan configuraciones mínimas y de contexto completo de GPU para BF16 y FP8, por ejemplo GLM-4.5 FP8 en 8x H100 y GLM-4.5-Air FP8 en 2x H100, con recuentos mayores para contexto completo de 128K. - Las guías cubren implementación en Ascend NPU mediante xLLM e implementación en GPU AMD. Ajuste fino Las configuraciones de ajuste fino se documentan para Llama Factory y ms-swift, incluyendo configuraciones LoRA, SFT y RL con recuentos de GPU H100 y H20. Evaluación y herramientas El repositorio enlaza una guía de razonamiento integrado con herramientas y una plantilla de trayectoria de agente de búsqueda, y proporciona un ejemplo de solicitud API para llamadas de herramientas estilo OpenAI. Hay un informe técnico disponible en arXiv, y los servicios API se ofrecen a través de la plataforma Z.ai.