Sobre o projeto

GLM-4.5, GLM-4.6 e GLM-4.7 formam uma família de modelos de fundação de código aberto da Zhipu AI (zai-org) voltada para cargas de trabalho de agente, raciocínio e codificação. O repositório documenta variantes de modelos, links de download, requisitos de hardware, comandos de implantação e orientações de avaliação. Família de modelos - GLM-4.5: 355B de parâmetros totais com 32B ativos (MoE), raciocínio híbrido com modos de pensamento e não pensamento. - GLM-4.5-Air: 106B totais, 12B ativos, um design mais compacto. - GLM-4.5-Base e GLM-4.5-Air-Base: modelos base. - Versões FP8 dos modelos de raciocínio híbrido são fornecidas. - GLM-4.6: expande a janela de contexto de 128K para 200K tokens e relata melhorias em codificação, raciocínio, uso de ferramentas e comportamento de escrita. - GLM-4.7: adiciona Interleaved Thinking, Preserved Thinking e Turn-level Thinking, com ganhos relatados em benchmarks de codificação, terminal e uso de ferramentas. - GLM-4.7-Flash: um modelo leve de 30B-A3B para implantação mais leve. Licenciamento e disponibilidade Os modelos são lançados sob a licença MIT para uso comercial e desenvolvimento secundário. Os pesos são distribuídos via Hugging Face e ModelScope. O código dos modelos, parsers de ferramentas e parsers de raciocínio são integrados em transformers, vLLM e SGLang. Implantação - Exemplos de inferência são fornecidos para transformers, vLLM e SGLang, incluindo flags de chamada de ferramenta e parser de raciocínio (por exemplo, glm47 e glm45). - Exemplos de SGLang cobrem PD-disaggregation com separação de prefill/decode e um roteador. - O modo de pensamento é habilitado por padrão em vLLM e SGLang; pode ser desabilitado por solicitação via chat_template_kwargs. - Preserved Thinking para tarefas de agente é configurado via chat_template_kwargs (somente SGLang). - Tabelas de hardware listam configurações mínimas e de contexto completo de GPU para BF16 e FP8, por exemplo, GLM-4.5 FP8 em 8x H100 e GLM-4.5-Air FP8 em 2x H100, com contagens maiores para contexto completo de 128K. - Guias cobrem implantação em Ascend NPU via xLLM e implantação em GPU AMD. Ajuste fino Configurações de ajuste fino são documentadas para Llama Factory e ms-swift, incluindo configurações LoRA, SFT e RL com contagens de GPU H100 e H20. Avaliação e ferramentas O repositório vincula um guia de raciocínio integrado a ferramentas e um modelo de trajetória de agente de busca, e fornece um exemplo de solicitação de API para chamada de ferramentas no estilo OpenAI. Um relatório técnico está disponível no arXiv, e serviços de API são oferecidos através da plataforma Z.ai.