Sobre o projeto
GLM-4.5, GLM-4.6 e GLM-4.7 formam uma família de modelos de fundação de código aberto da Zhipu AI (zai-org) voltada para cargas de trabalho de agente, raciocínio e codificação. O repositório documenta variantes de modelos, links de download, requisitos de hardware, comandos de implantação e orientações de avaliação.
Família de modelos
- GLM-4.5: 355B de parâmetros totais com 32B ativos (MoE), raciocínio híbrido com modos de pensamento e não pensamento.
- GLM-4.5-Air: 106B totais, 12B ativos, um design mais compacto.
- GLM-4.5-Base e GLM-4.5-Air-Base: modelos base.
- Versões FP8 dos modelos de raciocínio híbrido são fornecidas.
- GLM-4.6: expande a janela de contexto de 128K para 200K tokens e relata melhorias em codificação, raciocínio, uso de ferramentas e comportamento de escrita.
- GLM-4.7: adiciona Interleaved Thinking, Preserved Thinking e Turn-level Thinking, com ganhos relatados em benchmarks de codificação, terminal e uso de ferramentas.
- GLM-4.7-Flash: um modelo leve de 30B-A3B para implantação mais leve.
Licenciamento e disponibilidade
Os modelos são lançados sob a licença MIT para uso comercial e desenvolvimento secundário. Os pesos são distribuídos via Hugging Face e ModelScope. O código dos modelos, parsers de ferramentas e parsers de raciocínio são integrados em transformers, vLLM e SGLang.
Implantação
- Exemplos de inferência são fornecidos para transformers, vLLM e SGLang, incluindo flags de chamada de ferramenta e parser de raciocínio (por exemplo, glm47 e glm45).
- Exemplos de SGLang cobrem PD-disaggregation com separação de prefill/decode e um roteador.
- O modo de pensamento é habilitado por padrão em vLLM e SGLang; pode ser desabilitado por solicitação via chat_template_kwargs.
- Preserved Thinking para tarefas de agente é configurado via chat_template_kwargs (somente SGLang).
- Tabelas de hardware listam configurações mínimas e de contexto completo de GPU para BF16 e FP8, por exemplo, GLM-4.5 FP8 em 8x H100 e GLM-4.5-Air FP8 em 2x H100, com contagens maiores para contexto completo de 128K.
- Guias cobrem implantação em Ascend NPU via xLLM e implantação em GPU AMD.
Ajuste fino
Configurações de ajuste fino são documentadas para Llama Factory e ms-swift, incluindo configurações LoRA, SFT e RL com contagens de GPU H100 e H20.
Avaliação e ferramentas
O repositório vincula um guia de raciocínio integrado a ferramentas e um modelo de trajetória de agente de busca, e fornece um exemplo de solicitação de API para chamada de ferramentas no estilo OpenAI. Um relatório técnico está disponível no arXiv, e serviços de API são oferecidos através da plataforma Z.ai.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.