프로젝트 소개
GLM-4.5, GLM-4.6 및 GLM-4.7은 Zhipu AI(zai-org)의 오픈소스 기반 모델 제품군으로, 에이전트, 추론 및 코딩 워크로드를 대상으로 합니다. 이 저장소는 모델 변형, 다운로드 링크, 하드웨어 요구 사항, 배포 명령 및 평가 지침을 문서화합니다.
모델 제품군
- GLM-4.5: 총 355B 파라미터, 활성 32B(MoE), 사고 및 비사고 모드를 갖춘 하이브리드 추론.
- GLM-4.5-Air: 총 106B, 활성 12B, 더 컴팩트한 설계.
- GLM-4.5-Base 및 GLM-4.5-Air-Base: 기본 모델.
- 하이브리드 추론 모델의 FP8 버전이 제공됩니다.
- GLM-4.6: 컨텍스트 창을 128K에서 200K 토큰으로 확장하고 코딩, 추론, 도구 사용 및 작성 동작이 개선되었다고 보고합니다.
- GLM-4.7: Interleaved Thinking, Preserved Thinking 및 Turn-level Thinking을 추가하고 코딩, 터미널 및 도구 사용 벤치마크에서 개선된 성능을 보고합니다.
- GLM-4.7-Flash: 더 가벼운 배포를 위한 경량 30B-A3B 모델.
라이선스 및 가용성
모델은 상업적 사용 및 2차 개발을 위해 MIT 라이선스로 출시됩니다. 가중치는 Hugging Face 및 ModelScope를 통해 배포됩니다. 모델 코드, 도구 파서 및 추론 파서는 transformers, vLLM 및 SGLang에 통합됩니다.
배포
- transformers, vLLM 및 SGLang에 대한 추론 예제가 제공되며, 도구 호출 및 추론 파서 플래그(예: glm47 및 glm45)를 포함합니다.
- SGLang 예제는 prefill/decode 분리 및 라우터를 사용한 PD 분리를 다룹니다.
- Thinking 모드는 vLLM 및 SGLang에서 기본적으로 활성화되며, chat_template_kwargs를 통해 요청별로 비활성화할 수 있습니다.
- 에이전트 작업을 위한 Preserved Thinking은 chat_template_kwargs(SGLang 전용)를 통해 구성됩니다.
- 하드웨어 표에는 BF16 및 FP8에 대한 최소 및 전체 컨텍스트 GPU 구성이 나열됩니다(예: 8x H100의 GLM-4.5 FP8, 2x H100의 GLM-4.5-Air FP8, 전체 128K 컨텍스트의 경우 더 많은 수).
- 가이드는 xLLM을 통한 Ascend NPU 배포 및 AMD GPU 배포를 다룹니다.
파인튜닝
Llama Factory 및 ms-swift에 대한 파인튜닝 구성이 문서화되어 있으며, H100 및 H20 GPU 수를 사용한 LoRA, SFT 및 RL 설정을 포함합니다.
평가 및 도구
저장소는 도구 통합 추론 가이드 및 검색 에이전트 궤적 템플릿을 연결하고 OpenAI 스타일 도구 호출을 위한 API 요청 예제를 제공합니다. 기술 보고서는 arXiv에서 제공되며, API 서비스는 Z.ai 플랫폼을 통해 제공됩니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.