프로젝트 소개
MoziAI-35B-V3.8은 Chen Yumo 팀이 개발한 로컬 배포 가능한 오픈소스 멀티모달 대규모 언어 모델입니다. Ornith-1.5-35B-A3B 베이스(Qwen3.5/3.6-35B-A3B 아키텍처, 256개 라우팅 전문가와 1개 공유 전문가로 구성된 MoE, 토큰당 8개 전문가 활성)를 기반으로 하며, llama.cpp, Ollama, LM Studio, Jan에서 사용할 수 있는 GGUF 파일로 배포됩니다.
핵심 기능은 자체 개발한 MoziSmartBit 하이브리드 양자화로, 35B 파라미터 MoE 모델을 약 15.9GB로 압축합니다. 이는 표준 Q4_K_M 빌드(약 22GB)보다 약 30% 작은 크기이며, FP16 정확도의 약 99%를 유지한다고 보고됩니다. 모델은 256K(262,144 토큰) 컨텍스트 창, 별도 mmproj 프로젝터 파일을 통한 멀티모달 비전, 네이티브 도구 호출을 지원합니다. README에 따르면 AMD R9700 GPU에서 140+ tok/s, AMD MAX+395 iGPU에서 70+ tok/s의 추론 속도를 보이며, 추측 디코딩을 활성화했을 때의 수치입니다.
두 가지 추론 메커니즘이 설명되어 있습니다. 첫 번째는 동적 7차원 사고 프레임워크로, 간단한 Q&A에는 2차원 빠른 답변에서 시작하여 복잡한 개발 및 전략 작업에는 전체 7차원 심층 추론으로 확장되며, moziAI-Think 마커로 트리거됩니다. 두 번째는 Agent LOOP 반복 메커니즘으로, 복잡한 작업에 대해 실행 후 검증의 2라운드 사이클을 수행하며 간단한 쿼리에는 자동으로 건너뜁니다. 두 메커니즘 모두 모델 가중치와 함께 로드해야 하는 커스텀 Jinja 채팅 템플릿을 통해 주입됩니다.
이 모델은 금융 수직 분야 어시스턴트로 포지셔닝되며, 시장 분석, 실적 및 리서치 해석, 위험 및 컴플라이언스 검토, 퀀트 전략 설계, 실시간 시장 데이터·데이터베이스·리서치 검색에 대한 플러그형 도구 호출 기능이 문서화되어 있습니다. 또한 일반 프로그래밍, 글쓰기, 201개 언어 다국어 지원, 베이스 모델에서 상속된 무검열 출력 모드도 제공합니다.
배포에는 세 개의 파일이 필요합니다: 저장소 루트의 메인 GGUF 모델, mmproj/35B/ 디렉토리의 비전 프로젝터, V3.8/ 디렉토리의 채팅 템플릿입니다. README는 최소 및 전체 llama-server 실행 명령, 권장 샘플링 파라미터(온도 0.6–0.8, top_p 0.95, top_k 20, min_p 0.024), VRAM 가이드(비전 포함 150K 컨텍스트에 20GB, 비전 포함 전체 256K에 24GB, 최대 여유 공간에 32GB 이상)를 제공합니다. Ollama 배포는 Modelfile을 통해 설명되지만, README는 Ollama의 mmproj 및 채팅 템플릿 지원이 llama.cpp에 비해 제한적이라고 언급합니다.
벤치마크는 Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B, Qwen3.5-397B와 비교하여 코딩(Terminal-Bench, SWE-bench 변형, NL2Repo), 추론(HLE, GPQA Diamond), 에이전트(MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval) 스위트에서 제공됩니다. 라이선스는 Qwen3.5/3.6 및 Gemma 4의 Apache-2.0 업스트림 구성 요소를 포함한 커스텀 MoziAI 모델 라이선스이며, 상업적 사용은 무료로 명시되어 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.