这个项目能做什么
MoziAI-35B-V3.8是由Chen Yumo团队开发的可本地部署的开源多模态大语言模型。它基于Ornith-1.5-35B-A3B基础(Qwen3.5/3.6-35B-A3B架构,MoE,256个路由专家加1个共享专家,每个token激活8个专家),并以GGUF文件形式发布,可用于llama.cpp、Ollama、LM Studio和Jan。
其核心亮点是自研的MoziSmartBit混合量化技术,将35B参数的MoE模型压缩至约15.9 GB——比标准Q4_K_M版本(约22 GB)小约30%——同时据称保留约99%的FP16精度。该模型支持256K(262,144 token)上下文窗口,通过单独的mmproj投影文件实现多模态视觉,并原生支持工具调用。README报告,启用推测解码时,在AMD R9700 GPU上推理速度可达140+ tok/s,在AMD MAX+395 iGPU上可达70+ tok/s。
文档描述了两种推理机制。第一种是动态七维思考框架,从针对简单问答的二维快速回答,扩展到针对复杂开发与策略任务的全七维深度推理过程,由moziAI-Think标记触发。第二种是Agent LOOP迭代机制,对复杂任务执行两轮“先执行后验证”的循环,对简单查询自动跳过。两者均通过自定义的Jinja聊天模板注入,该模板必须与模型权重一起加载。
该模型定位为金融垂直领域助手,具备市场分析、财报与研报解读、风险与合规审查、量化策略设计,以及可插拔工具调用(接入实时市场数据、数据库和研究检索)等文档化能力。它还宣称支持通用编程、写作,以及201种语言的多语言支持,并继承了基础模型的无审查输出模式。
部署需要三个文件:仓库根目录下的主GGUF模型、mmproj/35B/目录下的视觉投影器,以及V3.8/目录下的聊天模板。README提供了最小化和完整的llama-server启动命令、推荐采样参数(temperature 0.6–0.8,top_p 0.95,top_k 20,min_p 0.024),以及VRAM指南——带视觉的150K上下文需20 GB,带视觉的全256K需24 GB,最大余量需32 GB以上。通过Modelfile展示了Ollama部署方式,但README指出,与llama.cpp相比,Ollama对mmproj和聊天模板的支持有限。
基准测试提供了与Ornith-1.0-35B-A3B、Qwen3.6-35B-A3B、Gemma-4-31B、Muse-Glimmer-30B和Qwen3.5-397B的对比,涵盖编码(Terminal-Bench、SWE-bench变体、NL2Repo)、推理(HLE、GPQA Diamond)和智能体(MCP-Atlas、Toolathlon、WideSearch、BrowseComp、ClawEval)等测试集。许可证为自定义MoziAI模型许可证,包含来自Qwen3.5/3.6和Gemma 4的Apache-2.0上游组件,并声明该模型可免费商用。
评论
0 评分人数达到10人后显示
登录后参与讨论。