Sobre o projeto

MoziAI-35B-V3.8 é um modelo de linguagem grande multimodal open-source, implantável localmente, desenvolvido pela equipe Chen Yumo. Ele é construído sobre a base Ornith-1.5-35B-A3B (arquitetura Qwen3.5/3.6-35B-A3B, MoE com 256 especialistas de roteamento mais 1 especialista compartilhado, 8 especialistas ativos por token) e é distribuído como um arquivo GGUF para uso com llama.cpp, Ollama, LM Studio e Jan. A característica principal é a quantização híbrida MoziSmartBit desenvolvida internamente, que comprime o modelo MoE de 35B de parâmetros para aproximadamente 15,9 GB — cerca de 30% menor que uma compilação Q4_K_M padrão (~22 GB) — enquanto supostamente retém cerca de 99% da precisão FP16. O modelo suporta uma janela de contexto de 256K (262.144 tokens), visão multimodal via um arquivo de projetor mmproj separado e chamada de ferramentas nativa. O README relata velocidades de inferência de 140+ tok/s em uma GPU AMD R9700 e 70+ tok/s em uma iGPU AMD MAX+395 quando a decodificação especulativa está habilitada. Dois mecanismos de raciocínio são descritos. O primeiro é um framework de pensamento dinâmico de sete dimensões que se expande de uma resposta rápida de duas dimensões para perguntas simples até uma passagem completa de raciocínio profundo de sete dimensões para tarefas complexas de desenvolvimento e estratégia, acionado por um marcador moziAI-Think. O segundo é um mecanismo de iteração Agent LOOP que executa um ciclo de executar-depois-verificar em duas rodadas em tarefas complexas, automaticamente ignorado para consultas simples. Ambos são injetados através de um modelo de chat Jinja personalizado que deve ser carregado junto com os pesos do modelo. O modelo é posicionado como um assistente vertical financeiro, com capacidades documentadas em análise de mercado, interpretação de lucros e pesquisas, revisão de risco e conformidade, design de estratégia quantitativa e chamada de ferramentas plugável em dados de mercado ao vivo, bancos de dados e recuperação de pesquisas. Ele também anuncia programação geral, escrita e suporte multilíngue em 201 idiomas, além de um modo de saída sem censura herdado do modelo base. A implantação requer três arquivos: o modelo GGUF principal na raiz do repositório, o projetor de visão sob mmproj/35B/ e o modelo de chat sob V3.8/. O README fornece comandos de lançamento mínimos e completos do llama-server, parâmetros de amostragem recomendados (temperatura 0,6–0,8, top_p 0,95, top_k 20, min_p 0,024) e orientação de VRAM — 20 GB para contexto de 150K com visão, 24 GB para 256K completo com visão e 32 GB+ para margem máxima. A implantação via Ollama é mostrada através de um Modelfile, embora o README observe que o suporte do Ollama para mmproj e modelos de chat é limitado em comparação com llama.cpp. Benchmarks são fornecidos contra Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B e Qwen3.5-397B em conjuntos de codificação (Terminal-Bench, variantes SWE-bench, NL2Repo), raciocínio (HLE, GPQA Diamond) e agêntico (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval). A licença é uma Licença de Modelo MoziAI personalizada com componentes upstream Apache-2.0 de Qwen3.5/3.6 e Gemma 4, e o modelo é declarado gratuito para uso comercial.