Sobre el proyecto
MoziAI-35B-V3.8 es un modelo de lenguaje extenso multimodal de código abierto, desplegable localmente, desarrollado por el equipo de Chen Yumo. Está construido sobre la base Ornith-1.5-35B-A3B (arquitectura Qwen3.5/3.6-35B-A3B, MoE con 256 expertos de enrutamiento más 1 experto compartido, 8 expertos activos por token) y se distribuye como archivo GGUF para usarse con llama.cpp, Ollama, LM Studio y Jan.
La característica principal es la cuantización híbrida MoziSmartBit de desarrollo propio, que comprime el modelo MoE de 35B de parámetros a aproximadamente 15,9 GB — alrededor de un 30% más pequeño que una compilación Q4_K_M estándar (~22 GB) — aunque se informa que conserva alrededor del 99% de la precisión FP16. El modelo admite una ventana de contexto de 256K (262 144 tokens), visión multimodal mediante un archivo proyector mmproj separado y llamada nativa de herramientas. El README informa velocidades de inferencia de más de 140 tok/s en una GPU AMD R9700 y más de 70 tok/s en una iGPU AMD MAX+395 cuando la decodificación especulativa está activada.
Se describen dos mecanismos de razonamiento. El primero es un marco de pensamiento dinámico de siete dimensiones que se expande desde una respuesta rápida de dos dimensiones para preguntas sencillas hasta un pase completo de razonamiento profundo de siete dimensiones para tareas complejas de desarrollo y estrategia, activado por un marcador moziAI-Think. El segundo es un mecanismo de iteración Agent LOOP que ejecuta un ciclo de dos rondas de ejecutar y verificar en tareas complejas, que se omite automáticamente en consultas simples. Ambos se inyectan mediante una plantilla de chat personalizada de Jinja que debe cargarse junto con los pesos del modelo.
El modelo está posicionado como asistente vertical financiero, con capacidades documentadas en análisis de mercado, interpretación de ganancias e investigaciones, revisión de riesgos y cumplimiento, diseño de estrategias cuantitativas y llamada de herramientas conectable a datos de mercado en vivo, bases de datos y recuperación de investigaciones. También promociona programación general, redacción y soporte multilingüe en 201 idiomas, además de un modo de salida sin censura heredado del modelo base.
El despliegue requiere tres archivos: el modelo GGUF principal en la raíz del repositorio, el proyector de visión en mmproj/35B/ y la plantilla de chat en V3.8/. El README proporciona comandos de arranque de llama-server mínimos y completos, parámetros de muestreo recomendados (temperatura 0.6–0.8, top_p 0.95, top_k 20, min_p 0.024) y guía de VRAM: 20 GB para 150K de contexto con visión, 24 GB para 256K completos con visión y 32 GB+ para máximo margen. El despliegue con Ollama se muestra mediante un Modelfile, aunque el README señala que el soporte de Ollama para mmproj y plantillas de chat es limitado en comparación con llama.cpp.
Se proporcionan puntos de referencia contra Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B y Qwen3.5-397B en conjuntos de codificación (Terminal-Bench, variantes de SWE-bench, NL2Repo), razonamiento (HLE, GPQA Diamond) y de agente (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval). La licencia es una Licencia de Modelo MoziAI personalizada con componentes upstream Apache-2.0 de Qwen3.5/3.6 y Gemma 4, y se indica que el modelo es gratuito para uso comercial.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.