À propos du projet
MoziAI-35B-V3.8 est un modèle de langage multimodal open source déployable localement développé par l'équipe de Chen Yumo. Il est basé sur la base Ornith-1.5-35B-A3B (architecture Qwen3.5/3.6-35B-A3B, MoE avec 256 experts de routage plus 1 expert partagé, 8 experts actifs par jeton) et est distribué sous forme de fichier GGUF pour une utilisation avec llama.cpp, Ollama, LM Studio et Jan.
La fonctionnalité phare est la quantification hybride MoziSmartBit développée en interne, qui compresse le modèle MoE de 35B paramètres à environ 15,9 Go — soit environ 30% de moins qu'une version standard Q4_K_M (~22 Go) — tout en conservant, selon les rapports, environ 99% de la précision FP16. Le modèle prend en charge une fenêtre de contexte de 256K (262 144 jetons), la vision multimodale via un fichier projecteur mmproj séparé, et l'appel d'outils natif. Le README rapporte des vitesses d'inférence de 140+ tok/s sur un GPU AMD R9700 et de 70+ tok/s sur un iGPU AMD MAX+395 lorsque le décodage spéculatif est activé.
Deux mécanismes de raisonnement sont décrits. Le premier est un cadre de réflexion dynamique à sept dimensions qui passe d'une réponse rapide à deux dimensions pour les questions-réponses simples à un raisonnement profond complet à sept dimensions pour les tâches complexes de développement et de stratégie, déclenché par un marqueur moziAI-Think. Le second est un mécanisme d'itération Agent LOOP qui exécute un cycle exécuter puis vérifier en deux tours sur les tâches complexes, automatiquement ignoré pour les requêtes simples. Les deux sont injectés via un modèle de chat Jinja personnalisé qui doit être chargé avec les poids du modèle.
Le modèle est positionné comme un assistant vertical financier, avec des capacités documentées en analyse de marché, interprétation des résultats et de la recherche, examen des risques et de la conformité, conception de stratégies quantitatives, et appel d'outils enfichables vers les données de marché en direct, les bases de données et la récupération de recherches. Il annonce également la programmation générale, l'écriture et la prise en charge multilingue dans 201 langues, ainsi qu'un mode de sortie non censuré hérité du modèle de base.
Le déploiement nécessite trois fichiers : le modèle GGUF principal à la racine du dépôt, le projecteur de vision sous mmproj/35B/, et le modèle de chat sous V3.8/. Le README fournit des commandes de lancement minimales et complètes pour llama-server, des paramètres d'échantillonnage recommandés (température 0,6–0,8, top_p 0,95, top_k 20, min_p 0,024) et des recommandations de VRAM — 20 Go pour un contexte de 150K avec vision, 24 Go pour 256K complet avec vision, et 32 Go+ pour une marge maximale. Le déploiement avec Ollama est présenté via un Modelfile, bien que le README note que le support d'Ollama pour mmproj et les modèles de chat est limité par rapport à llama.cpp.
Des benchmarks sont fournis contre Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B et Qwen3.5-397B dans les suites de codage (Terminal-Bench, variantes SWE-bench, NL2Repo), de raisonnement (HLE, GPQA Diamond) et d'agents (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval). La licence est une licence de modèle MoziAI personnalisée avec des composants amont Apache-2.0 de Qwen3.5/3.6 et Gemma 4, et le modèle est annoncé comme gratuit pour un usage commercial.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.