इस प्रोजेक्ट के बारे में
MoziAI-35B-V3.8 चेन युमो टीम द्वारा विकसित एक स्थानीय रूप से तैनात करने योग्य ओपन-सोर्स मल्टीमॉडल बड़ा भाषा मॉडल है। यह Ornith-1.5-35B-A3B बेस (Qwen3.5/3.6-35B-A3B आर्किटेक्चर, 256 रूटिंग विशेषज्ञों के साथ MoE और 1 साझा विशेषज्ञ, प्रति टोकन 8 सक्रिय विशेषज्ञ) पर बनाया गया है और इसे llama.cpp, Ollama, LM Studio और Jan के साथ उपयोग के लिए GGUF फ़ाइल के रूप में वितरित किया जाता है।
मुख्य विशेषता स्व-विकसित MoziSmartBit हाइब्रिड क्वांटाइज़ेशन है, जो 35B-पैरामीटर MoE मॉडल को लगभग 15.9 GB तक संपीड़ित करता है — मानक Q4_K_M बिल्ड (~22 GB) से लगभग 30% छोटा — जबकि रिपोर्ट के अनुसार FP16 सटीकता का लगभग 99% बनाए रखता है। मॉडल 256K (262,144 टोकन) संदर्भ विंडो, अलग mmproj प्रोजेक्टर फ़ाइल के माध्यम से मल्टीमॉडल विज़न और मूल टूल कॉलिंग का समर्थन करता है। README AMD R9700 GPU पर 140+ tok/s और AMD MAX+395 iGPU पर 70+ tok/s की अनुमान गति की रिपोर्ट करता है जब सट्टा डिकोडिंग सक्षम होती है।
दो तर्क तंत्रों का वर्णन किया गया है। पहला एक गतिशील सात-आयामी सोच ढांचा है जो सरल Q&A के लिए दो-आयामी त्वरित उत्तर से लेकर जटिल विकास और रणनीति कार्यों के लिए पूर्ण सात-आयामी गहन तर्क पास तक विस्तारित होता है, जो moziAI-Think मार्कर द्वारा ट्रिगर होता है। दूसरा एक Agent LOOP पुनरावृत्ति तंत्र है जो जटिल कार्यों पर दो-दौर की निष्पादन-फिर-सत्यापन चक्र चलाता है, सरल प्रश्नों के लिए स्वचालित रूप से छोड़ दिया जाता है। दोनों को एक कस्टम Jinja चैट टेम्पलेट के माध्यम से इंजेक्ट किया जाता है जिसे मॉडल वेट के साथ लोड किया जाना चाहिए।
मॉडल को वित्तीय ऊर्ध्वाधर सहायक के रूप में स्थित किया गया है, जिसमें बाजार विश्लेषण, आय और अनुसंधान व्याख्या, जोखिम और अनुपालन समीक्षा, क्वांट रणनीति डिजाइन और लाइव बाजार डेटा, डेटाबेस और अनुसंधान पुनर्प्राप्ति में प्लग करने योग्य टूल कॉलिंग में प्रलेखित क्षमताएं हैं। यह सामान्य प्रोग्रामिंग, लेखन और 201 भाषाओं में बहुभाषी समर्थन, साथ ही बेस मॉडल से विरासत में मिला एक अनसेंसर्ड आउटपुट मोड भी विज्ञापित करता है।
तैनाती के लिए तीन फ़ाइलों की आवश्यकता होती है: रिपॉजिटरी रूट पर मुख्य GGUF मॉडल, mmproj/35B/ के तहत विज़न प्रोजेक्टर और V3.8/ के तहत चैट टेम्पलेट। README न्यूनतम और पूर्ण llama-server लॉन्च कमांड, अनुशंसित सैंपलिंग पैरामीटर (तापमान 0.6–0.8, top_p 0.95, top_k 20, min_p 0.024) और VRAM मार्गदर्शन प्रदान करता है — विज़न के साथ 150K संदर्भ के लिए 20 GB, विज़न के साथ पूर्ण 256K के लिए 24 GB और अधिकतम हेडरूम के लिए 32 GB+। Ollama तैनाती Modelfile के माध्यम से दिखाई गई है, हालांकि README नोट करता है कि Ollama का mmproj और चैट टेम्पलेट के लिए समर्थन llama.cpp की तुलना में सीमित है।
बेंचमार्क Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B और Qwen3.5-397B के खिलाफ कोडिंग (Terminal-Bench, SWE-bench वेरिएंट, NL2Repo), तर्क (HLE, GPQA Diamond) और एजेंटिक (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval) सुइट्स में प्रदान किए गए हैं। लाइसेंस Qwen3.5/3.6 और Gemma 4 से Apache-2.0 अपस्ट्रीम घटकों के साथ एक कस्टम MoziAI मॉडल लाइसेंस है, और मॉडल को व्यावसायिक उपयोग के लिए मुफ्त बताया गया है।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.