منصوبے کے بارے میں

MoziAI-35B-V3.8 ایک مقامی طور پر تعینات کیے جانے والا اوپن سورس ملٹی موڈل بڑا لینگویج ماڈل ہے جسے چن یومو ٹیم نے تیار کیا ہے۔ یہ Ornith-1.5-35B-A3B بیس پر مبنی ہے (Qwen3.5/3.6-35B-A3B فن تعمیر، MoE جس میں 256 روٹنگ ماہرین اور 1 مشترکہ ماہر شامل ہیں، فی ٹوکن 8 ماہرین فعال ہوتے ہیں) اور اسے GGUF فائل کی شکل میں تقسیم کیا جاتا ہے تاکہ llama.cpp، Ollama، LM Studio اور Jan میں استعمال کیا جا سکے۔ سب سے نمایاں خصوصیت خود تیار کردہ MoziSmartBit ہائبرڈ کوانٹائزیشن ہے، جو 35B پیرامیٹرز والے MoE ماڈل کو تقریباً 15.9 GB تک کمپریس کرتی ہے — معیاری Q4_K_M بلڈ (~22 GB) سے تقریباً 30% چھوٹا — جبکہ مبینہ طور پر FP16 کی درستگی کا تقریباً 99% برقرار رکھتی ہے۔ ماڈل 256K (262,144 ٹوکن) سیاق و سباق کی ونڈو، الگ mmproj پروجیکٹر فائل کے ذریعے ملٹی موڈل ویژن، اور مقامی ٹول کالنگ سپورٹ کرتا ہے۔ README میں بتایا گیا ہے کہ تخمینی رفتار AMD R9700 GPU پر 140+ ٹوکن فی سیکنڈ اور AMD MAX+395 iGPU پر 70+ ٹوکن فی سیکنڈ ہے جب اسپیکیولیٹو ڈی کوڈنگ فعال ہو۔ دو استدلالی میکانزم بیان کیے گئے ہیں۔ پہلا ایک متحرک سات جہتی سوچ کا فریم ورک ہے جو سادہ سوال و جواب کے لیے دو جہتی فوری جواب سے وسعت پاتا ہے اور پیچیدہ ترقیاتی اور حکمت عملی کے کاموں کے لیے مکمل سات جہتی گہرے استدلال تک پہنچ جاتا ہے، جو moziAI-Think مارکر سے متحرک ہوتا ہے۔ دوسرا Agent LOOP تکرار میکانزم ہے جو پیچیدہ کاموں پر دو راؤنڈ کا عمل-پھر-تصدیق سائیکل چلاتا ہے، اور سادہ سوالات کے لیے خودکار طور پر چھوڑ دیا جاتا ہے۔ دونوں کو ایک حسب ضرورت Jinja چیٹ ٹیمپلیٹ کے ذریعے شامل کیا جاتا ہے جسے ماڈل کے وزن کے ساتھ لوڈ کرنا ضروری ہے۔ ماڈل کو مالیاتی عمودی معاون کے طور پر پیش کیا گیا ہے، جس میں مارکیٹ تجزیہ، آمدنی اور تحقیق کی تشریح، رسک اور تعمیل کا جائزہ، کوانٹ حکمت عملی ڈیزائن، اور لائیو مارکیٹ ڈیٹا، ڈیٹا بیسز اور تحقیق کی بازیافت میں پلگ ایبل ٹول کالنگ کی دستاویزی صلاحیتیں شامل ہیں۔ یہ عمومی پروگرامنگ، تحریر، اور 201 زبانوں میں کثیر لسانی سپورٹ کے ساتھ ساتھ بیس ماڈل سے وراثت میں ملنے والا غیر سنسر شدہ آؤٹ پٹ موڈ بھی پیش کرتا ہے۔ تعیناتی کے لیے تین فائلیں درکار ہیں: ریپوزٹری روٹ پر مرکزی GGUF ماڈل، mmproj/35B/ کے تحت ویژن پروجیکٹر، اور V3.8/ کے تحت چیٹ ٹیمپلیٹ۔ README میں کم سے کم اور مکمل llama-server لانچ کمانڈز، تجویز کردہ سیمپلنگ پیرامیٹرز (temperature 0.6–0.8، top_p 0.95، top_k 20، min_p 0.024) اور VRAM رہنمائی فراہم کی گئی ہے — ویژن کے ساتھ 150K سیاق و سباق کے لیے 20 GB، ویژن کے ساتھ مکمل 256K کے لیے 24 GB، اور زیادہ سے زیادہ ہیڈ روم کے لیے 32 GB+۔ Ollama تعیناتی Modelfile کے ذریعے دکھائی گئی ہے، حالانکہ README نوٹ کرتا ہے کہ mmproj اور چیٹ ٹیمپلیٹس کے لیے Ollama کی حمایت llama.cpp کے مقابلے میں محدود ہے۔ بینچ مارکس Ornith-1.0-35B-A3B، Qwen3.6-35B-A3B، Gemma-4-31B، Muse-Glimmer-30B اور Qwen3.5-397B کے خلاف پیش کیے گئے ہیں، جن میں کوڈنگ (Terminal-Bench، SWE-bench متغیرات، NL2Repo)، استدلال (HLE، GPQA Diamond) اور ایجنٹک (MCP-Atlas، Toolathlon، WideSearch، BrowseComp، ClawEval) سوئٹ شامل ہیں۔ لائسنس ایک حسب ضرورت MoziAI ماڈل لائسنس ہے جس میں Qwen3.5/3.6 اور Gemma 4 کے Apache-2.0 اپ اسٹریم اجزاء شامل ہیں، اور ماڈل کو تجارتی استعمال کے لیے مفت قرار دیا گیا ہے۔