প্রকল্প সম্পর্কে
MoziAI-35B-V3.8 হলো চেন ইউমো টিমের তৈরি একটি লোকালি ডিপ্লয়যোগ্য ওপেন-সোর্স মাল্টিমোডাল লার্জ ল্যাঙ্গুয়েজ মডেল। এটি Ornith-1.5-35B-A3B বেসের উপর নির্মিত (Qwen3.5/3.6-35B-A3B আর্কিটেকচার, 256 রাউটিং এক্সপার্ট এবং 1 শেয়ার্ড এক্সপার্ট সহ MoE, প্রতি টোকেনে 8 এক্সপার্ট সক্রিয়) এবং llama.cpp, Ollama, LM Studio এবং Jan-এ ব্যবহারের জন্য GGUF ফাইল হিসেবে বিতরণ করা হয়।
প্রধান বৈশিষ্ট্য হলো স্ব-উন্নত MoziSmartBit হাইব্রিড কোয়ান্টাইজেশন, যা 35B-প্যারামিটার MoE মডেলকে প্রায় 15.9 GB-এ সংকুচিত করে — স্ট্যান্ডার্ড Q4_K_M বিল্ডের (~22 GB) চেয়ে প্রায় 30% ছোট — এবং রিপোর্ট অনুযায়ী FP16 নির্ভুলতার প্রায় 99% ধরে রাখে। মডেলটি 256K (262,144 টোকেন) কনটেক্সট উইন্ডো, আলাদা mmproj প্রজেক্টর ফাইলের মাধ্যমে মাল্টিমোডাল ভিশন এবং নেটিভ টুল কলিং সমর্থন করে। README-তে স্পেকুলেটিভ ডিকোডিং চালু থাকলে AMD R9700 GPU-তে 140+ tok/s এবং AMD MAX+395 iGPU-তে 70+ tok/s ইনফারেন্স গতি উল্লেখ করা হয়েছে।
দুটি রিজনিং মেকানিজম বর্ণনা করা হয়েছে। প্রথমটি হলো একটি ডাইনামিক সেভেন-ডাইমেনশনাল থিংকিং ফ্রেমওয়ার্ক, যা সাধারণ প্রশ্নের জন্য দুই-ডাইমেনশন দ্রুত উত্তর থেকে শুরু করে জটিল ডেভেলপমেন্ট এবং স্ট্র্যাটেজি কাজের জন্য সম্পূর্ণ সাত-ডাইমেনশন ডিপ রিজনিং পাস পর্যন্ত বিস্তৃত হয়, যা moziAI-Think মার্কার দ্বারা ট্রিগার হয়। দ্বিতীয়টি হলো Agent LOOP ইটারেশন মেকানিজম, যা জটিল কাজগুলিতে দুই-রাউন্ডের execute-then-verify চক্র চালায় এবং সাধারণ প্রশ্নের জন্য স্বয়ংক্রিয়ভাবে এড়িয়ে যায়। উভয়ই একটি কাস্টম Jinja চ্যাট টেমপ্লেটের মাধ্যমে ইনজেক্ট করা হয়, যা মডেল ওয়েটের সাথে লোড করতে হয়।
মডেলটি একটি ফিন্যান্সিয়াল ভার্টিক্যাল অ্যাসিস্ট্যান্ট হিসেবে অবস্থান করছে, যার নথিভুক্ত ক্ষমতার মধ্যে রয়েছে মার্কেট অ্যানালাইসিস, আর্নিংস ও রিসার্চ ইন্টারপ্রিটেশন, রিস্ক ও কমপ্লায়েন্স রিভিউ, কোয়ান্ট স্ট্র্যাটেজি ডিজাইন এবং লাইভ মার্কেট ডেটা, ডেটাবেস ও রিসার্চ রিট্রিভালে প্লাগেবল টুল কলিং। এটি সাধারণ প্রোগ্রামিং, লেখালেখি এবং ২০১টি ভাষায় বহুভাষিক সমর্থন, পাশাপাশি বেস মডেল থেকে পাওয়া আনসেন্সর্ড আউটপুট মোডও বিজ্ঞাপন দেয়।
ডিপ্লয়মেন্টের জন্য তিনটি ফাইল প্রয়োজন: রিপোজিটরি রুটে মূল GGUF মডেল, mmproj/35B/ ফোল্ডারে ভিশন প্রজেক্টর এবং V3.8/ ফোল্ডারে চ্যাট টেমপ্লেট। README-তে ন্যূনতম এবং সম্পূর্ণ llama-server লঞ্চ কমান্ড, প্রস্তাবিত স্যামপ্লিং প্যারামিটার (temperature 0.6–0.8, top_p 0.95, top_k 20, min_p 0.024) এবং VRAM গাইডেন্স দেওয়া আছে — ভিশনসহ 150K কনটেক্সটের জন্য 20 GB, ভিশনসহ সম্পূর্ণ 256K-এর জন্য 24 GB এবং সর্বোচ্চ হেডরুমের জন্য 32 GB+। Ollama ডিপ্লয়মেন্ট Modelfile-এর মাধ্যমে দেখানো হয়েছে, তবে README-তে উল্লেখ করা হয়েছে যে Ollama-এর mmproj এবং চ্যাট টেমপ্লেট সমর্থন llama.cpp-এর তুলনায় সীমিত।
Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Gemma-4-31B, Muse-Glimmer-30B এবং Qwen3.5-397B-এর বিপরীতে কোডিং (Terminal-Bench, SWE-bench variants, NL2Repo), রিজনিং (HLE, GPQA Diamond) এবং এজেন্টিক (MCP-Atlas, Toolathlon, WideSearch, BrowseComp, ClawEval) স্যুটগুলিতে বেঞ্চমার্ক প্রদান করা হয়েছে। লাইসেন্সটি একটি কাস্টম MoziAI মডেল লাইসেন্স, যার Apache-2.0 আপস্ট্রিম কম্পোনেন্ট Qwen3.5/3.6 এবং Gemma 4 থেকে এসেছে এবং মডেলটি বাণিজ্যিক ব্যবহারের জন্য বিনামূল্যে বলে ঘোষণা করা হয়েছে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.