প্রকল্প সম্পর্কে
AngelSlim হলো টেনসেন্টের ওপেন-সোর্স মডেল কম্প্রেশন টুলকিট, যা বড়-মডেল কম্প্রেশনের জন্য একটি ইউনিফাইড ফ্রেমওয়ার্ক হিসেবে অবস্থান করছে, যেখানে ব্যবহারযোগ্যতা, অ্যালগরিদমের বিস্তৃতি এবং এন্ড-টু-এন্ড দক্ষতার উপর জোর দেওয়া হয়েছে। এটি LLM, ভিশন-ল্যাঙ্গুয়েজ মডেল, ডিফিউশন মডেল এবং স্পিচ (TTS/ASR) মডেলকে লক্ষ্য করে এবং প্রশিক্ষণ-পার্শ্ব ও ডিপ্লয়মেন্ট-পার্শ্ব উভয় টুলিং সরবরাহ করে।
কভার করা কম্প্রেশন কৌশল
কোয়ান্টাইজেশন: FP8 স্ট্যাটিক/ডাইনামিক, INT8 ডাইনামিক, INT4 GPTQ/AWQ/GPTAQ, NVFP4, FOCUS FP4 (MXFP4/NVFP4), LeptoQuant, সাথে Tequila (টারনারি) এবং Sherry (1.25-বিট) এর মতো লো-বিট গবেষণা অ্যালগরিদম। Megatron-Core-এ Qwen3-MoE এবং Hy3-এর জন্য TP/EP/CP/SP প্যারালেলিজম সহ কোয়ান্টাইজেশন-অ্যাওয়ার ডিস্টিলেশন সমর্থিত।
স্পেকুলেটিভ ডিকোডিং: প্রকল্পটি AngelSpec-কে সংহত করে, যা ড্রাফট মডেলের জন্য একটি torch-নেটিভ, ডিসঅ্যাগ্রিগেটেড প্রশিক্ষণ ফ্রেমওয়ার্ক, যার মধ্যে DFly, DFlare, DFlash, DSpark, MTP, Eagle3 এবং SpecExit পদ্ধতি রয়েছে। ডিজাইনটি ইনফারেন্স (ফ্রোজেন টার্গেট মডেল, হিডেন-স্টেট এক্সট্র্যাকশন) কে প্রশিক্ষণ ওয়ার্কার থেকে আলাদা করে, Mooncake-এর মাধ্যমে RDMA-তে হিডেন স্টেট স্ট্রিম করে। এটি vLLM, SGLang এবং HuggingFace ব্যাকএন্ড, Ulysses সিকোয়েন্স প্যারালেলিজম সহ দীর্ঘ-সিকোয়েন্স প্রশিক্ষণ, ডকুমেন্ট-অ্যাওয়ার প্যাকিং, অনলাইন অ্যাকসেপ্টেন্স-রেট মূল্যায়ন, মাল্টি-নোড MoE শার্ডিং এবং ভোকাবুলারি প্রুনিং সমর্থন করে।
অন্যান্য কৌশল: স্পার্স অ্যাটেনশন (Stem, MInference ভ্যারিয়েন্ট, FlexPrefill, XAttention, FlashPrefill, VecAttention, CoSA), ফুল-প্রিসিশন এবং QAT-স্টাইল মডেলের জন্য ডিস্টিলেশন, এবং ভিশন টোকেন প্রুনিং/মার্জিং (যেমন, VisionZip, IDPruner)। ডিফিউশন মডেল অতিরিক্তভাবে DeepCache, TeaCache এবং TaylorCache-এর মতো ক্যাশিং পদ্ধতি সমর্থন করে।
মডেল কভারেজ
README-তে Hunyuan ডেন্স এবং MoE পরিবার, Qwen3, Qwen2.5, DeepSeek-V3/R1, GLM-4.6, Hunyuan-VL, HunyuanOCR, Qwen3-VL, Qwen2.5-VL, Hunyuan-Image/Video/3D, Qwen-Image, FLUX, Wan, SDXL, Qwen3-Omni, Qwen2-Audio এবং Fun-CosyVoice3-এর জন্য সমর্থন তালিকাভুক্ত। প্রকাশিত আর্টিফ্যাক্টগুলির মধ্যে Hugging Face এবং ModelScope-এ কোয়ান্টাইজড ওয়েট অন্তর্ভুক্ত, যেমন Qwen3-32B-NVFP4, Qwen3-235B-A22B-NVFP4, Hy-MT1.5-1.8B 2-বিট এবং 1.25-বিট অনুবাদ মডেল, এবং একটি Hy4-প্রিভিউ GGUF বিল্ড।
ব্যবহার
ইনস্টলেশন pip (angelslim) বা সোর্স থেকে করা যায়। কোয়ান্টাইজেশন YAML কনফিগের মাধ্যমে চালানো যায়, যেমন Qwen3-1.7B-এর জন্য একটি এক-কমান্ড FP8-স্ট্যাটিক রান, অথবা একটি Engine API-এর মাধ্যমে প্রোগ্রাম্যাটিকভাবে যা একটি মডেল প্রস্তুত করে, fp8_dynamic সহ PTQ-এর মতো একটি কম্প্রেসার নির্বাচন করে, কম্প্রেশন চালায় এবং আউটপুট সংরক্ষণ করে। ডিফিউশন কোয়ান্টাইজেশন এবং ইনফারেন্স একটি ডেডিকেটেড স্ক্রিপ্ট ব্যবহার করে যেখানে কোয়ান্ট টাইপ, প্রম্পট, রেজোলিউশন, স্টেপ, গাইডেন্স এবং সিডের বিকল্প রয়েছে। টোকেন প্রুনিং-এ একটি YAML কৌশল কনফিগ দ্বারা চালিত একটি স্মোক-টেস্ট স্ক্রিপ্ট রয়েছে। ডিপ্লয়মেন্ট পাথে ট্রান্সফরমার সহ অফলাইন ইনফারেন্স এবং vLLM বা SGLang স্ক্রিপ্টের মাধ্যমে চালু করা OpenAI-সামঞ্জস্যপূর্ণ API সার্ভার অন্তর্ভুক্ত।
ইকোসিস্টেম এবং ডকুমেন্টেশন
প্রকল্পটি একটি টেকনিক্যাল রিপোর্ট, ReadTheDocs ডকুমেন্টেশন, Hugging Face এবং ModelScope সংস্থা, WeChat এবং Discord চ্যানেল এবং একটি পৃথক AngelSpec রিপোজিটরির সাথে লিঙ্ক করে। README-তে একটি চেঞ্জলগ v0.2 এবং v0.3 থেকে অসংখ্য অ্যালগরিদম এবং মডেল সংযোজনের মাধ্যমে রিলিজ ট্র্যাক করে।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.