منصوبے کے بارے میں

AngelSlim ٹینسنٹ کا اوپن سورس ماڈل کمپریشن ٹول کٹ ہے، جو بڑے ماڈل کمپریشن کے لیے ایک متحد فریم ورک کے طور پر پیش کیا گیا ہے جس میں استعمال میں آسانی، الگورتھم کی وسعت، اور اینڈ ٹو اینڈ کارکردگی پر زور دیا گیا ہے۔ یہ LLMs، وژن-لینگویج ماڈلز، ڈفیوژن ماڈلز، اور اسپیچ (TTS/ASR) ماڈلز کو ہدف بناتا ہے، اور ٹریننگ سائیڈ اور ڈیپلائمنٹ سائیڈ دونوں ٹولنگ فراہم کرتا ہے۔ کمپریشن حکمت عملیاں کوانٹائزیشن: FP8 اسٹیٹک/ڈائنامک، INT8 ڈائنامک، INT4 GPTQ/AWQ/GPTAQ، NVFP4، FOCUS FP4 (MXFP4/NVFP4)، LeptoQuant، نیز کم بٹ ریسرچ الگورتھم جیسے Tequila (ٹرنری) اور Sherry (1.25-بٹ)۔ کوانٹائزیشن-آویر ڈسٹلیشن Megatron-Core پر TP/EP/CP/SP پیریلیزم کے ساتھ Qwen3-MoE اور Hy3 کے لیے معاون ہے۔ اسپیکیولیٹو ڈی کوڈنگ: پروجیکٹ AngelSpec کو ضم کرتا ہے، جو ڈرافٹ ماڈلز کے لیے torch-native، ڈس ایگریگیٹڈ ٹریننگ فریم ورک ہے، جس میں DFly، DFlare، DFlash، DSpark، MTP، Eagle3، اور SpecExit شامل ہیں۔ ڈیزائن انفرنس (منجمد ہدف ماڈل، ہڈن-اسٹیٹ ایکسٹریکشن) کو ٹریننگ ورکرز سے الگ کرتا ہے، اور Mooncake کے ذریعے RDMA پر ہڈن اسٹیٹس اسٹریم کرتا ہے۔ یہ vLLM، SGLang، اور HuggingFace بیک اینڈز، Ulysses سیکوئنس پیریلیزم کے ساتھ لانگ-سیکوئنس ٹریننگ، ڈاکیومنٹ-آویر پیکنگ، آن لائن ایکسیپٹنس-ریٹ ایویلیوایشن، ملٹی-نوڈ MoE شیڈنگ، اور ووکیبلری پرووننگ کو سپورٹ کرتا ہے۔ دیگر تکنیکیں: اسپارس اٹینشن (Stem، MInference ورژنز، FlexPrefill، XAttention، FlashPrefill، VecAttention، CoSA)، فل-پریسیژن اور QAT-اسٹائل ماڈلز کے لیے ڈسٹلیشن، اور وژن ٹوکن پرووننگ/مرجنگ (جیسے VisionZip، IDPruner)۔ ڈفیوژن ماڈلز اضافی طور پر کیشنگ طریقے جیسے DeepCache، TeaCache، اور TaylorCache کو سپورٹ کرتے ہیں۔ ماڈل کوریج README میں Hunyuan ڈینس اور MoE فیملیز، Qwen3، Qwen2.5، DeepSeek-V3/R1، GLM-4.6، Hunyuan-VL، HunyuanOCR، Qwen3-VL، Qwen2.5-VL، Hunyuan-Image/Video/3D، Qwen-Image، FLUX، Wan، SDXL، Qwen3-Omni، Qwen2-Audio، اور Fun-CosyVoice3 کے لیے سپورٹ درج ہے۔ جاری کردہ آرٹیفیکٹس میں Hugging Face اور ModelScope پر کوانٹائزڈ ویٹس شامل ہیں، جیسے Qwen3-32B-NVFP4، Qwen3-235B-A22B-NVFP4، Hy-MT1.5-1.8B 2-بٹ اور 1.25-بٹ ترجمہ ماڈلز، اور Hy4-preview GGUF بلڈ۔ استعمال انسٹالیشن pip (angelslim) یا سورس سے کی جاتی ہے۔ کوانٹائزیشن YAML کنفگز کے ذریعے چلائی جا سکتی ہے، مثلاً Qwen3-1.7B کے لیے ایک کمانڈ FP8-اسٹیٹک رن، یا پروگرامی طور پر Engine API کے ذریعے جو ماڈل تیار کرتا ہے، fp8_dynamic کے ساتھ PTQ جیسا کمپریسر منتخب کرتا ہے، کمپریشن چلاتا ہے، اور آؤٹ پٹ محفوظ کرتا ہے۔ ڈفیوژن کوانٹائزیشن اور انفرنس ایک مخصوص اسکرپٹ استعمال کرتے ہیں جس میں کوانٹ ٹائپ، پرامپٹ، ریزولوشن، اسٹیپس، گائیڈنس، اور سیڈ کے آپشنز ہوتے ہیں۔ ٹوکن پرووننگ کے لیے YAML اسٹریٹیجی کنفگ سے چلنے والا اسموک-ٹیسٹ اسکرپٹ ہے۔ ڈیپلائمنٹ راستوں میں transformers کے ساتھ آف لائن انفرنس اور vLLM یا SGLang اسکرپٹس کے ذریعے لانچ کیے گئے OpenAI-کمپیٹیبل API سرورز شامل ہیں۔ ایکوسسٹم اور دستاویزات پروجیکٹ ایک ٹیکنیکل رپورٹ، ReadTheDocs دستاویزات، Hugging Face اور ModelScope آرگنائزیشنز، WeChat اور Discord چینلز، اور ایک الگ AngelSpec ریپوزٹری سے لنک کرتا ہے۔ README میں ایک چینج لاگ v0.2 اور v0.3 سے لے کر متعدد الگورتھم اور ماڈل اضافوں تک ریلیزز کو ٹریک کرتا ہے۔