عن المشروع

AngelSlim هي مجموعة أدوات ضغط النماذج مفتوحة المصدر من تينسنت، وتُقدَّم كإطار موحّد لضغط النماذج الكبيرة مع التركيز على سهولة الاستخدام واتساع الخوارزميات والكفاءة من البداية إلى النهاية. وهي تستهدف نماذج LLM ونماذج الرؤية واللغة ونماذج الانتشار ونماذج الصوت (TTS/ASR)، وتوفّر أدوات لكل من جانب التدريب وجانب النشر. استراتيجيات الضغط المشمولة التكميم: FP8 ثابت/ديناميكي، INT8 ديناميكي، INT4 GPTQ/AWQ/GPTAQ، NVFP4، FOCUS FP4 (MXFP4/NVFP4)، LeptoQuant، إضافة إلى خوارزميات بحثية منخفضة البتات مثل Tequila (ثلاثي) وSherry (1.25 بت). ويُدعم التقطير الواعي بالتكميم على Megatron-Core مع توازي TP/EP/CP/SP لـ Qwen3-MoE وHy3. فك التشفير التخميني: يدمج المشروع AngelSpec، وهو إطار تدريب أصلي في torch ومفصول لنماذج المسودة، مع طرق تشمل DFly وDFlare وDFlash وDSpark وMTP وEagle3 وSpecExit. ويفصل التصميم بين الاستدلال (نموذج هدف مجمّد، واستخراج الحالات المخفية) وعمال التدريب، مع بث الحالات المخفية عبر RDMA بواسطة Mooncake. ويدعم خلفيات vLLM وSGLang وHuggingFace، والتدريب على التسلسلات الطويلة مع توازي التسلسل Ulysses، والتجميع الواعي بالمستندات، وتقييم معدل القبول عبر الإنترنت، وتجزئة MoE متعددة العقد، وتقليم المفردات. تقنيات أخرى: الانتباه المتناثر (Stem، متغيرات MInference، FlexPrefill، XAttention، FlashPrefill، VecAttention، CoSA)، والتقطير للنماذج كاملة الدقة والنماذج بنمط QAT، وتقليم/دمج رموز الرؤية (مثل VisionZip وIDPruner). كما تدعم نماذج الانتشار طرق التخزين المؤقت مثل DeepCache وTeaCache وTaylorCache. تغطية النماذج يسرد ملف README الدعم لعائلات Hunyuan الكثيفة وMoE، وQwen3، وQwen2.5، وDeepSeek-V3/R1، وGLM-4.6، وHunyuan-VL، وHunyuanOCR، وQwen3-VL، وQwen2.5-VL، وHunyuan-Image/Video/3D، وQwen-Image، وFLUX، وWan، وSDXL، وQwen3-Omni، وQwen2-Audio، وFun-CosyVoice3. وتشمل الإصدارات المنشورة أوزانًا مكمّمة على Hugging Face وModelScope، مثل Qwen3-32B-NVFP4، وQwen3-235B-A22B-NVFP4، ونماذج ترجمة Hy-MT1.5-1.8B ببتين و1.25 بت، وبناء Hy4-preview GGUF. الاستخدام يتم التثبيت عبر pip (angelslim) أو من المصدر. ويمكن تشغيل التكميم من خلال إعدادات YAML، مثل تشغيل FP8-static بأمر واحد لـ Qwen3-1.7B، أو برمجيًا عبر واجهة Engine API التي تجهّز نموذجًا، وتختار ضاغطًا مثل PTQ مع fp8_dynamic، وتنفّذ الضغط، وتحفظ الناتج. ويستخدم تكميم الانتشار والاستدلال نصًا مخصصًا مع خيارات لنوع التكميم والمطالبة والدقة والخطوات والتوجيه والبذرة. ولتقليم الرموز نص اختبار سريع يقوده إعداد استراتيجية YAML. وتشمل مسارات النشر الاستدلال دون اتصال باستخدام transformers وخوادم API متوافقة مع OpenAI تُطلق عبر نصوص vLLM أو SGLang. المنظومة والتوثيق يربط المشروع تقريرًا تقنيًا، وتوثيق ReadTheDocs، ومنظمات Hugging Face وModelScope، وقنوات WeChat وDiscord، ومستودع AngelSpec منفصلًا. ويتتبع سجل التغييرات في README الإصدارات من v0.2 وv0.3 عبر العديد من الإضافات الخوارزمية والنموذجية.