À propos du projet

AngelSlim est la boîte à outils open source de compression de modèles de Tencent, positionnée comme un cadre unifié pour la compression de grands modèles, mettant l'accent sur la facilité d'utilisation, l'étendue des algorithmes et l'efficacité de bout en bout. Elle cible les LLM, les modèles vision-langage, les modèles de diffusion et les modèles de parole (TTS/ASR), et fournit des outils à la fois côté entraînement et côté déploiement. Stratégies de compression couvertes Quantification : FP8 statique/dynamique, INT8 dynamique, INT4 GPTQ/AWQ/GPTAQ, NVFP4, FOCUS FP4 (MXFP4/NVFP4), LeptoQuant, ainsi que des algorithmes de recherche en bits faibles comme Tequila (ternaire) et Sherry (1,25 bit). La distillation consciente de la quantification est prise en charge sur Megatron-Core avec parallélisme TP/EP/CP/SP pour Qwen3-MoE et Hy3. Décodage spéculatif : le projet intègre AngelSpec, un cadre d'entraînement natif torch et désagrégé pour les modèles draft, avec des méthodes incluant DFly, DFlare, DFlash, DSpark, MTP, Eagle3 et SpecExit. La conception sépare l'inférence (modèle cible gelé, extraction d'états cachés) des workers d'entraînement, en diffusant les états cachés sur RDMA via Mooncake. Il prend en charge les backends vLLM, SGLang et HuggingFace, l'entraînement sur longues séquences avec le parallélisme de séquence Ulysses, le packing conscient des documents, l'évaluation en ligne du taux d'acceptation, le sharding MoE multi-nœuds et l'élagage du vocabulaire. Autres techniques : attention creuse (Stem, variantes MInference, FlexPrefill, XAttention, FlashPrefill, VecAttention, CoSA), distillation pour les modèles en pleine précision et de type QAT, et élagage/fusion de tokens de vision (par ex. VisionZip, IDPruner). Les modèles de diffusion prennent en outre en charge des méthodes de mise en cache telles que DeepCache, TeaCache et TaylorCache. Couverture des modèles Le README liste la prise en charge des familles Hunyuan dense et MoE, Qwen3, Qwen2.5, DeepSeek-V3/R1, GLM-4.6, Hunyuan-VL, HunyuanOCR, Qwen3-VL, Qwen2.5-VL, Hunyuan-Image/Video/3D, Qwen-Image, FLUX, Wan, SDXL, Qwen3-Omni, Qwen2-Audio et Fun-CosyVoice3. Les artefacts publiés incluent des poids quantifiés sur Hugging Face et ModelScope, tels que Qwen3-32B-NVFP4, Qwen3-235B-A22B-NVFP4, les modèles de traduction Hy-MT1.5-1.8B en 2 bits et 1,25 bit, et une build GGUF Hy4-preview. Utilisation L'installation se fait via pip (angelslim) ou depuis les sources. La quantification peut être exécutée via des configurations YAML, par exemple une exécution FP8-statique en une commande pour Qwen3-1.7B, ou par programmation via une API Engine qui prépare un modèle, sélectionne un compresseur tel que PTQ avec fp8_dynamic, exécute la compression et sauvegarde la sortie. La quantification et l'inférence de diffusion utilisent un script dédié avec des options pour le type de quantification, le prompt, la résolution, les étapes, le guidance et la graine. L'élagage de tokens dispose d'un script de smoke-test piloté par une configuration de stratégie YAML. Les chemins de déploiement incluent l'inférence hors ligne avec transformers et des serveurs API compatibles OpenAI lancés via des scripts vLLM ou SGLang. Écosystème et documentation Le projet renvoie à un rapport technique, à la documentation ReadTheDocs, aux organisations Hugging Face et ModelScope, aux canaux WeChat et Discord, et à un dépôt AngelSpec distinct. Un changelog dans le README suit les versions depuis v0.2 et v0.3 jusqu'à de nombreux ajouts d'algorithmes et de modèles.