このプロジェクトについて
AngelSlimはTencentのオープンソースモデル圧縮ツールキットであり、使いやすさ、アルゴリズムの幅広さ、エンドツーエンドの効率性を重視した大規模モデル圧縮の統合フレームワークとして位置づけられている。LLM、視覚言語モデル、拡散モデル、音声(TTS/ASR)モデルを対象とし、トレーニング側とデプロイ側の両方のツールを提供する。
対応する圧縮戦略
量子化: FP8静的/動的、INT8動的、INT4 GPTQ/AWQ/GPTAQ、NVFP4、FOCUS FP4(MXFP4/NVFP4)、LeptoQuantに加え、Tequila(三値)やSherry(1.25ビット)などの低ビット研究アルゴリズム。量子化対応蒸留はMegatron-Core上でTP/EP/CP/SP並列性を用いてQwen3-MoEとHy3向けにサポートされる。
投機的復号: このプロジェクトは、ドラフトモデル用のtorchネイティブで分離されたトレーニングフレームワークであるAngelSpecを統合しており、DFly、DFlare、DFlash、DSpark、MTP、Eagle3、SpecExitなどの手法を含む。設計は推論(凍結ターゲットモデル、隠れ状態抽出)とトレーニングワーカーを分離し、Mooncakeを介してRDMAで隠れ状態をストリーミングする。vLLM、SGLang、HuggingFaceバックエンドをサポートし、Ulyssesシーケンス並列性による長シーケンストレーニング、ドキュメント認識パッキング、オンライン受理率評価、マルチノードMoEシャーディング、語彙プルーニングを備える。
その他の技術: スパースアテンション(Stem、MInferenceバリアント、FlexPrefill、XAttention、FlashPrefill、VecAttention、CoSA)、全精度およびQATスタイルモデル向け蒸留、視覚トークンプルーニング/マージ(例: VisionZip、IDPruner)。拡散モデルはさらにDeepCache、TeaCache、TaylorCacheなどのキャッシュ手法をサポートする。
モデルカバレッジ
READMEには、Hunyuan denseおよびMoEファミリー、Qwen3、Qwen2.5、DeepSeek-V3/R1、GLM-4.6、Hunyuan-VL、HunyuanOCR、Qwen3-VL、Qwen2.5-VL、Hunyuan-Image/Video/3D、Qwen-Image、FLUX、Wan、SDXL、Qwen3-Omni、Qwen2-Audio、Fun-CosyVoice3のサポートが記載されている。リリースされた成果物には、Hugging FaceとModelScope上の量子化重み(例: Qwen3-32B-NVFP4、Qwen3-235B-A22B-NVFP4、Hy-MT1.5-1.8B 2ビットおよび1.25ビット翻訳モデル、Hy4-preview GGUFビルド)が含まれる。
使用方法
インストールはpip(angelslim)またはソースから行う。量子化はYAML設定で実行でき、例えばQwen3-1.7B向けのワンコマンドFP8静的実行や、モデルを準備し、fp8_dynamicなどの圧縮器を選択し、圧縮を実行して出力を保存するEngine APIを介してプログラム的に実行できる。拡散モデルの量子化と推論は、量子化タイプ、プロンプト、解像度、ステップ、ガイダンス、シードのオプションを持つ専用スクリプトを使用する。トークンプルーニングには、YAML戦略設定で駆動されるスモークテストスクリプトがある。デプロイパスには、transformersによるオフライン推論と、vLLMまたはSGLangスクリプトを介して起動されるOpenAI互換APIサーバーが含まれる。
エコシステムとドキュメント
このプロジェクトは、テクニカルレポート、ReadTheDocsドキュメント、Hugging FaceおよびModelScope組織、WeChatとDiscordチャンネル、別のAngelSpecリポジトリにリンクしている。READMEの変更ログは、v0.2およびv0.3から多数のアルゴリズムとモデルの追加を通じてリリースを追跡している。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.