Sobre o projeto

O AngelSlim é o kit de ferramentas open-source de compressão de modelos da Tencent, posicionado como uma estrutura unificada para compressão de grandes modelos, com ênfase na usabilidade, amplitude de algoritmos e eficiência ponta a ponta. Ele é voltado para LLMs, modelos de visão-linguagem, modelos de difusão e modelos de fala (TTS/ASR), e inclui ferramentas tanto para o lado de treinamento quanto para o lado de implantação. Estratégias de compressão abordadas Quantização: FP8 estático/dinâmico, INT8 dinâmico, INT4 GPTQ/AWQ/GPTAQ, NVFP4, FOCUS FP4 (MXFP4/NVFP4), LeptoQuant, além de algoritmos de pesquisa de baixa precisão como Tequila (ternário) e Sherry (1,25 bit). A destilação com reconhecimento de quantização é suportada no Megatron-Core com paralelismo TP/EP/CP/SP para Qwen3-MoE e Hy3. Decodificação especulativa: o projeto integra o AngelSpec, uma estrutura de treinamento nativa do torch e desagregada para modelos draft, com métodos incluindo DFly, DFlare, DFlash, DSpark, MTP, Eagle3 e SpecExit. O design separa a inferência (modelo alvo congelado, extração de estados ocultos) dos workers de treinamento, transmitindo estados ocultos por RDMA via Mooncake. Ele suporta backends vLLM, SGLang e HuggingFace, treinamento de sequências longas com paralelismo de sequência Ulysses, empacotamento com reconhecimento de documento, avaliação online da taxa de aceitação, sharding de MoE em múltiplos nós e poda de vocabulário. Outras técnicas: atenção esparsa (Stem, variantes do MInference, FlexPrefill, XAttention, FlashPrefill, VecAttention, CoSA), destilação para modelos de precisão total e no estilo QAT, e poda/mesclagem de tokens de visão (por exemplo, VisionZip, IDPruner). Modelos de difusão também suportam métodos de cache como DeepCache, TeaCache e TaylorCache. Cobertura de modelos O README lista suporte para as famílias densas e MoE do Hunyuan, Qwen3, Qwen2.5, DeepSeek-V3/R1, GLM-4.6, Hunyuan-VL, HunyuanOCR, Qwen3-VL, Qwen2.5-VL, Hunyuan-Image/Video/3D, Qwen-Image, FLUX, Wan, SDXL, Qwen3-Omni, Qwen2-Audio e Fun-CosyVoice3. Os artefatos publicados incluem pesos quantizados no Hugging Face e no ModelScope, como Qwen3-32B-NVFP4, Qwen3-235B-A22B-NVFP4, modelos de tradução Hy-MT1.5-1.8B de 2 bits e 1,25 bit, e uma build GGUF Hy4-preview. Uso A instalação é via pip (angelslim) ou a partir do código-fonte. A quantização pode ser executada por meio de configurações YAML, por exemplo, uma execução FP8-estática com um único comando para o Qwen3-1.7B, ou programaticamente por meio de uma API Engine que prepara um modelo, seleciona um compressor como PTQ com fp8_dynamic, executa a compressão e salva a saída. A quantização e a inferência de difusão usam um script dedicado com opções para tipo de quantização, prompt, resolução, passos, orientação e seed. A poda de tokens tem um script de smoke test guiado por uma configuração YAML de estratégia. Os caminhos de implantação incluem inferência offline com transformers e servidores de API compatíveis com OpenAI iniciados por meio de scripts vLLM ou SGLang. Ecossistema e documentação O projeto disponibiliza links para um relatório técnico, documentação no ReadTheDocs, organizações no Hugging Face e no ModelScope, canais no WeChat e Discord, e um repositório separado do AngelSpec. Um changelog no README acompanha as versões desde v0.2 e v0.3 até inúmeras adições de algoritmos e modelos.