Sobre el proyecto
AngelSlim es el kit de herramientas de compresión de modelos de código abierto de Tencent, posicionado como un marco unificado para la compresión de modelos grandes con énfasis en la usabilidad, la amplitud de algoritmos y la eficiencia de extremo a extremo. Está dirigido a LLM, modelos de lenguaje-visión, modelos de difusión y modelos de voz (TTS/ASR), e incluye herramientas tanto del lado del entrenamiento como del lado del despliegue.
Estrategias de compresión cubiertas
Cuantización: FP8 estática/dinámica, INT8 dinámica, INT4 GPTQ/AWQ/GPTAQ, NVFP4, FOCUS FP4 (MXFP4/NVFP4), LeptoQuant, además de algoritmos de investigación de bits bajos como Tequila (ternario) y Sherry (1.25 bits). Se admite la destilación consciente de la cuantización en Megatron-Core con paralelismo TP/EP/CP/SP para Qwen3-MoE y Hy3.
Decodificación especulativa: el proyecto integra AngelSpec, un marco de entrenamiento desagregado nativo de torch para modelos de borrador, con métodos que incluyen DFly, DFlare, DFlash, DSpark, MTP, Eagle3 y SpecExit. El diseño separa la inferencia (modelo objetivo congelado, extracción de estados ocultos) de los trabajadores de entrenamiento, transmitiendo estados ocultos a través de RDMA mediante Mooncake. Admite backends de vLLM, SGLang y HuggingFace, entrenamiento de secuencias largas con paralelismo de secuencia Ulysses, empaquetado consciente de documentos, evaluación de tasa de aceptación en línea, fragmentación de MoE multinodo y poda de vocabulario.
Otras técnicas: atención dispersa (Stem, variantes de MInference, FlexPrefill, XAttention, FlashPrefill, VecAttention, CoSA), destilación para modelos de precisión completa y de estilo QAT, y poda/fusión de tokens de visión (por ejemplo, VisionZip, IDPruner). Los modelos de difusión también admiten métodos de almacenamiento en caché como DeepCache, TeaCache y TaylorCache.
Cobertura de modelos
El README enumera soporte para las familias Hunyuan densa y MoE, Qwen3, Qwen2.5, DeepSeek-V3/R1, GLM-4.6, Hunyuan-VL, HunyuanOCR, Qwen3-VL, Qwen2.5-VL, Hunyuan-Image/Video/3D, Qwen-Image, FLUX, Wan, SDXL, Qwen3-Omni, Qwen2-Audio y Fun-CosyVoice3. Los artefactos publicados incluyen pesos cuantizados en Hugging Face y ModelScope, como Qwen3-32B-NVFP4, Qwen3-235B-A22B-NVFP4, modelos de traducción Hy-MT1.5-1.8B de 2 bits y 1.25 bits, y una compilación GGUF de Hy4-preview.
Uso
La instalación se realiza mediante pip (angelslim) o desde el código fuente. La cuantización se puede ejecutar a través de configuraciones YAML, por ejemplo, una ejecución FP8 estática de un solo comando para Qwen3-1.7B, o programáticamente a través de una API de Engine que prepara un modelo, selecciona un compresor como PTQ con fp8_dynamic, ejecuta la compresión y guarda la salida. La cuantización e inferencia de difusión utilizan un script dedicado con opciones para tipo de cuantización, prompt, resolución, pasos, guía y semilla. La poda de tokens tiene un script de prueba rápida impulsado por una configuración de estrategia YAML. Las rutas de despliegue incluyen inferencia sin conexión con transformers y servidores API compatibles con OpenAI lanzados a través de scripts de vLLM o SGLang.
Ecosistema y documentación
El proyecto enlaza un informe técnico, documentación de ReadTheDocs, organizaciones de Hugging Face y ModelScope, canales de WeChat y Discord, y un repositorio separado de AngelSpec. Un registro de cambios en el README rastrea las versiones desde v0.2 y v0.3 hasta numerosas adiciones de algoritmos y modelos.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.