Об этом проекте

AngelSlim — это открытый набор инструментов Tencent для сжатия моделей, позиционируемый как единая платформа сжатия больших моделей с акцентом на удобство использования, широту алгоритмов и сквозную эффективность. Он ориентирован на LLM, визуально-языковые модели, диффузионные модели и речевые модели (TTS/ASR) и включает инструменты как для обучения, так и для развёртывания. Стратегии сжатия Квантизация: FP8 статическая/динамическая, INT8 динамическая, INT4 GPTQ/AWQ/GPTAQ, NVFP4, FOCUS FP4 (MXFP4/NVFP4), LeptoQuant, а также исследовательские алгоритмы низкой разрядности, такие как Tequila (тернарная) и Sherry (1,25 бита). Квантизационно-осведомлённая дистилляция поддерживается на Megatron-Core с параллелизмом TP/EP/CP/SP для Qwen3-MoE и Hy3. Спекулятивное декодирование: проект интегрирует AngelSpec — нативный для torch, разделённый фреймворк обучения черновых моделей с методами DFly, DFlare, DFlash, DSpark, MTP, Eagle3 и SpecExit. Архитектура разделяет инференс (замороженная целевая модель, извлечение скрытых состояний) и обучающие воркеры, передавая скрытые состояния по RDMA через Mooncake. Поддерживаются бэкенды vLLM, SGLang и HuggingFace, обучение на длинных последовательностях с параллелизмом последовательностей Ulysses, документно-ориентированная упаковка, онлайн-оценка acceptance rate, многоузловое шардирование MoE и прунинг словаря. Другие методы: разреженное внимание (Stem, варианты MInference, FlexPrefill, XAttention, FlashPrefill, VecAttention, CoSA), дистилляция для моделей полной точности и QAT-типа, а также прунинг/слияние визуальных токенов (например, VisionZip, IDPruner). Диффузионные модели дополнительно поддерживают методы кэширования, такие как DeepCache, TeaCache и TaylorCache. Покрытие моделей В README перечислена поддержка семейств Hunyuan dense и MoE, Qwen3, Qwen2.5, DeepSeek-V3/R1, GLM-4.6, Hunyuan-VL, HunyuanOCR, Qwen3-VL, Qwen2.5-VL, Hunyuan-Image/Video/3D, Qwen-Image, FLUX, Wan, SDXL, Qwen3-Omni, Qwen2-Audio и Fun-CosyVoice3. Опубликованные артефакты включают квантизованные веса на Hugging Face и ModelScope, например Qwen3-32B-NVFP4, Qwen3-235B-A22B-NVFP4, 2-битные и 1,25-битные модели перевода Hy-MT1.5-1.8B и сборку Hy4-preview GGUF. Использование Установка через pip (angelslim) или из исходников. Квантизацию можно запускать через YAML-конфиги, например одной командой FP8-static для Qwen3-1.7B, или программно через API Engine, который подготавливает модель, выбирает компрессор, например PTQ с fp8_dynamic, выполняет сжатие и сохраняет результат. Квантизация и инференс диффузионных моделей используют отдельный скрипт с опциями типа квантизации, промпта, разрешения, шагов, guidance и seed. Для прунинга токенов есть скрипт дымового тестирования, управляемый YAML-конфигом стратегии. Пути развёртывания включают офлайн-инференс с transformers и OpenAI-совместимые API-серверы, запускаемые через скрипты vLLM или SGLang. Экосистема и документация Проект ссылается на технический отчёт, документацию ReadTheDocs, организации Hugging Face и ModelScope, каналы WeChat и Discord, а также отдельный репозиторий AngelSpec. Журнал изменений в README отслеживает релизы от v0.2 и v0.3 до многочисленных добавлений алгоритмов и моделей.