Об этом проекте
Unified Latent-State Memory Fabric (UL-SMF) представлен как аппаратно-программный фреймворк сжатия памяти, нацеленный на устранение узкого места памяти при инференсе длинноконтекстных трансформеров. Заявленный подход сочетает конечное скалярное квантование (FSQ) с динамическим 16-мерным латентным отображением, реализованным через проприетарный компонент под названием Aegis-KV Oracle Core. Проект утверждает, что сжимает тензоры кэша ключ-значение (KV) до 384 раз, сохраняя более 94% семантического содержимого.
Репозиторий лицензирован под AGPLv3 и требует Python 3.10+ и PyTorch 2.0+. Однако критическое структурное ограничение явно задокументировано в README: хотя оркестрационный фреймворк и интерфейсы являются открытыми, полный производственный конвейер зависит от скомпилированного проприетарного бинарного файла (`aegis_kv_oracle_core.pt`), который не включен в репозиторий. Скрипт быстрого старта с открытым исходным кодом определяет структуру конвейера и поток данных, но локальное выполнение фактического сжатия зависит от этого лицензированного бинарного ядра. Обладатели коммерческой лицензии направляются на отдельный контактный адрес (inquiries@lawrencearchitectures.com) для получения оптимизированного бинарного файла, поддержки интеграции и маршрутизации VRAM с нулевым копированием.
README включает несколько таблиц с бенчмарками. Тест на извлечение контекста с несколькими иглами на модели `unsloth/llama-3-8b-Instruct-bnb-4bit` сообщает о 100% точности извлечения по трем целям при 4 892 токенах со сжатием 128D-в-16D. Таблица аппаратного профилирования сообщает о снижении VRAM на 14,66% (с 1317,52 МБ до 1124,34 МБ) с 3% накладными расходами на скорость генерации. Изолированная таблица профилирования тензоров заявляет о 384-кратном сокращении (с 48,00 МБ до 0,12 МБ) для 4096 токенов. Аудит перплексии на WikiText-2 сообщает о чистом ухудшении примерно на 0,0020. Представлен развернутый анализ по скорости искажения для латентных размерностей 32D, 16D, 8D и 4D, где 16D определено как оптимальная точка на границе Парето. Таблица масштабирования параллелизма показывает размеры пакетов от 1 до 16 с линейным ростом накладных расходов.
Пользователям следует учитывать, что открытая часть этого репозитория предоставляет только интерфейс и оркестрационный слой. Фактические алгоритмы сжатия находятся в проприетарном бинарном файле Aegis-KV, который недоступен в репозитории. Приведенные показатели бенчмарков являются самоотчетными и не могут быть независимо проверены без доступа к закрытому бинарному файлу. Математическая согласованность заявленных коэффициентов сжатия относительно указанной архитектуры модели должна быть оценена потенциальными пользователями перед тем, как полагаться на эти результаты.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.