このプロジェクトについて

Unified Latent-State Memory Fabric(UL-SMF)は、長文脈Transformer推論におけるメモリボトルネックを対象とした、ハードウェア・ソフトウェア協調設計のメモリ圧縮ファブリックとして提示されています。提案手法は、有限スカラー量子化(FSQ)と動的な16次元潜在マッピングを組み合わせ、Aegis-KV Oracle Coreと呼ばれるプロプライエタリなコンポーネントを介して実装されています。このプロジェクトは、Key-Value(KV)キャッシュテンソルを最大384倍に圧縮し、意味内容の94%以上を保持すると主張しています。 リポジトリはAGPLv3の下でライセンスされ、Python 3.10+およびPyTorch 2.0+を必要とします。しかし、重大な構造的制限がREADMEに目立つ形で記載されています。オーケストレーションフレームワークとインターフェースはオープンソースですが、本番パイプライン全体は、リポジトリに含まれていないコンパイル済みプロプライエタリバイナリ(`aegis_kv_oracle_core.pt`)に依存しています。オープンソースのクイックスタートスクリプトはパイプライン構造とデータフローを定義しますが、実際の圧縮のローカル実行はこのライセンスされたコアバイナリに依存します。商用ライセンス保有者は、最適化されたバイナリ、統合サポート、ゼロコピーVRAMルーティングについて、別の連絡先(inquiries@lawrencearchitectures.com)に案内されています。 READMEにはいくつかのベンチマーク表が含まれています。`unsloth/llama-3-8b-Instruct-bnb-4bit`でのマルチニードル文脈検索テストでは、128Dから16Dへの圧縮で、4,892トークンにおいて3つのターゲットすべてで100%の検索忠実度が報告されています。ハードウェアプロファイリング表では、VRAMが14.66%削減(1317.52 MBから1124.34 MB)され、生成速度のオーバーヘッドは3%と報告されています。単体テンソルプロファイリング表では、4096トークンに対して384倍の削減(48.00 MBから0.12 MB)が主張されています。WikiText-2でのパープレキシティ監査では、正味の劣化は約0.0020と報告されています。32D、16D、8D、4Dの潜在次元にわたるレート歪みスイープが提示され、16Dが最適なパレートフロンティア点であると特定されています。並行性スケーリング表では、バッチサイズ1から16まで、線形のオーバーヘッド増加が示されています。 ユーザーは、このリポジトリのオープンソース部分はインターフェースとオーケストレーション層のみを提供することに注意すべきです。実際の圧縮アルゴリズムは、リポジトリでは入手できないプロプライエタリなAegis-KVバイナリに存在します。ベンチマーク数値は自己申告であり、クローズドバイナリにアクセスできなければ独立に検証できません。報告された圧縮率と記載されたモデルアーキテクチャとの間の数学的整合性は、これらの結果に依存する前に、採用予定ユーザーが評価すべきです。