このプロジェクトについて
PowerInferは、パーソナルコンピュータ上で大規模言語モデルを展開するための推論ランタイムです。その設計はアクティベーションの局所性を活用しています。一貫してアクティブなニューロンはGPUに保持され、入力依存のニューロンはCPUで実行されます。適応型予測器とニューロン認識スパース演算子がこの分割を導き、GPUメモリの圧力とCPU-GPU間のデータ転送を削減します。ハイブリッド推論は、利用可能なすべてのVRAMを使用するか、設定可能な`--vram-budget`制限に従うことができます。CPUのみの推論も利用可能です。
このプロジェクトは、モデルと予測器の重みを含むPowerInfer GGUFファイルを使用し、元のモデルと予測器のリポジトリを変換するためのツールを提供します。INT4 Q4_0量子化、限定的な密推論モード、ローカルサーバー、バッチ生成、パープレキシティ評価をサポートしています。コマンドラインの例は主にllama.cppの使用方法に従っていますが、PowerInferのオフロードには`-ngl`の代わりに`--vram-budget`が使用されます。
文書化されたモデルファミリーには、Falcon-40B、ReLUベースのLlama 2バリアント、ProSparse Llama 2、Bamboo-7Bが含まれます。互換性は一般的ではありません。FAQによると、モデルはReLU、ReGLU、またはSquared ReLUアクティベーションを使用する必要があり、Mistral、元のLlama、Qwenなどのサポートされていないアーキテクチャは現在カバーされていません。
PowerInferは、x86-64 AVX2 CPUを搭載したLinuxまたはWindows上でCMakeとPythonを使用してビルドし、NVIDIA CUDAおよびAMD ROCm/HIPパス、CPUのみの操作を提供します。Apple Silicon CPU推論はmacOS向けにリストされていますが、READMEにはそこで最適化されておらず、Metalスパース推論は計画中であると記載されています。READMEは、特定のRTX 4090およびRTX 2080 Tiテストでのベンチマーク結果を報告し、評価の詳細についての論文にリンクしています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.