这个项目能做什么

PowerInfer是一个用于在个人计算机上部署大型语言模型的推理运行时。其设计利用了激活局部性:持续活跃的神经元保留在GPU上,而输入相关的神经元在CPU上运行。自适应预测器和神经元感知的稀疏算子指导这种划分,减少GPU内存压力和CPU-GPU数据传输。混合推理可以使用所有可用的VRAM,或遵循可配置的--vram-budget限制;也支持仅CPU推理。 该项目使用包含模型和预测器权重的PowerInfer GGUF文件,并提供转换原始模型和预测器仓库的工具。它支持INT4 Q4_0量化、有限的密集推理模式、本地服务、批量生成和困惑度评估。其命令行示例主要遵循llama.cpp的用法,尽管--vram-budget替代了-ngl用于PowerInfer卸载。 文档化的模型系列包括Falcon-40B、基于ReLU的Llama 2变体、ProSparse Llama 2和Bamboo-7B。兼容性并不普遍:FAQ指出模型必须使用ReLU、ReGLU或Squared ReLU激活函数,因此不支持的架构(如Mistral、原始Llama和Qwen)目前不在覆盖范围内。 PowerInfer在Linux或Windows上使用CMake和Python构建,支持x86-64 AVX2 CPU,提供NVIDIA CUDA和AMD ROCm/HIP路径以及仅CPU操作。Apple Silicon CPU推理在macOS上列出,但README表示未优化,Metal稀疏推理仍在计划中。README报告了特定RTX 4090和RTX 2080 Ti测试的基准结果,并链接到论文以获取评估细节。