프로젝트 소개

PowerInfer는 개인용 컴퓨터에서 대규모 언어 모델을 배포하기 위한 추론 런타임입니다. 그 설계는 활성화 지역성을 활용합니다: 일관되게 활성화되는 뉴런은 GPU에 유지하고, 입력에 의존하는 뉴런은 CPU에서 실행합니다. 적응형 예측기와 뉴런 인식 희소 연산자가 이 분할을 안내하여 GPU 메모리 압력과 CPU-GPU 데이터 전송을 줄입니다. 하이브리드 추론은 사용 가능한 모든 VRAM을 사용하거나 구성 가능한 --vram-budget 제한을 따를 수 있습니다; CPU 전용 추론도 가능합니다. 프로젝트는 모델 및 예측기 가중치가 포함된 PowerInfer GGUF 파일을 사용하며, 원본 모델과 예측기 저장소를 변환하는 도구를 제공합니다. INT4 Q4_0 양자화, 제한된 밀집 추론 모드, 로컬 서빙, 배치 생성, 혼란도 평가를 지원합니다. 명령줄 예제는 대부분 llama.cpp 사용법을 따르지만, PowerInfer 오프로딩에는 -ngl 대신 --vram-budget이 사용됩니다. 문서화된 모델 패밀리에는 Falcon-40B, ReLU 기반 Llama 2 변형, ProSparse Llama 2, Bamboo-7B가 포함됩니다. 호환성은 일반적이지 않습니다: FAQ에 따르면 모델은 ReLU, ReGLU, 또는 Squared ReLU 활성화를 사용해야 하므로, Mistral, 원본 Llama, Qwen과 같은 지원되지 않는 아키텍처는 현재 포함되지 않습니다. PowerInfer는 Linux 또는 Windows에서 CMake와 Python으로 x86-64 AVX2 CPU를 사용하여 빌드하며, NVIDIA CUDA 및 AMD ROCm/HIP 경로뿐만 아니라 CPU 전용 작동도 제공합니다. Apple Silicon CPU 추론은 macOS용으로 나열되어 있지만, README는 그곳에서 최적화되지 않았고 Metal 희소 추론은 계획 중이라고 말합니다. README는 특정 RTX 4090 및 RTX 2080 Ti 테스트에서 벤치마크 결과를 보고하고 평가 세부 사항은 논문에 링크합니다.