Sobre el proyecto

PowerInfer es un runtime de inferencia para implementar modelos de lenguaje grandes en una computadora personal. Su diseño explota la localidad de activación: las neuronas consistentemente activas se mantienen en la GPU, mientras que las neuronas dependientes de la entrada se ejecutan en la CPU. Predictores adaptativos y operadores dispersos conscientes de neuronas guían esta división, reduciendo la presión de memoria de la GPU y las transferencias de datos entre CPU y GPU. La inferencia híbrida puede usar todo el VRAM disponible o seguir un límite configurable de --vram-budget; también está disponible la inferencia solo con CPU. El proyecto utiliza archivos PowerInfer GGUF que contienen pesos del modelo y del predictor, con herramientas para convertir repositorios originales de modelo y predictor. Soporta cuantización INT4 Q4_0, modo de inferencia densa limitado, servidor local, generación por lotes y evaluación de perplejidad. Sus ejemplos de línea de comandos siguen en gran medida el uso de llama.cpp, aunque --vram-budget reemplaza a -ngl para la descarga de PowerInfer. Las familias de modelos documentadas incluyen Falcon-40B, variantes de Llama 2 basadas en ReLU, ProSparse Llama 2 y Bamboo-7B. La compatibilidad no es general: las preguntas frecuentes indican que los modelos deben usar activaciones ReLU, ReGLU o Squared ReLU, por lo que arquitecturas no compatibles como Mistral, Llama original y Qwen no están actualmente cubiertas. PowerInfer se compila con CMake y Python en Linux o Windows con CPUs x86-64 AVX2, ofreciendo rutas NVIDIA CUDA y AMD ROCm/HIP, así como operación solo CPU. La inferencia de CPU de Apple Silicon está listada para macOS, pero el README dice que no está optimizada allí y que la inferencia dispersa de Metal sigue planificada. El README reporta resultados de rendimiento en pruebas específicas de RTX 4090 y RTX 2080 Ti y enlaza a un paper para detalles de evaluación.