Sobre o projeto
PowerInfer é um runtime de inferência para implantar grandes modelos de linguagem em um computador pessoal. Seu design explora a localidade de ativação: neurônios consistentemente ativos são mantidos na GPU, enquanto neurônios dependentes de entrada são executados na CPU. Preditores adaptativos e operadores esparsos cientes de neurônios orientam essa divisão, reduzindo a pressão de memória da GPU e as transferências de dados entre CPU e GPU. A inferência híbrida pode usar toda a VRAM disponível ou seguir um limite configurável de --vram-budget; a inferência apenas com CPU também está disponível.
O projeto usa arquivos PowerInfer GGUF contendo pesos de modelo e preditor, com ferramentas para converter repositórios originais de modelo e preditor. Ele suporta quantização INT4 Q4_0, modo de inferência densa limitado, servindo localmente, geração em lote e avaliação de perplexidade. Seus exemplos de linha de comando seguem amplamente o uso do llama.cpp, embora --vram-budget substitua -ngl para o offloading do PowerInfer.
As famílias de modelos documentadas incluem Falcon-40B, variantes ReLU-based Llama 2, ProSparse Llama 2 e Bamboo-7B. A compatibilidade não é geral: o FAQ afirma que os modelos devem usar ativações ReLU, ReGLU ou Squared ReLU, então arquiteturas não suportadas, como Mistral, Llama original e Qwen, não são atualmente cobertas.
O PowerInfer é compilado com CMake e Python no Linux ou Windows com CPUs x86-64 AVX2, oferecendo caminhos NVIDIA CUDA e AMD ROCm/HIP, bem como operação apenas com CPU. A inferência de CPU Apple Silicon é listada para macOS, mas o README diz que não é otimizada lá e a inferência esparsa Metal permanece planejada. O README relata resultados de benchmark em testes específicos de RTX 4090 e RTX 2080 Ti e vincula a um artigo para detalhes de avaliação.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.