প্রকল্প সম্পর্কে

PowerInfer হলো একটি ইনফারেন্স রানটাইম, যা ব্যক্তিগত কম্পিউটারে বড় ভাষা মডেল ডিপ্লয় করার জন্য ব্যবহৃত হয়। এর ডিজাইন অ্যাক্টিভেশন লোকালিটিকে কাজে লাগায়: ধারাবাহিকভাবে সক্রিয় নিউরনগুলো GPU-তে রাখা হয়, আর ইনপুট-নির্ভর নিউরনগুলো CPU-তে চলে। অ্যাডাপটিভ প্রেডিক্টর এবং নিউরন-সচেতন স্পার্স অপারেটর এই বিভাজন পরিচালনা করে, ফলে GPU মেমোরির চাপ ও CPU-GPU ডেটা স্থানান্তর কমে। হাইব্রিড ইনফারেন্সে উপলব্ধ সব VRAM ব্যবহার করা যায় বা কনফিগারযোগ্য --vram-budget সীমা মেনে চলা যায়; CPU-only ইনফারেন্সও পাওয়া যায়। প্রকল্পটি PowerInfer GGUF ফাইল ব্যবহার করে, যেখানে মডেল ও প্রেডিক্টর ওয়েট থাকে, এবং মূল মডেল ও প্রেডিক্টর রিপোজিটরি রূপান্তরের টুলও আছে। এটি INT4 Q4_0 কোয়ান্টাইজেশন, সীমিত ডেন্স-ইনফারেন্স মোড, লোকাল সার্ভিং, ব্যাচড জেনারেশন এবং পারপ্লেক্সিটি মূল্যায়ন সমর্থন করে। এর কমান্ড-লাইন উদাহরণগুলো বেশিরভাগ ক্ষেত্রে llama.cpp ব্যবহারের ধরন অনুসরণ করে, যদিও PowerInfer অফলোডিংয়ের জন্য -ngl-এর বদলে --vram-budget ব্যবহৃত হয়। ডকুমেন্টেড মডেল পরিবারে আছে Falcon-40B, ReLU-ভিত্তিক Llama 2 ভ্যারিয়েন্ট, ProSparse Llama 2 এবং Bamboo-7B। সামঞ্জস্য সাধারণ নয়: FAQ-তে বলা হয়েছে মডেলগুলোকে ReLU, ReGLU বা Squared ReLU অ্যাক্টিভেশন ব্যবহার করতে হবে, তাই Mistral, মূল Llama এবং Qwen-এর মতো অসমর্থিত আর্কিটেকচার বর্তমানে অন্তর্ভুক্ত নয়। PowerInfer Linux বা Windows-এ x86-64 AVX2 CPU সহ CMake ও Python দিয়ে বিল্ড হয়, এবং NVIDIA CUDA ও AMD ROCm/HIP পথের পাশাপাশি CPU-only অপারেশনও দেয়। macOS-এর জন্য Apple Silicon CPU ইনফারেন্স তালিকাভুক্ত, তবে README বলছে সেখানে এটি অপ্টিমাইজড নয় এবং Metal স্পার্স ইনফারেন্স এখনও পরিকল্পিত। README-তে নির্দিষ্ট RTX 4090 ও RTX 2080 Ti পরীক্ষার বেঞ্চমার্ক ফলাফল রিপোর্ট করা হয়েছে এবং মূল্যায়নের বিস্তারিতের জন্য একটি পেপারের লিংক দেওয়া হয়েছে।