इस प्रोजेक्ट के बारे में
PowerInfer एक निजी कंप्यूटर पर बड़े भाषा मॉडलों (LLMs) को तैनात करने के लिए एक इनफरेंस रनटाइम है। इसका डिज़ाइन एक्टिवेशन लोकालिटी का लाभ उठाता है: लगातार सक्रिय न्यूरॉन्स GPU पर रखे जाते हैं, जबकि इनपुट-निर्भर न्यूरॉन्स CPU पर चलते हैं। एडेप्टिव प्रेडिक्टर्स और न्यूरॉन-अवेयर स्पार्स ऑपरेटर इस विभाजन की दिशा देते हैं, जिससे GPU मेमोरी दबाव और CPU-GPU डेटा ट्रांसफर कम होते हैं। हाइब्रिड इनफरेंस सभी उपलब्ध VRAM का उपयोग कर सकता है या एक कॉन्फ़िगर करने योग्य --vram-budget सीमा का पालन कर सकता है; केवल CPU इनफरेंस भी उपलब्ध है।
परियक्ति PowerInfer GGUF फ़ाइलों का उपयोग करती है, जिनमें मॉडल और प्रेडिक्टर वजन शामिल होते हैं, और मूल मॉडल तथा प्रेडिक्टर रिपॉजिटरी को बदलने के लिए उपकरण प्रदान करती है। यह INT4 Q4_0 क्वांटाइजेशन, सीमित घनत्व इनफरेंस मोड, स्थानीय सर्विंग, बैच्ड जनरेशन और perplexity मूल्यांकन का समर्थन करता है। इसके कमांड-लाइन उदाहरण मुख्य रूप से llama.cpp उपयोग का पालन करते हैं, हालांकि PowerInfer ऑफलोडिंग के लिए -ngl की जगह --vram-budget का उपयोग किया जाता है।
दस्तावेज़ित मॉडल परिवारों में Falcon-40B, ReLU-आधारित Llama 2 वेरिएंट्स, ProSparse Llama 2, और Bamboo-7B शामिल हैं। संगतता सामान्य नहीं है: FAQ बताती है कि मॉडलों को ReLU, ReGLU, या Squared ReLU एक्टिवेशन का उपयोग करना चाहिए, इसलिए Mistral, मूल Llama, और Qwen जैसे अविश्वसनीय आर्किटेक्चर वर्तमान में कवर नहीं किए गए हैं।
PowerInfer Linux या Windows पर x86-64 AVX2 CPUs के साथ CMake और Python का उपयोग करके बनाया जाता है, जिसमें NVIDIA CUDA और AMD ROCm/HIP मार्गों के साथ-साथ केवल CPU संचालन भी शामिल है। Apple Silicon CPU इनफरेंस macOS के लिए सूचीबद्ध है, लेकिन README कहता है कि वह那里 अनुकूलित नहीं है और Metal स्पार्स इनफरेंस अभी योजनाबद्ध है। README विशिष्ट RTX 4090 और RTX 2080 Ti परीक्षणों पर बेंचमार्क परिणाम रिपोर्ट करता है और मूल्यांकन विवरण के लिए एक पेपर की लिंक प्रदान करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.