منصوبے کے بارے میں

bitnet.cpp 1-بٹ LLMs جیسے BitNet b1.58 کے لیے سرکاری انفرنس فریم ورک ہے۔ یہ بہتر کردہ کرنل کا ایک مجموعہ فراہم کرتا ہے جس کا مقصد CPU اور GPU پر 1.58-بٹ ماڈلز کی تیز اور بلا نقصان انفرنس کو ممکن بنانا ہے، جس میں NPU سپورٹ جلد آنے والی ہے۔ یہ پروجیکٹ llama.cpp فریم ورک پر مبنی ہے، اور اس کے کرنل T-MAC میں پیش کردہ لوک اپ ٹیبل طریقوں پر استوار ہیں۔ README میں بیان کردہ اہم صلاحیتیں: - ٹرنری/1-بٹ ماڈلز کے لیے CPU انفرنس، جس میں ARM CPUs پر 1.37x سے 5.07x اور x86 CPUs پر 2.37x سے 6.17x تک کی رفتار میں اضافہ رپورٹ کیا گیا ہے، نیز توانائی میں کمی 55.4%-70.0% (ARM) اور 71.9%-82.2% (x86) رپورٹ کی گئی ہے۔ - ایک 100B BitNet b1.58 ماڈل کو ایک ہی CPU پر چلانے کی صلاحیت، جس کی رفتار انسانی پڑھنے کے مترادف بتائی گئی ہے (5-7 ٹوکن فی سیکنڈ)۔ - مئی 2025 میں سرکاری GPU انفرنس کرنل جاری کیا گیا۔ - I2_S اور TL1 سمیت کوانٹائزیشن کی اقسام، جن کی کرنل سپورٹ ماڈل اور آرکیٹیکچر (x86 بمقابلہ ARM) کے لحاظ سے مختلف ہوتی ہے۔ - .safetensors چیک پوائنٹس سے GGUF میں ماڈل کی تبدیلی ایک معاون اسکرپٹ کے ذریعے۔ - بینچ مارکنگ یوٹیلیٹیز (e2e_benchmark.py) اور غیر معاون لے آؤٹ کے لیے ڈمی ماڈل جنریٹر۔ - انسٹرکٹ ماڈلز کے لیے چیٹ/مکالمہ موڈ۔ نمایاں سرکاری ماڈلز میں BitNet-b1.58-2B-4T (2.4B پیرامیٹرز، 4T ٹوکنز پر تربیت یافتہ)، BitNet-embedding-0.6B، اور BitNet-embedding-270M شامل ہیں۔ معاون کمیونٹی ماڈلز میں bitnet_b1_58-large، bitnet_b1_58-3B، Llama3-8B-1.58-100B-tokens، اور Falcon3 اور Falcon-E فیملیز شامل ہیں۔ انسٹالیشن کے لیے Python 3.10+، CMake 3.22+، اور Clang 18+ درکار ہے، اور conda تجویز کیا جاتا ہے۔ بلڈ کے مراحل میں ریپوزٹری کو recursively کلون کرنا، Python ڈیپنڈنسیز انسٹال کرنا، ماڈل ڈاؤن لوڈ کرنا، اور منتخب کوانٹائزیشن قسم کے ساتھ setup_env.py چلانا شامل ہے۔ انفرنس run_inference.py کے ذریعے چلائی جاتی ہے جس میں پرامپٹ، ٹوکن شمار، تھریڈز، سیاق و سباق کا سائز، درجہ حرارت، اور مکالمہ موڈ کے اختیارات ہوتے ہیں۔ README میں عام بلڈ مسائل پر مشتمل FAQ بھی شامل ہے، جیسے llama.cpp میں std::chrono کی خرابیاں اور ونڈوز پر conda ماحول میں clang کی ترتیب۔ یہ پروجیکٹ MIT لائسنس کے تحت جاری کیا گیا ہے۔