منصوبے کے بارے میں

TensorFold ایک لوکل انفرنس سرور ہے جو لینگویج ماڈلز کو OpenAI-مطابق HTTP API کے ذریعے پیش کرتا ہے۔ یہ دو بیک اینڈز کو نشانہ بناتا ہے: MLX کے ذریعے Apple Silicon اور CUDA کے ذریعے NVIDIA GPUs۔ ہر معاون ماڈل فیملی اپنے کیرنلز اور ڈرافٹ-تصدیق کی منطق فراہم کرتی ہے بجائے اس کے کہ کسی ایک عمومی راستے پر انحصار کیا جائے۔ انسٹالیشن Git ریپوزٹری سے pip کے ساتھ ہوتی ہے، اور CLI میں `serve`، `pull`، `models`، `info` اور `update` کمانڈز شامل ہیں۔ عام آغاز `tensorfold serve <checkpoint>` ہے، جس کے بعد کلائنٹس `http://127.0.0.1:8080/v1` پر پوائنٹ کرتے ہیں اور `/v1/models` سے رپورٹ شدہ ماڈل ID استعمال کرتے ہیں۔ چیٹ کمپلیشنز، کمپلیشنز اور Responses API سب پیش کیے جاتے ہیں۔ Python 3.11+ درکار ہے، اور macOS پر MLX 0.32.2+۔ README میں معاون ماڈل فیملیز اور چیک پوائنٹس کی ایک جدول درج ہے، جس میں Nemotron 3.5 Lightning، Qwen3.8-27B، Qwen3.8 Flash Next، GLM-5.3-Flash، Gemma 4 26B-A4B، DeepSeek-V4-Flash اور Ternary Bonsai 2 27B شامل ہیں، ساتھ ہی نوٹس کہ ہر ایک کون سا بیک اینڈ اور ڈرافٹنگ طریقہ استعمال کرتا ہے۔ کوانٹائزیشن سپورٹ فیملی کے لحاظ سے مختلف ہوتی ہے: Qwen3.8-27B MLX affine 2- سے 8-بٹ چیک پوائنٹس پڑھتا ہے جس میں مخلوط پرت فارمیٹس شامل ہیں؛ Flash Next کو 4-بٹ/گروپ-32 وزن درکار ہیں؛ Nemotron CUDA کو 4-بٹ/گروپ-64 کے ساتھ MTP ہیڈ درکار ہے؛ GLM 4-بٹ/گروپ-64 اور مخلوط-بٹ تبدیلیاں پڑھتا ہے۔ کچھ CUDA راستے NVFP4 یا EXL3 تبدیلیاں قبول کرتے ہیں، جو تجرباتی نشان زد ہیں۔ ایک مرکزی ڈیزائن دعویٰ قطعی ڈی کوڈنگ ہے: ایک اسپیکولیٹو ڈرافٹ صرف اس وقت قبول کیا جاتا ہے جب یہ اس ٹوکن کے برابر ہو جو وہی انجن سیریل طور پر پیدا کرے گا، جس میں سیمپلنگ پرامپٹ یا سیڈ، مطلق پوزیشن اور ٹوکن ID سے منسلک ہوتی ہے۔ README واضح کرتا ہے کہ قطعیت اسی انجن، وزن، رن ٹائم اور سیٹنگز کے نسبت ہے، اور اس کا مطلب MLX اور CUDA، مختلف کوانٹائزیشنز یا مختلف ٹینسر-پیرلل رینک شماروں کے درمیان یکساں آؤٹ پٹ نہیں ہے۔ صارفین درخواست کو `"draft": false` کے ساتھ موازنہ کر سکتے ہیں تاکہ ڈرافٹ شدہ بمقابلہ سیریل آؤٹ پٹ چیک کریں۔ سرونگ آپشنز میں ہوسٹ/پورٹ، مشتہر ماڈل نام، سیاق و سباق کا سائز، جواب کی حدیں، سیمپلنگ ڈیفالٹس، سوچنے کے ٹوگلز اور استدلال کی کوشش، بیک اینڈ انتخاب، پیرلل ازم، ڈرافٹ کنٹرول اور MLX پر پرامپٹ کیشنگ اور میموری ٹیوننگ جیسے برقرار رکھے گئے پریفکسز، ڈسک اسپل، سنیپ شاٹ ڈائریکٹریز اور دوبارہ قابل استعمال بفر کیش شامل ہیں۔ CUDA-صرف آپشنز میں Flash Next کے لیے KV کیش dtype، MTP اعتماد کی حد اور دو-رینک ٹینسر-پیرلل ایگزیکیوشن شامل ہیں۔ میموری ہینڈلنگ تفصیل سے دستاویز کی گئی ہے: MLX ڈیفالٹ طور پر RAM کا 70% پروسیس بجٹ استعمال کرتا ہے، جسے ماحولیاتی متغیر کے ذریعے تبدیل کیا جا سکتا ہے، جس میں وزن، کیش گروتھ، جوابی ٹوکنز اور پری فل ورک اسپیس کے لیے داخلہ اکاؤنٹنگ شامل ہے۔ ایک میموری-کلاس جدول 32 GB سے 256 GB تک کوالیفیکیشن سلاٹس دکھاتی ہے، لیکن زیادہ تر سیلز TBD نشان زد ہیں؛ صرف 64 GB M5 Pro قطار میں شائع شدہ اعداد و شمار ہیں، جو پہلے ورژن پر کمیونٹی رن سے منسوب ہیں۔ README کہتا ہے کہ یہ کوالیفیکیشن سلاٹس ہیں، کم از کم میموری کے وعدے نہیں۔ MLX پر پرامپٹ کیشنگ رینڈر شدہ ٹوکن سیکوئنس سے اخذ کردہ چنک پلانز استعمال کرتی ہے، جس میں اسسٹنٹ-میسج آغاز اور دوسرے میسج آغاز پر ریزوم پوائنٹس ہوتے ہیں۔ سنیپ شاٹس ماڈل، رن ٹائم، کیرنل اور چنک-پلان شناخت رکھتے ہیں تاکہ پریفکسز ری اسٹارٹس پر زندہ رہ سکیں۔ CUDA انجن اپنی پرامپٹ اور جوابی حالت رکھتے ہیں اور MLX ڈسک-سنیپ شاٹ یا برقرار-پریفکس آپشنز استعمال نہیں کرتے۔ NVIDIA ہارڈویئر کے لیے README NVIDIA کے PyTorch کنٹینر کی سفارش کرتا ہے، کیونکہ پیکج میں CUDA انسٹالیشن ایکسٹرا نہیں ہے۔ Qwen3.8-27B، Flash Next اور Nemotron ایک یا دو CUDA رینک سپورٹ کرتے ہیں، جبکہ GLM کو دو درکار ہیں۔ رینک 0 HTTP پیش کرتا ہے۔ ویژن ان پٹ آپٹ-ان ہے: ویژن ایکسٹرا انسٹال کرنا اور مطابق Qwen3.5/3.8 ڈینس چیک پوائنٹ کو `--vision` کے ساتھ شروع کرنا اسی انجن کے ذریعے تصویر اور متن کے مواد کے حصوں کی اجازت دیتا ہے۔ پروجیکٹ MIT لائسنس یافتہ ہے، ماڈل وزن اپنے لائسنس رکھتے ہیں اور کچھ اختیاری ڈرافٹ چیک پوائنٹس میں غیر-تجارتی شرائط شامل ہیں جو تھرڈ-پارٹی نوٹسز میں درج ہیں۔