প্রকল্প সম্পর্কে

TensorFold হল একটি লোকাল ইনফারেন্স সার্ভার যা OpenAI-সামঞ্জস্যপূর্ণ HTTP API-এর মাধ্যমে ভাষার মডেল প্রকাশ করে। এটি দুটি ব্যাকএন্ড লক্ষ্য করে: MLX-এর মাধ্যমে Apple Silicon এবং CUDA-এর মাধ্যমে NVIDIA GPU। প্রতিটি সমর্থিত মডেল পরিবার একটি সাধারণ পথের উপর নির্ভর না করে নিজস্ব কার্নেল এবং ড্রাফট-ভেরিফিকেশন লজিক নিয়ে আসে। ইনস্টলেশন Git রিপোজিটরি থেকে pip দিয়ে করা হয়, এবং CLI-তে `serve`, `pull`, `models`, `info` এবং `update` কমান্ড রয়েছে। একটি সাধারণ শুরু হল `tensorfold serve <checkpoint>`, এরপর ক্লায়েন্টরা `http://127.0.0.1:8080/v1`-এ পয়েন্ট করে এবং `/v1/models` দ্বারা রিপোর্ট করা মডেল ID ব্যবহার করে। চ্যাট কমপ্লিশন, কমপ্লিশন এবং Responses API সবই পরিবেশন করা হয়। Python 3.11+ প্রয়োজন, এবং macOS-এ MLX 0.32.2+। README-তে সমর্থিত মডেল পরিবার এবং চেকপয়েন্টের একটি টেবিল তালিকাভুক্ত রয়েছে, যার মধ্যে Nemotron 3.5 Lightning, Qwen3.8-27B, Qwen3.8 Flash Next, GLM-5.3-Flash, Gemma 4 26B-A4B, DeepSeek-V4-Flash এবং Ternary Bonsai 2 27B অন্তর্ভুক্ত, প্রতিটি কোন ব্যাকএন্ড এবং ড্রাফটিং পদ্ধতি ব্যবহার করে তার নোট সহ। কোয়ান্টাইজেশন সমর্থন পরিবার অনুযায়ী ভিন্ন: Qwen3.8-27B MLX affine 2- থেকে 8-বিট চেকপয়েন্ট পড়ে যার মধ্যে মিশ্র লেয়ার ফরম্যাট রয়েছে; Flash Next-এর জন্য 4-বিট/গ্রুপ-32 ওয়েট প্রয়োজন; Nemotron CUDA-র জন্য 4-বিট/গ্রুপ-64 এবং একটি MTP হেড প্রয়োজন; GLM 4-বিট/গ্রুপ-64 এবং মিশ্র-বিট কনভার্শন পড়ে। কিছু CUDA পাথ NVFP4 বা EXL3 কনভার্শন গ্রহণ করে, যা পরীক্ষামূলক হিসেবে চিহ্নিত। একটি কেন্দ্রীয় ডিজাইন দাবি হল নির্ভুল ডিকোডিং: একটি স্পেকুলেটিভ ড্রাফট তখনই গৃহীত হয় যখন এটি সেই টোকেনের সমান হয় যা একই ইঞ্জিন সিরিয়ালি তৈরি করবে, স্যাম্পলিং প্রম্পট বা সিড, পরম অবস্থান এবং টোকেন ID-এর সাথে যুক্ত থাকে। README স্পষ্টভাবে বলে যে নির্ভুলতা একই ইঞ্জিন, ওয়েট, রানটাইম এবং সেটিংসের সাপেক্ষে, এবং এটি MLX এবং CUDA, ভিন্ন কোয়ান্টাইজেশন বা ভিন্ন টেনসর-প্যারালাল র‍্যাংক সংখ্যার মধ্যে অভিন্ন আউটপুট বোঝায় না। ব্যবহারকারীরা ড্রাফটেড বনাম সিরিয়াল আউটপুট পরীক্ষা করতে `"draft": false` সহ একটি অনুরোধ তুলনা করতে পারেন। সার্ভিং অপশনগুলিতে হোস্ট/পোর্ট, বিজ্ঞাপিত মডেল নাম, কনটেক্সট সাইজ, রিপ্লাই লিমিট, স্যাম্পলিং ডিফল্ট, থিংকিং টগল এবং রিজনিং এফোর্ট, ব্যাকএন্ড নির্বাচন, প্যারালালিজম, ড্রাফট নিয়ন্ত্রণ এবং MLX-এ প্রম্পট ক্যাশিং ও মেমরি টিউনিং যেমন রিটেইনড প্রিফিক্স, ডিস্ক স্পিল, স্ন্যাপশট ডিরেক্টরি এবং একটি পুনঃব্যবহারযোগ্য বাফার ক্যাশ অন্তর্ভুক্ত। CUDA-শুধু অপশনগুলির মধ্যে Flash Next-এর জন্য KV ক্যাশ dtype, একটি MTP কনফিডেন্স থ্রেশহোল্ড এবং দুই-র‍্যাংক টেনসর-প্যারালাল এক্সিকিউশন অন্তর্ভুক্ত। মেমরি হ্যান্ডলিং বিস্তারিতভাবে নথিভুক্ত: MLX ডিফল্টভাবে RAM-এর 70% প্রসেস বাজেট ব্যবহার করে, যা একটি এনভায়রনমেন্ট ভেরিয়েবলের মাধ্যমে ওভাররাইড করা যায়, ওয়েট, ক্যাশ বৃদ্ধি, রিপ্লাই টোকেন এবং প্রিফিল ওয়ার্কস্পেসের জন্য অ্যাডমিশন অ্যাকাউন্টিং সহ। একটি মেমরি-ক্লাস টেবিল 32 GB থেকে 256 GB পর্যন্ত কোয়ালিফিকেশন স্লট তালিকাভুক্ত করে, কিন্তু বেশিরভাগ সেল TBD চিহ্নিত; শুধুমাত্র একটি 64 GB M5 Pro সারিতে প্রকাশিত পরিসংখ্যান রয়েছে, যা একটি পূর্ববর্তী সংস্করণে একটি কমিউনিটি রানের জন্য দায়ী। README বলে যে এগুলো কোয়ালিফিকেশন স্লট, ন্যূনতম-মেমরি প্রতিশ্রুতি নয়। MLX-এ প্রম্পট ক্যাশিং রেন্ডার করা টোকেন সিকোয়েন্স থেকে প্রাপ্ত চাঙ্ক প্ল্যান ব্যবহার করে, অ্যাসিস্ট্যান্ট-মেসেজ শুরুতে এবং দ্বিতীয় মেসেজ শুরুতে রিজিউম পয়েন্ট সহ। স্ন্যাপশটে মডেল, রানটাইম, কার্নেল এবং চাঙ্ক-প্ল্যান পরিচয় থাকে যাতে প্রিফিক্স রিস্টার্টের পরেও টিকে থাকতে পারে। CUDA ইঞ্জিন তাদের নিজস্ব প্রম্পট এবং রিপ্লাই স্টেট রাখে এবং MLX ডিস্ক-স্ন্যাপশট বা রিটেইনড-প্রিফিক্স অপশন ব্যবহার করে না। NVIDIA হার্ডওয়্যারের জন্য README NVIDIA-এর PyTorch কন্টেইনার সুপারিশ করে, যেহেতু প্যাকেজে কোনো CUDA ইনস্টলেশন এক্সট্রা নেই। Qwen3.8-27B, Flash Next এবং Nemotron এক বা দুটি CUDA র‍্যাংক সমর্থন করে, যেখানে GLM-এর দুটি প্রয়োজন। র‍্যাংক 0 HTTP পরিবেশন করে। ভিশন ইনপুট অপ্ট-ইন: ভিশন এক্সট্রা ইনস্টল করে এবং একটি সামঞ্জস্যপূর্ণ Qwen3.5/3.8 ডেন্স চেকপয়েন্ট `--vision` সহ শুরু করলে একই ইঞ্জিনের মাধ্যমে ছবি এবং টেক্সট কনটেন্ট পার্টস অনুমোদিত হয়। প্রকল্পটি MIT লাইসেন্সযুক্ত, মডেল ওয়েট তাদের নিজস্ব লাইসেন্স রাখে এবং কিছু ঐচ্ছিক ড্রাফট চেকপয়েন্ট থার্ড-পার্টি নোটিসে উল্লেখিত অ-বাণিজ্যিক শর্ত বহন করে।