প্রকল্প সম্পর্কে

জানো একটি মিনিমাল, OpenAI-সামঞ্জস্যপূর্ণ HTTP রাউটার যা একই GPU-তে একাধিক লোকাল LLM চালানো ব্যবহারকারীদের জন্য তৈরি। এটি গ্রিডি ব্যাচিং বা贪心 ব্যাচিং বাস্তবায়ন করে ওভারহেড কমায়: প্রতিটি রিকোয়েস্ট পরিবর্তনে মডেল সওয়াপ করার বদলে, এটি প্রথমে বর্তমানে লোড করা মডেলের সব পেন্ডিং রিকোয়েস্ট পরিবেশন করে, শুধুমাত্র প্রয়োজন হলেই সওয়াপ করে। এটি একাধিক মডেল সওয়াপকে একটি বুর্স্টে মাত্র একে নামিয়ে আনতে পারে, লোকাল হার্ডওয়্যারে ৩০ সেকেন্ড থেকে ৩ মিনিট সময় বাঁচাতে পারে। জানো স্থানীয় ব্যাকএন্ড (যেমন llama-server বা vLLM) এবং রিমোট API (যেমন DeepSeek) উভয়ই সমর্থন করে, রিমোট প্রদানকারীদের জন্য স্বয়ংক্রিয় মডেল নাম পুনরুলেখনের সুবিধা দেয়। এতে স্বয়ংক্রিয় টেলিমেট্রি /health, /status এবং Prometheus metrics এন্ডপয়েন্ট সহ রয়েছে, যা queue depth, swap duration, token throughput এবং ব্যাকএন্ড স্বাস্থ্য ট্র্যাক করে। কনফিগারেশন পরিবেশ চলক এবং models.json ফাইলের মাধ্যমে পরিচালিত হয়, যেখানে ব্যবহারকারীরা মডেলের নাম, URL, অ্যালাইজ এবং ঐচ্ছিক সওয়াপ স্ক্রিপ্ট সংজ্ঞায়িত করেন। সওয়াপ স্ক্রিপ্টের চুক্তি সরল: একটি মডেলের নাম দিলে এটিকে সক্টিভেট করতে হবে এবং পরিষ্কারভাবে বন্ধ হতে হবে; ঐচ্ছিক স্ট্যাটাস রিপোর্টিং প্রাথমিক অবস্থা নির্ণয়ে সাহায্য করে। জানো ব্যাকএন্ড অনুযায়ী সব রিকোয়েস্ট সিরিয়ালাইজ করে যুক্তি সহজ রাখে, যা ব্যক্তিগত বা ছোট পরিসরের সেটআপের জন্য উপযোগী, একাধিক ভাড়াটে সেবা নয়। এটি GPU তাপমাত্রা বা সিস্টেম রিসোর্স পরিচালনা করে না—এগুলো এর সীমার বাইরে। বিদ্যমান সরঞ্জামগুলোর উপরে একটি পাতলা স্তর হিসেবে নকশা করা, জানো মডেল সুইচিংয়ে স্পষ্ট নিয়ন্ত্রণ, কোনো OpenAI-স্টাইল ব্যাকএন্ডের সাথে সামঞ্জস্য, এবং স্ট্রিমিং ও টুল কলের স্বচ্ছ পার্সথ্রু সরবরাহ করে। আপনি যদি Ollama বা একটি একক মডেল ব্যবহার করেন তবে প্রয়োজন নেই; এটি এমন ব্যবহারকারীদের জন্য সবচেয়ে উপযুক্ত যাদের ইতিমধ্যে কাস্টম ব্যাকএন্ড আছে এবং তারা রাউটিং ও সওয়াপ নিয়ে সূক্ষ্ম নিয়ন্ত্রণ চান।