প্রকল্প সম্পর্কে

ডাইনামো একটি ওপেন-সোর্স অর্কেস্ট্রেশন লেয়ার যা ইনফারেন্স ইঞ্জিনগুলোকে প্রতিস্থাপন না করে তাদের উপরে বসে। এটি SGLang, TensorRT-LLM ও vLLM-কে LLM, রিজনিং, মাল্টিমোডাল ও ভিডিও জেনারেশন ওয়ার্কলোডের জন্য একটি মাল্টি-নোড ইনফারেন্স সিস্টেমে সমন্বয় করে। প্রকল্পটি পারফরম্যান্সের জন্য Rust এবং এক্সটেনসিবিলিটির জন্য Python দিয়ে তৈরি, এবং Apache 2.0 লাইসেন্সের অধীনে। README-তে বর্ণিত মূল সক্ষমতাগুলো: - ডিসএগ্রিগেটেড প্রিফিল/ডিকোড: প্রিফিল ও ডিকোডকে স্বতন্ত্রভাবে স্কেলযোগ্য GPU পুলে আলাদা করে, যাতে প্রতিটি ধাপ তার ওয়ার্কলোডের উপযোগী হার্ডওয়্যারে চলতে পারে। - KV-সচেতন রাউটিং: অপ্রয়োজনীয় প্রিফিল গণনা কমাতে ওয়ার্কার লোড ও KV ক্যাশ ওভারল্যাপের ভিত্তিতে অনুরোধ রাউট করে। - KV Block Manager (KVBM): কার্যকর কনটেক্সট দৈর্ঘ্য বাড়াতে GPU, CPU, SSD ও রিমোট স্টোরেজ জুড়ে KV ক্যাশ অফলোড করে। - ModelExpress: নতুন রেপ্লিকার কোল্ড স্টার্ট দ্রুত করতে NIXL/NVLink-এর মাধ্যমে GPU-থেকে-GPU মডেল ওয়েট স্ট্রিম করে। - Planner: একটি SLA-চালিত অটোস্কেলার যা ওয়ার্কলোড প্রোফাইল করে এবং পুলের আকার যথাযথ করে। - Grove: টপোলজি-সচেতন গ্যাং শিডিউলিংয়ের জন্য একটি Kubernetes অপারেটর, যার মধ্যে র্যাক, হোস্ট ও NUMA নোড জুড়ে NVL72 প্লেসমেন্ট অন্তর্ভুক্ত। - AISimulate: GPU ক্লাস্টার চালু না করেই অফলাইনে সার্ভিং আচরণ পূর্বাভাস দেয় এবং ডিপ্লয়মেন্ট কনফিগারেশন অনুসন্ধান করে। - ফল্ট টলারেন্স: ক্যানারি হেলথ চেক এবং ইন-ফ্লাইট অনুরোধ মাইগ্রেশন, যাতে ওয়ার্কার ব্যর্থ হলেও ব্যবহারকারীর অনুরোধ হারানো না যায়। ভার্সন 1.0-এর হাইলাইট করা সংযোজনগুলোর মধ্যে রয়েছে DGDR-এর মাধ্যমে জিরো-কনফিগ ডিপ্লয়মেন্ট (একটি YAML-এ মডেল, হার্ডওয়্যার ও SLA নির্দিষ্ট করা), এজেন্টিক ইনফারেন্স বৈশিষ্ট্য যেমন অগ্রাধিকার, প্রত্যাশিত আউটপুট দৈর্ঘ্য ও স্পেকুলেটিভ প্রিফিলের জন্য প্রতি-অনুরোধ হিন্ট, সেশন মেটাডেটা, এবং LangChain ও NeMo Agent Toolkit-এর সাথে ইন্টিগ্রেশন। এমবেডিং ক্যাশসহ মাল্টিমোডাল এনকোড/প্রিফিল/ডিকোড, ভিডিও জেনারেশনের জন্য নেটিভ FastVideo ও SGLang Diffusion সাপোর্ট, একটি Kubernetes Inference Gateway প্লাগইন, এবং S3/Azure blob সাপোর্টসহ স্টোরেজ-টিয়ার KV অফলোডও তালিকাভুক্ত। ডিপ্লয়মেন্ট অপশন: vLLM, SGLang ও TensorRT-LLM রানটাইমের জন্য প্রি-বিল্ট NGC কনটেইনার; ব্যাকএন্ড এক্সট্রাসহ uv-এর মাধ্যমে PyPI ইনস্টলেশন; এবং Dynamo Platform-এর মাধ্যমে Kubernetes ডিপ্লয়মেন্ট, যার মধ্যে মডেল, ব্যাকএন্ড ও SLA টার্গেট নেয় এমন একটি DynamoGraphDeploymentRequest ম্যানিফেস্ট অন্তর্ভুক্ত। Qwen3-32B-FP8, DeepSeek-R1 ও Kimi-K3-এর মতো মডেলের জন্য প্রি-বিল্ট রেসিপি রয়েছে, সাথে AWS EKS, Google GKE, Azure AKS ও Amazon ECS-এর ক্লাউড গাইড। সোর্স থেকে বিল্ড করতে Rust, maturin ও uv ব্যবহার হয়, এবং একটি devcontainer উপলব্ধ। দুটি অনুরোধ রাউটিং টপোলজি নথিভুক্ত: Dynamo-native ফ্রন্টএন্ড রাউটিং (ক্লায়েন্ট থেকে Frontend থেকে Router থেকে ওয়ার্কার) এবং Kubernetes Gateway API Inference Extension-সহ Gateway API রাউটিং, যেখানে একটি গেটওয়ে ওয়ার্কারের ফ্রন্টএন্ড সাইডকারে ফরওয়ার্ড করার আগে Dynamo Endpoint Picker Plugin-কে কল করে। উভয়ই OpenAI-সামঞ্জস্যপূর্ণ API প্রকাশ করে। সার্ভিস ডিসকভারি আন্তঃকম্পোনেন্ট যোগাযোগের জন্য TCP ব্যবহার করে; Kubernetes-এ CRD ও EndpointSlice ডিসকভারি সামলায়, এবং বেশিরভাগ ডিপ্লয়মেন্টের জন্য etcd বা NATS ঐচ্ছিক। ফ্রন্টএন্ড একটি OpenAPI 3 স্পেসিফিকেশন প্রকাশ করে, এবং AIPerf-এর মাধ্যমে বেঞ্চমার্কিং নির্দেশনা প্রদান করা হয়। README-তে Slack, অফিস আওয়ার, সাপ্তাহিক কমিউনিটি মিটিং এবং GitHub ইস্যু হিসেবে ট্র্যাক করা ডিজাইন প্রস্তাবসহ কমিউনিটি চ্যানেলও তালিকাভুক্ত।