منصوبے کے بارے میں

Dynamo ایک اوپن سورس آرکیسٹریشن لیئر ہے جو انفرنس انجنوں کو بدلنے کے بجائے ان کے اوپر کام کرتی ہے۔ یہ SGLang، TensorRT-LLM اور vLLM کو LLM، reasoning، multimodal اور ویڈیو جنریشن ورک لوڈز کے لیے ایک multi-node انفرنس سسٹم میں مربوط کرتی ہے۔ یہ پروجیکٹ کارکردگی کے لیے Rust اور توسیع پذیری کے لیے Python کے ساتھ بنایا گیا ہے، اور Apache 2.0 لائسنس کے تحت جاری کیا گیا ہے۔ README میں بیان کردہ بنیادی صلاحیتیں: - Disaggregated prefill/decode: prefill اور decode کو الگ الگ قابلِ توسیع GPU پولز میں تقسیم کرتا ہے تاکہ ہر مرحلہ اپنے ورک لوڈ کے مطابق ہارڈویئر پر چل سکے۔ - KV-aware routing: ورکر لوڈ اور KV cache اوورلیپ کی بنیاد پر درخواستوں کو روٹ کرتا ہے تاکہ غیر ضروری prefill حساب کم ہو۔ - KV Block Manager (KVBM): مؤثر context لمبائی بڑھانے کے لیے KV cache کو GPU، CPU، SSD اور ریموٹ اسٹوریج میں منتقل کرتا ہے۔ - ModelExpress: نئی replicas کے cold starts کو تیز کرنے کے لیے NIXL/NVLink کے ذریعے ماڈل weights کو GPU-to-GPU اسٹریم کرتا ہے۔ - Planner: ایک SLA-driven autoscaler جو ورک لوڈز کا تجزیہ کرتا ہے اور پولز کو درست سائز دیتا ہے۔ - Grove: topology-aware gang scheduling کے لیے ایک Kubernetes operator، جس میں racks، hosts اور NUMA nodes کے پار NVL72 placement شامل ہے۔ - AISimulate: GPU کلسٹر قائم کیے بغیر serving رویے کی پیش گوئی اور deployment کنفیگریشنز کی آف لائن تلاش کرتا ہے۔ - Fault tolerance: canary health checks کے ساتھ in-flight request migration تاکہ ورکر کی ناکامی ضروری نہیں کہ صارف کی درخواستیں ضائع کرے۔ Version 1.0 کے نمایاں اضافوں میں DGDR کے ذریعے zero-config deployment (ایک YAML میں ماڈل، ہارڈویئر اور SLA بتائیں)، agentic inference خصوصیات جیسے priority، متوقع output لمبائی اور speculative prefill کے لیے per-request hints، session metadata، اور LangChain اور NeMo Agent Toolkit کے ساتھ integrations شامل ہیں۔ embedding cache کے ساتھ multimodal encode/prefill/decode، ویڈیو جنریشن کے لیے native FastVideo اور SGLang Diffusion سپورٹ، ایک Kubernetes Inference Gateway plugin، اور S3/Azure blob سپورٹ کے ساتھ storage-tier KV offload بھی درج ہیں۔ Deployment کے اختیارات: vLLM، SGLang اور TensorRT-LLM رن ٹائمز کے لیے پہلے سے تیار NGC containers؛ backend extras کے ساتھ uv کے ذریعے PyPI installation؛ اور Dynamo Platform کے ذریعے Kubernetes deployment، جس میں ایک DynamoGraphDeploymentRequest manifest شامل ہے جو ماڈل، backend اور SLA اہداف لیتا ہے۔ Qwen3-32B-FP8، DeepSeek-R1 اور Kimi-K3 جیسے ماڈلز کے لیے پہلے سے تیار recipes موجود ہیں، جن کے ساتھ AWS EKS، Google GKE، Azure AKS اور Amazon ECS کے لیے کلاؤڈ گائیڈز بھی ہیں۔ سورس سے build کرنے میں Rust، maturin اور uv استعمال ہوتے ہیں، اور ایک devcontainer بھی دستیاب ہے۔ دو request routing topologies دستاویزی ہیں: Dynamo-native frontend routing (client سے Frontend سے Router سے workers) اور Kubernetes Gateway API Inference Extension کے ساتھ Gateway API routing، جہاں ایک gateway ورکر کے frontend sidecar کو فارورڈ کرنے سے پہلے Dynamo Endpoint Picker Plugin کو کال کرتا ہے۔ دونوں ایک OpenAI-compatible API فراہم کرتے ہیں۔ Service discovery inter-component مواصلات کے لیے TCP استعمال کرتی ہے؛ Kubernetes پر CRDs اور EndpointSlices discovery سنبھالتے ہیں، اور etcd یا NATS زیادہ تر deployments کے لیے اختیاری ہیں۔ Frontend ایک OpenAPI 3 specification فراہم کرتا ہے، اور benchmarking رہنمائی AIPerf کے ذریعے دی گئی ہے۔ README میں کمیونٹی چینلز بھی درج ہیں جن میں Slack، office hours، ہفتہ وار کمیونٹی میٹنگز اور GitHub issues کے طور پر ٹریک ہونے والی design proposals شامل ہیں۔