প্রকল্প সম্পর্কে

# llm-d Router ওভারভিউ llm-d Router হলো Kubernetes পরিবেশে ইনফারেন্স ট্র্যাফিকের জন্য একটি বুদ্ধিমান এন্ট্রি পয়েন্ট, যা লোড-সচেতন এবং প্রিফিক্স-ক্যাশ-সচেতন রাউটিং, রিকোয়েস্ট প্রায়োরিটাইজেশন এবং উন্নত ফ্লো কন্ট্রোল প্রদান করে LLM সেভিং অপ্টিমাইজ করার জন্য ডিজাইন করা হয়েছে। এটি বিভিন্ন ধরণের রিকোয়েস্ট ফর্ম্যাট এবং জটিল সেভিং উদ্দেশ্য সমর্থন করে, যা একে প্রোডাকশন-গ্রেড AI ডিপ্লয়মেন্টের জন্য উপযুক্ত করে তোলে। ## মূল উপাদানসমূহ রিপোজিটরিটিতে বেশ কিছু গুরুত্বপূর্ণ উপাদান রয়েছে: 1. **Endpoint Picker (EPP)**: বুদ্ধিমান রাউটিং ইঞ্জিন যা রাউটারের "মস্তিষ্ক" হিসাবে কাজ করে। এটি InferencePool-এর বর্তমান অবস্থার বিরুদ্ধে আগত রিকোয়েস্টগুলিকে মূল্যায়ন করে, যেমন KV-cache locality, বর্তমান লোড এবং প্রায়োরিটির মতো বিষয়গুলো বিবেচনা করে সর্বোত্তম প্লেসমেন্ট সিদ্ধান্ত নেয়। এটি ext-proc প্রোটোকলের মাধ্যমে L7 প্রক্সির সাথে সংহত হয়। 2. **Request Management APIs**: সম্পদ যা EPP আচরণকে প্রভাবিত করে: - **InferenceObjective**: নির্দিষ্ট রিকোয়েস্টের জন্য শিডিউলিং লক্ষ্য কনফিগার করে, যার মধ্যে প্রায়োরিটি লেভেল এবং পারফরম্যান্স টার্গেট অন্তর্ভুক্ত। - **InferenceModelRewrite**: নমনীয় ট্র্যাফিক ব্যবস্থাপনার জন্য মডেল নাম পুনর্লিখন সক্রিয় করে, A/B পরীক্ষা এবং ক্যানারি রোলআউট সমর্থন করে। 3. **Disaggregation Sidecar**: মডেল সার্ভারের পাশাপাশি স্থাপন করা একটি সমন্বয়কারী উপাদান (সাধারণত decode worker-দের সাইডকার হিসাবে)। এটি KV-cache এবং এমবেডিং ট্রান্সফার পরিচালনা করতে বিশেষায়িত worker-দের সাথে যোগাযোগ করে P/D (Prefill/Decode) এবং E/P/D (Encode/Prefill/Decode)-এর মতো জটিল মাল্টি-স্টেজ ইনফারেন্স লাইফসাইকেল সাজানো করে। ## অপারেটিং মোড llm-d Router দুটি প্রধান ডিপ্লয়মেন্ট মোড সমর্থন করে: ### 1. Standalone Mode এই মোডটি Gateway API অবকাঠামোর প্রয়োজন ছাড়াই একটি স্ব-ব্যবস্থাপিত Envoy প্রক্সি ব্যবহার করে। স্বতন্ত্র Helm চার্ট দুটি টপোলজি সমর্থন করে: - **Sidecar mode** (ডিফল্ট): প্রক্সি EPP pod-এ চলে, মৌলিক পরীক্ষা এবং স্থানীয় মূল্যায়নের জন্য উপযুক্ত। - **Service mode**: প্রক্সি একটি পৃথক, অনুভূমিকভাবে স্কেলযোগ্য Deployment এবং Service হিসাবে চলে, তার Service-এর মাধ্যমে EPP-এ পৌঁছায়। প্রক্সিকে স্বাধীনভাবে স্কেল করতে `router.proxy.mode=service` সেট করুন। ### 2. Gateway Mode (Inference Gateway) প্রস্তাবিত প্রোডাকশন মোড অফিসিয়াল Kubernetes Gateway API ব্যবহার করে। EPP একটি InferencePool-এর ব্যাকএন্ড হিসাবে কাজ করে, যা একটি শেয়ার্ড Gateway-এর HTTPRoute দ্বারা রেফারেন্স করা হয়। এটি উন্নত ট্র্যাফিক ব্যবস্থাপনা, মাল্টি-ক্লাস্টার লোড ব্যালেন্সিং এবং ইনফারেন্স ও ঐতিহ্যবাহী কর্মভার উভয়ের জন্য শেয়ার্ড অবকাঠামো সক্ষম করে। ## আর্কিটেকচার এবং ডকুমেন্টেশন প্রকল্পটি ব্যাপক ডকুমেন্টেশন প্রদান করে যার মধ্যে রয়েছে: - আর্কিটেকচার বিবরণ, রাউটিং লজিক এবং প্লাগইন (ফিল্টার এবং স্কোরার) - ভারী বা দীর্ঘ-প্রসঙ্গ কর্মভারের জন্য কনটেইনার সাইজিং সুপারিশ - OpenTelemetry JSON stdout লগ ফর্ম্যাট স্পেসিফিকেশন - Disaggregation সেটআপ গাইড - নিরাপত্তার জন্য আর্টিফ্যাক্ট যাচাইকরণ নির্দেশাবলী ## প্রযুক্তিগত প্রয়োজনীয়তা স্বয়ংক্রিয় Envoy ইনস্টলেশনের জন্য, প্রকল্পটি সরঞ্জাম প্রদান করে, কিন্তু ম্যানুয়াল ইনস্টলেশনের জন্য ext-proc ফিল্টারে `FULL_DUPLEX_STREAMED` রিকোয়েস্ট/রেসপন্স বডি মোডের সমর্থন প্রয়োজন। ## কমিউনিটি এবং অবদান প্রকল্পটি দ্বি-সাপ্তাহিক মিটিং, একটি নিবেদিত Slack চ্যানেল (#sig-router), এবং অবদান নির্দেশাবলীর সাথে কমিউনিটি সম্পৃক্ততাকে উৎসাহিত করে। এটি llm-d সংস্থার অবদান গাইড অনুসরণ করে, এবং বড় পরিবর্তনগুলো প্রথমে ইস্যুর মাধ্যমে আলোচনা করা উচিত। ## নিরাপত্তা প্রকাশিত কনটেইনার ইমেজে স্বাক্ষরিত প্রোভেন্যান্স অ্যাটেস্টেশন এবং SBOM (সফটওয়্যার বিল অফ ম্যাটেরিয়ালস) থাকে। নিরাপত্তা প্রতিবেদন নির্দেশাবলী SECURITY.md-এ নথিভুক্ত করা হয়েছে, মুক্তিপ্রাপ্ত আর্টিফ্যাক্টগুলোর জন্য যাচাইকরণ নির্দেশাবলী সহ। সামগ্রিকভাবে, llm-d Router হলো Kubernetes-এ বুদ্ধিমান, স্কেলযোগ্য ইনফারেন্স রাউটিং খুঁজছেন এমন সংস্থাগুলোর জন্য একটি শক্তিশালী সমাধান, বিশেষ করে বিচ্ছিন্ন সেভিং প্রয়োজনীয়তার সাথে আধুনিক LLM কর্মভারের জন্য।