इस प्रोजेक्ट के बारे में
# llm-d Router अवलोकन
llm-d Router, Kubernetes वातावरण में inference ट्रैफ़िक के लिए एक बुद्धिमान प्रवेश बिंदु है, जिसे लोड-aware और prefix-cache-aware रूटिंग, अनुरोध प्राथमिकता और उन्नत प्रवाह नियंत्रण प्रदान करके LLM serving को अनुकूलित करने के लिए डिज़ाइन किया गया है। यह विविध अनुरोध प्रारूपों और जटिल serving लक्ष्यों का समर्थन करता है, जिससे यह उत्पादन-स्तरीय AI परिनियोजन के लिए उपयुक्त बनता है।
## मुख्य घटक
रिपॉज़िटरी में कई प्रमुख घटक होते हैं:
1. **Endpoint Picker (EPP)**: बुद्धिमान रूटिंग इंजन जो राउटर के "मस्तिष्क" के रूप में कार्य करता है। यह InferencePool की वर्तमान स्थिति के आधार पर आने वाले अनुरोधों का मूल्यांकन करता है, और KV-cache locality, वर्तमान लोड तथा प्राथमिकता जैसे कारकों पर विचार करके इष्टतम प्लेसमेंट निर्णय लेता है। यह ext-proc प्रोटोकॉल के माध्यम से L7 प्रॉक्सी के साथ एकीकृत होता है।
2. **Request Management APIs**: ऐसे संसाधन जो EPP व्यवहार को प्रभावित करते हैं:
- **InferenceObjective**: विशिष्ट अनुरोधों के लिए शेड्यूलिंग लक्ष्य कॉन्फ़िगर करता है, जिसमें प्राथमिकता स्तर और प्रदर्शन लक्ष्य शामिल हैं।
- **InferenceModelRewrite**: लचीले ट्रैफ़िक प्रबंधन के लिए मॉडल नाम पुनर्लेखन सक्षम करता है, तथा A/B परीक्षण और canary रोलआउट का समर्थन करता है।
3. **Disaggregation Sidecar**: एक समन्वय घटक जो मॉडल सर्वरों के साथ तैनात किया जाता है (आमतौर पर decode workers के sidecar के रूप में)। यह विशेषीकृत workers के साथ संचार करके KV-cache और embedding स्थानांतरण का प्रबंधन करते हुए जटिल बहु-चरणीय inference जीवनचक्रों, जैसे P/D (Prefill/Decode) और E/P/D (Encode/Prefill/Decode), का संचालन करता है।
## संचालन के मोड
llm-d Router दो प्राथमिक परिनियोजन मोड का समर्थन करता है:
### 1. Standalone मोड
यह मोड Gateway API अवसंरचना की आवश्यकता के बिना स्व-प्रबंधित Envoy प्रॉक्सी का उपयोग करता है। standalone Helm चार्ट दो टोपोलॉजी का समर्थन करता है:
- **Sidecar मोड** (डिफ़ॉल्ट): प्रॉक्सी EPP pod में चलता है, जो बुनियादी परीक्षण और स्थानीय मूल्यांकन के लिए उपयुक्त है।
- **Service मोड**: प्रॉक्सी एक अलग, क्षैतिज रूप से स्केलेबल Deployment और Service के रूप में चलता है, और अपनी Service के माध्यम से EPP तक पहुँचता है। प्रॉक्सी को स्वतंत्र रूप से स्केल करने के लिए `router.proxy.mode=service` सेट करें।
### 2. Gateway मोड (Inference Gateway)
अनुशंसित उत्पादन मोड आधिकारिक Kubernetes Gateway API का लाभ उठाता है। EPP एक InferencePool के लिए बैकएंड के रूप में कार्य करता है, जिसे साझा Gateway पर HTTPRoute द्वारा संदर्भित किया जाता है। यह उन्नत ट्रैफ़िक प्रबंधन, बहु-क्लस्टर लोड बैलेंसिंग, और inference तथा पारंपरिक वर्कलोड दोनों के लिए साझा अवसंरचना को सक्षम करता है।
## आर्किटेक्चर और दस्तावेज़ीकरण
परियोजना व्यापक दस्तावेज़ीकरण प्रदान करती है, जिसमें शामिल हैं:
- आर्किटेक्चर विवरण, रूटिंग लॉजिक, और प्लगइन्स (फ़िल्टर और स्कोरर)
- भारी या लंबे-संदर्भ वाले वर्कलोड के लिए कंटेनर आकार की सिफ़ारिशें
- OpenTelemetry JSON stdout लॉग प्रारूप विनिर्देश
- Disaggregation सेटअप गाइड
- सुरक्षा के लिए आर्टिफ़ैक्ट सत्यापन निर्देश
## तकनीकी आवश्यकताएँ
स्वचालित Envoy इंस्टॉलेशन के लिए, परियोजना उपकरण प्रदान करती है, लेकिन मैनुअल इंस्टॉलेशन के लिए ext-proc फ़िल्टर में `FULL_DUPLEX_STREAMED` अनुरोध/प्रतिक्रिया बॉडी मोड का समर्थन आवश्यक है।
## समुदाय और योगदान
परियोजना द्वि-साप्ताहिक बैठकों, एक समर्पित Slack चैनल (#sig-router), और योगदान दिशानिर्देशों के साथ समुदाय की भागीदारी को प्रोत्साहित करती है। यह llm-d संगठन के contributing गाइड का पालन करती है, और बड़े बदलावों पर पहले issues के माध्यम से चर्चा की जानी चाहिए।
## सुरक्षा
प्रकाशित कंटेनर इमेज में हस्ताक्षरित provenance attestation और SBOM (सॉफ़्टवेयर सामग्री सूची) होती है। सुरक्षा रिपोर्टिंग दिशानिर्देश SECURITY.md में प्रलेखित हैं, साथ ही जारी किए गए आर्टिफ़ैक्ट के लिए सत्यापन निर्देश भी दिए गए हैं।
कुल मिलाकर, llm-d Router उन संगठनों के लिए एक मजबूत समाधान है जो Kubernetes में बुद्धिमान, स्केलेबल inference रूटिंग चाहते हैं, विशेष रूप से disaggregated serving आवश्यकताओं वाले आधुनिक LLM वर्कलोड के लिए।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.