इस प्रोजेक्ट के बारे में

InferenceX (पूर्व में InferenceMAX) LLM अनुमान प्रदर्शन पर शोध और निरंतर बेंचमार्किंग के लिए एक ओपन-सोर्स मंच है। यह SGLang, vLLM, TensorRT-LLM, CUDA और ROCm जैसे लोकप्रिय अनुमान स्टैक में सॉफ़्टवेयर और हार्डवेयर संयोजनों को ट्रैक करता है, और परिणामों को एक सार्वजनिक प्रदर्शन डैशबोर्ड के माध्यम से प्रकाशित करता है। रिपॉजिटरी कई घटकों में संगठित है: - InferenceX-e2e: एंड-टू-एंड अनुमान सर्विंग बेंचमार्क। - CollectiveX: प्रायोगिक नेटवर्किंग और सामूहिक-संचार बेंचमार्क। - OperatorX: प्रायोगिक ऑपरेटर और कर्नेल-स्तरीय बेंचमार्क। - power_model: सिस्टम-स्तरीय बिजली मॉडलिंग। - shared: परियोजना में उपयोग किए जाने वाले साझा घटक। - experimental: अतिरिक्त प्रयोग। परियोजना में AgentX भी शामिल है, जिसे लंबे-संदर्भ, बहु-चरण एजेंटिक वर्कलोड का समर्थन करने वाले बेंचमार्किंग हार्नेस के रूप में वर्णित किया गया है। दस्तावेज़ीकरण में आर्किटेक्चर, कॉन्फ़िगरेशन, वर्कफ़्लो, मूल्यांकन, रनर, समस्या निवारण, और CI या Slurm के बिना मौजूदा सर्वर की बेंचमार्किंग के लिए एक स्टैंडअलोन `aiperf profile` पथ शामिल है। सूचीबद्ध समर्थित हार्डवेयर में NVIDIA Vera Rubin, GB300, GB200, B300, B200, H200, H100, RTX PRO 6000 Server, AMD MI355X, MI325X, MI300X, और Google TPUv7x Ironwood Ghostfish शामिल हैं, अतिरिक्त प्लेटफ़ॉर्म जल्द आने वाले के रूप में चिह्नित हैं। रिपॉजिटरी पुल अनुरोधों का स्वागत करती है और योगदान तथा समीक्षा दस्तावेज़ीकरण प्रदान करती है।