Xinference ایک متحد inference لائبریری ہے جو زبان، تقریر، اور ملٹی موڈل ماڈلز کی خدمت کرتی ہے۔ یہ OpenAI-مطابق RESTful API، متفاوت GPU/CPU استعمال، تقسیم شدہ تعیناتی فراہم کرتی ہے، اور LangChain، LlamaIndex، Dify، اور Chatbox کے ساتھ مربوط ہے۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
InferenceX ایک Apache-2.0 انفرنس پرفارمنس ریسرچ پلیٹ فارم ہے جو اوپن سورس LLM سروسنگ اسٹیکس، ہارڈویئر کنفیگریشنز، آپریٹرز، نیٹ ورکنگ اور بجلی کے استعمال کی مسلسل بینچ مارکنگ کرتا ہے، عوامی ڈیش بورڈز اور دوبارہ استعمال کے قابل بینچ مارکنگ اجزاء کے ساتھ۔
SGLang-Omni ایک اوپن سورس ملٹی اسٹیج سروِنگ رن ٹائم ہے جو omni، اسپیچ اور TTS ماڈلز کے لیے ہے، اور اسپیچ جنریشن، ٹرانسکرپشن اور ملٹی موڈل چیٹ کے لیے OpenAI کے ساتھ مطابقت رکھنے والے اینڈ پوائنٹس فراہم کرتا ہے۔
OrbitKV vLLM اور SGLang کے لیے ایک بیرونی KV کیش ہے جو GPU سے خارج ہونے کے بعد دوبارہ قابل استعمال prefixes کو DRAM اور SSD میں رکھتا ہے اور مماثل درخواستوں پر انہیں بحال کرتا ہے۔ یہ فی ہوسٹ Cache Manager چلاتا ہے، اختیاری دوبارہ استعمال کی پالیسیاں، CUDA IPC کے ذریعے GPU منتقلی، اور تجرباتی ملٹی نوڈ اشتراک کو سپورٹ کرتا ہے۔
Dynamo ایک اوپن سورس ڈیٹا سینٹر پیمانے کی انفرنس آرکیسٹریشن لیئر ہے جو vLLM، SGLang اور TensorRT-LLM جیسے انجنوں کو متعدد GPUs پر مربوط کرتی ہے، اور disaggregated prefill/decode، KV-aware routing، multi-tier KV caching اور SLA-driven autoscaling شامل کرتی ہے۔