عن المشروع

SGLang-Omni هو إطار عمل للخدمة من مشروع SGLang يستهدف نماذج الأومني والكلام وتحويل النص إلى كلام. بدلاً من معالجة التوليد كخطوة واحدة متجانسة، فإنه يصمم الاستدلال كخط أنابيب من مراحل منسقة: المعالجة المسبقة، والمشفِّرات، ومحركات الانحدار الذاتي، والمتحدثون، وفكّات التشفير، ومولِّدات الصوت، والمجمِّعات. تعمل كل مرحلة خلف جدولة مناسبة لعبء عملها، وتقوم طائرة تحكم بتنسيق الطلبات بينما تنقل طائرة بيانات ترحيل الحمولات الموترية عبر خلفيات الذاكرة المشتركة وNCCL وNIXL وMooncake. حيثما أمكن، يتكامل مع SGLang للجدولة الذاتية وتنفيذ النماذج. يكشف المشروع عن واجهة برمجة تطبيقات متوافقة مع OpenAI تغطي الدردشة متعددة الوسائط، وتوليد الكلام، والكلام الدفعي والمتدفق، والأصوات المرفوعة، ونسخ الصوت. يعمل موجه SGLang-Omni المنفصل كبوابة أمامية متعددة العمال مع اكتشاف الصحة والجاهزية ودورة الحياة والقدرات. تشمل تغطية النماذج الموضحة في ملف README نماذج الدردشة والكلام الأومني مثل Qwen3-Omni وMing-Omni؛ وتوليد الموسيقى مع MiniMax Music 3 (كلمات الأغاني بالإضافة إلى وصف إلى ستيريو 32 كيلوهرتز)؛ وتوليد الكلام مع Higgs Audio v3 وMOSS-TTS وMOSS-TTS Local وFish Speech S2-Pro وQwen3-TTS وVoxtral TTS وMing-Omni-TTS وdots.tts وZONOS2؛ والنسخ والفصل بين المتحدثين مع Qwen3-ASR وFun-ASR وARK-ASR وMOSS-Transcribe-Diarize، حيث يدعم الأخير تسميات المتحدثين والطوابع الزمنية عبر verbose_json. تذكر الإدخالات الإخبارية الأخيرة أيضًا دعم AuK وAuK-Flash لتعليمات النص/الصوت وتحرير الصوت. دعم الأجهزة موثق على أنه NVIDIA CUDA (افتراضي، تغطية كاملة للنماذج)، وApple Silicon (تجريبي، Qwen3-ASR عبر MLX أو Torch MPS على macOS arm64)، وIntel XPU (تجريبي، مع Qwen3-ASR وQwen3-TTS وQwen3-Omni تعمل من البداية إلى النهاية مع خلفية مكتشفة تلقائيًا). التثبيت متاح من PyPI، مع سكربت تثبيت بأمر واحد لـ macOS Apple Silicon، ويتم توفير وثائق شاملة وروابط لكتاب الطبخ ومرجع المطور. المشروع مرخص بموجب رخصة مفتوحة المصدر ويرحب بالمساهمات حول أنظمة الاستدلال والنوى والجدولة والتواصل بين المراحل ومشغلات النماذج والقياس والنشر.