عن المشروع
يوفر vLLM Semantic Router طبقة توجيه للمؤسسات التي تشغّل نماذج LLM متعددة عبر نماذج ومسرّعات ومواقع نشر مختلفة. وبدلاً من تضمين منطق اختيار النموذج مباشرة في التطبيقات، يمكن للفرق تعريف سياسات تقيّم الطلبات الواردة وتفضيلات المستخدم وخصائص عبء العمل وقيود البنية التحتية أو حدود البيانات. ثم يستطيع الموجّه اختيار مسار نموذج مناسب أو تركيب عدة نماذج لطلب واحد.
يستهدف المشروع بيئات استدلال غير متجانسة، تشمل وحدات GPU ومسرّعات أخرى، وعمليات النشر على الحافة والسحابة، والبنية التحتية الخاصة أو العامة. وتشمل أهدافه المعلنة مساعدة المستخدمين على إدارة المقايضات بين الجودة والتكلفة وزمن الاستجابة والخصوصية والسلامة عندما لا يكون أي نموذج واحد هو الأفضل لكل عبء عمل. ويصف ملف README مسارات نماذج مخصّصة، والتوجيه عبر موارد الحوسبة، وعناصر تحكم تهدف إلى إبقاء البيانات داخل حدود محددة.
المستودع مكتوب بلغة Go، مع شارة Go 1.25، ويوفر نص تثبيت مستقراً بالإضافة إلى وثائق للتثبيت عبر pip وuv والتثبيت الموجّه بالوكلاء. ويتوفر ملعب تجريبي عبر الإنترنت، ويربط المشروع بوثائق ومنشورات مدونات وأبحاث وموارد Hugging Face وقناة vLLM على Slack. ويسرد ملف README الإصدارات من v0.1 Iris حتى v0.3 Themis، إلى جانب أوراق ومقالات تغطي التخزين المؤقت الدلالي وقرارات التوجيه وكشف الهلوسة وقابلية توسعة LoRA والميزات المتعلقة بالدمج.
تشمل المشاركة المجتمعية اجتماعات شهرية مناسبة لمنطقتي آسيا والمحيط الهادئ والأمريكتين، وقناة Slack، وإرشادات المساهمة، ووثائق تطوير موجّهة للوكلاء. وتُدرج AMD كراعٍ يوفّر موارد GPU وبرمجيات ROCm لأبحاث نموذج الموجّه واختباره والملعب التجريبي عبر الإنترنت.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.