عن المشروع

جانونو هو راوتر HTTP بسيط ومتوافق مع OpenAI مصمم للمستخدمين الذين يشغّلون عدة نماذج ذكاء اصطناعي محلية على بطاقة رسوميات واحدة. يقلّل النفقات العامة من خلال تنفيذ تجميع طموح: بدلاً من تبديل النماذج مع كل تغيير طلب، يخدم جميع الطلبات المعلقة للنموذج المحمّل حالياً فقط، ثم يقوم بالتبديل عند الضرورة فقط. يمكن أن يقلل هذا عدد تبديلات النماذج من عدة تبديلات إلى تبديلة واحدة لكل موجة، مما يوفر وقتاً كبيراً يتراوح بين 30 ثانية إلى 3 دقائق على الأجهزة المحلية. يدعم جانونو كل الخلفيات المحلية (مثل llama-server أو vLLM) وواجهات برمجة التطبيقات عن بُعد (مثل DeepSeek)، مع إعادة كتابة أسماء النماذج تلقائياً لمزودي الخدمات عن بُعد. يتضمن مراقبة أداء مدمجة عبر نقاط النهاية /health و/status ومقاييس Prometheus، لتتبع عمق الطابور، ومدة التبديل، وإنتاجية الرموز، وصحة الخلفية. يتم التعامل مع التكوين من خلال متغيرات البيئة وملف models.json، حيث يحدد المستخدمون أسماء النماذج وعناوين URL والأسماء المستعارة ونصوص التبديل الاختيارية. عقد نص التبديل بسيط: معطى اسم النموذج، يجب أن ينشط الخلفية المقابلة ويخرج بنظافة؛ يساعد التقرير عن الحالة الاختياري في اكتشاف الحالة الأولية. يُرسِل جانونو جميع الطلبات عبر كل خلفية للحفاظ على البساطة المنطقية، مما يجعله مثالياً للإعدادات الشخصية أو الصغيرة الحجم وليس خدمات متعددة المستأجرين. لا يدير درجة حرارة GPU أو موارد النظام — تبقى خارج نطاقه. مصمم كطبقة رقيقة فوق الأدوات القائمة،Offers تحكم صريحاً في تبديل النماذج، وتوافقا مع أي خلفية بأسلوب OpenAI، ومرور واضح للبث واستدعاء الأدوات. غير مطلوب إذا كنت تستخدم Ollama أو نموذجاً واحداً؛ يناسب بشكل أفضل المستخدمين الذين يملكون خلفيات مخصصة بالفعل ويرغبون في تحكم دقيق في التوجيه والتبديل.