عن المشروع
يشكل LLM Gateway طرفياً معكوساً للتعامل مع واجهة برمجة إكمال المحادثات الخاصة بـ OpenAI، حيث يُقلّص التكاليف من خلال خدمة الأسئلة المتكررة أو مماثلة semanticsياً من تخزين Redis. يدعم النظام درجتين للذاكرة المؤقتة: التطابق الدقيق (عبر تطبيع prompts) والتطابق الدلالي (باستخدام البحث المتجهي عبر Redis Stack). تُعاد صياغة الأسئلة اللاحقة إلى أشكال مستقلة قبل تضمينها لتمكين المطابقة عبر المحادثات. بُني النظام باستخدام FastAPI وRedis Stack، ويضيف عناوين X-Cache إلى الاستجابات لتمكين المستخدمين من التحقق من الدرجة التي كانت قد خدمت كل طلب. يتطلب الإعداد المحلي Python 3.12 أو أعلى، Docker، ومفتاح OpenAI. يتضمن نظام عروض توضيحية، واختبار الحمل، ومقاييس تُظهر أن المطابقات الدقيقة تستغرق حوالي 2 مللي ثانية، والمطابقات الدلالية حوالي 250 مللي ثانية، بينما تستغرق حالات الفشل بين 1 و4 ثوانٍ. صُمم للنشر كحاوية عديمة الحالة مع Redis Stack، ويدعم ضوابط الميزانية، وحدود المعدّل، والرقابة عند تفعيلها للنماذج العامة. تنتهي صلاحية عناصر الذاكرة المؤقتة بعد ساعة واحدة؛ ولا يدعم البث المباشر ولا طبقة مصادقة.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.