عن المشروع
## نظرة عامة على المشروع
هذا المستودع هو التنفيذ الرسمي للورقة البحثية "الذاكرة الشرطية عبر البحث القابل للتوسع: محور جديد للندرة في نماذج اللغة الكبيرة"، الصادرة عن DeepSeek. يدرس المستودع "الذاكرة الشرطية" كبعد للندرة مكمّل للخبراء المختلطين (MoE)، ويجسدها في وحدة Engram—وهي تحديث حديث لتضمينات N-gram الكلاسيكية مع بحث بتعقيد O(1).
## المحتوى الأساسي
- **تخصيص الندرة**: تُصيغ الورقة المفاضلة بين الحوسبة العصبية (MoE) والذاكرة الثابتة (Engram)، وتقترح قانون تحجيم على شكل حرف U لتوجيه تخصيص السعة.
- **التحقق التجريبي**: في ظل قيود متساوية لعدد المعلمات وFLOPs، يُظهر نموذج Engram-27B تحسنًا ثابتًا مقارنة بخط الأساس MoE في مجالات المعرفة والاستدلال والبرمجة والرياضيات.
- **التحليل الآلي**: يُظهر التحليل أن Engram يخفف عبء إعادة بناء الأنماط الثابتة في الطبقات المبكرة، مما قد يحافظ على العمق الفعّال للاستدلال المعقد.
- **كفاءة النظام**: تستخدم الوحدة عنونة حتمية، مما يسمح بتفريغ جدول التضمينات الضخم إلى ذاكرة المضيف مع حمل استدلال ضئيل.
## البنية والتقييم
تعزز وحدة Engram الشبكة الأساسية عبر استرجاع ذاكرة N-gram الثابتة ودمجها مع الحالات المخفية الديناميكية، ويوفر المستودع مخططات البنية وملفات drawio المصدرية. يتضمن قسم التقييم رسومًا بيانية لقوانين التحجيم، والتدريب المسبق واسع النطاق، والتدريب طويل السياق، ودراسات الحالة.
## البدء السريع
يُوصى باستخدام Python 3.8+ وPyTorch، وبعد تثبيت التبعيات، يمكن تشغيل السكربت التجريبي لعرض المنطق الأساسي لوحدة Engram. يُلاحظ أن الكود هو نسخة تجريبية تحاكي المكونات القياسية مثل Attention وMoE وmHC، مع التركيز على عرض تدفق البيانات في وحدة Engram.
## الترخيص والتواصل
يخضع استخدام النموذج للترخيص الموجود داخل المستودع، ويمكن إرسال الأسئلة عبر issues أو البريد الإلكتروني.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.