عن المشروع
decisionrl هي مكتبة تعلم معزز مصممة خصيصًا لمشاكل اتخاذ القرار التشغيلية مثل التسعير، إدارة المخزون، توزيع الطاقة، قبول الطوابير، وتحسين سلسلة التوريد. على عكس أطر التعلم المعزز العامة التي تستهدف الألعاب والروبوتات، تقدم decisionrl كل مشكلة تطبيقية كبيئة من الدرجة الأولى مقترنة بخط الأساس الكلاسيكي لبحوث العمليات، بحيث يمكن قياس السياسة المتعلمة مقابل الطريقة القياسية بدلاً من الادعاء بأنها جيدة.
توفر المكتبة 31 خوارزمية تغطي الطرق الجدولية (Q-Learning، SARSA، Expected SARSA، Dyna-Q)، التعلم العميق القائم على القيمة (DQN، Rainbow، C51، QR-DQN)، طرق الممثل-الناقد (PPO، A2C، TRPO، GRPO، IMPALA، Recurrent PPO)، التحكم المستمر (DDPG، TD3، SAC، SACDiscrete)، التعلم المعزز غير المتصل (TD3+BC، IQL، CQL، Decision Transformer)، الأساليب القائمة على النماذج (MBPO، Dreamer، DreamerRSSM)، التعلم الموجه بالأهداف (HER+DQN)، والتعلم بالمحاكاة (Diffusion Policy). كل وكيل يعرض واجهة موحدة للتنبؤ/التعلم/الحفظ/التحميل بغض النظر عما إذا كان جدوليًا أو عميقًا، منفصلاً أو مستمرًا، على السياسة أو خارجها.
النواة خفيفة الاعتماديات: البيئات، الخطوط الأساسية الكلاسيكية، والحلول هي NumPy نقية، بينما PyTorch إضافة اختيارية مطلوبة فقط للخوارزميات التي تتدرب. تشمل البيئات المدمجة GridWorld، CartPole، Pendulum، PointMass، واللصوص، مما يتيح التدريب من البداية إلى النهاية دون تثبيتات إضافية. بيئات Gymnasium متاحة كإضافة اختيارية.
تغطي البيئات التطبيقية المخزون غير الثابت مع طلب متغير، سلاسل التوريد ذات المستويين، التحكم في قبول الطوابير، إدارة بطاريات الشبكات الصغيرة للطاقة، التحكم في منظم الحرارة/التدفئة والتهوية وتكييف الهواء، المخزون الثابت، التسعير الديناميكي، والتسعير المشترك مع المخزون. يتضمن كل منها أفضل خط أساس كلاسيكي بقاعدة ثابتة تم العثور عليه بالبحث، وليس افتراضيًا ساذجًا. تظهر النتائج أن السياسة المتعلمة تتفوق على خط الأساس الكلاسيكي في المهام غير الثابتة (على سبيل المثال، تحسن بنحو 16% في المخزون المتغير، 20% في الشبكة الصغيرة للطاقة، 15% في خفض تكلفة سلسلة التوريد) وتطابق الأمثل الديناميكي البرمجي الدقيق في المهام الثابتة. دراسة حالة تقود بيئة المخزون ببيانات الاستهلاك الحقيقي الفصلية للولايات المتحدة من 1959 إلى 2009، مما يظهر أن السياسة المتعلمة تحسن أفضل مخزون أساس ثابت لأن اتجاهات الطلب الحقيقية ولا يوجد مستوى طلب واحد يناسب كل عصر.
تتضمن المكتبة أيضًا لصوصًا سياقيين (LinUCB، أخذ عينات طومسون الخطي، إبسيلون-جشع) لقرارات لمرة واحدة مثل التسعير والتوصية، RLHF وDPO على مهام التحكم وGPT على مستوى الأحرف، التعلم بالمحاكاة (BC، DAgger، GAIL)، استكشاف مدفوع بالفضول (RND، ICM)، تحسين بدون تدرج (12 طريقة تطور وسرب بواجهة ask/tell بالإضافة إلى NeuroevolutionAgent)، AlphaZero مع MCTS ولعب ذاتي لألعاب المعلومات الكاملة للاعبين، meta-RL (RL²) للتكيف عبر الإنترنت عبر توزيع المهام، لعب ذاتي متعدد الوكلاء مع IPPO، ممثلون موزعون بأسلوب IMPALA يغذون متعلم V-trace مركزي، وتصدير ONNX وTorchScript مع حاوية خدمة FastAPI بدون torch.
واجهة سطر أوامر تدعم التدريب والتقييم وتصور لوحة القيادة المباشرة. يمكن الإعلان عن التجارب في YAML أو JSON وتشغيلها باستخدام decisionrl run أو decisionrl.config.run. يتم ضمان قابلية التكرار من خلال RNGs قابلة للبذر عبر Python وNumPy وPyTorch، مع مجموعة اختبار تزيد عن 400 اختبار تغطي صحة المكونات (الفضاءات، المخازن المؤقتة، sum-tree، الجداول، GAE، التطبيع، دورات الحفظ/التحميل) وسلوك التعلم (الطرق الجدولية تصل إلى سياسة GridWorld المثلى؛ DQN وPPO يتعلمان CartPole؛ SAC وTD3 وDDPG يحلون مهمة PointMass). يعيد سير عمل CI مجدول تشغيل التحقق التطبيقي متعدد البذور ليلاً ويفشل إذا تراجع أي نتيجة مبلغ عنها عن خط الأساس.
المشروع مرخص بموجب MIT ويستمد الإلهام التصميمي من CleanRL وStable-Baselines3 وTianshou ومؤسسة Farama's Gymnasium.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.