عن المشروع
يوفّر Stable Baselines3 (SB3) مجموعة من تطبيقات خوارزميات التعلّم المعزّز (RL) الموثوقة والمبنية باستخدام PyTorch. يهدف إلى أن يكون قاعدة مستقرة تمكن مجتمع البحث والصناعة من إعادة إنتاج وتحسين ومقارنة منهجيات RL دون الحاجة إلى تنفيذ الخوارزميات من الصفر.
من أبرز ميزات المشروع:
- دعم أحدث طرق RL مع واجهة موحّدة تشبه sklearn.
- إمكانية تخصيص البيئات وسياسات التعلّم والدلائل البرمجية (callbacks).
- التوافق مع مساحات الملاحظة من نوع Dict وأداة Tensorboard للمراقبة.
- تغطية شاملة للكود مع تلميحات أنواع الامتثال لمعايير PEP8.
- التكامل مع Weights & Biases لتتبع التجارب ومع Hugging Face لمشاركة النماذج.
تشمل الخوارزميات المُنفّذة: A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 وغيرها. تتوفر بعض الميزات التجريبية (مثل Recurrent PPO وTQC) عبر مستودع SB3-Contrib، بينما يتوفر إصدار قائم على Jax (SBX) لتحسين الأداء.
يرتبط المشروع أيضاً بـ RL Baselines3 Zoo، وهو إطار تدريبي يوفّر سكريبتات للتدريب وتقييم العوامل الضابطة وضبط المعاملات الفائقة للبيئات الشائعة.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.