عن المشروع

SDV (Synthetic Data Vault) هي مكتبة بايثون لإنشاء بيانات جدولية اصطناعية. تتعلم الأنماط من البيانات الحقيقية باستخدام مجموعة من نماذج التعلم الآلي وتعيد إنتاجها في البيانات المولدة. القدرات الرئيسية الموصوفة في ملف README: - مُصنِّعات متعددة، من الأساليب الإحصائية الكلاسيكية (GaussianCopula) إلى التعلم العميق (CTGAN). - دعم للجداول الفردية، والجداول المتعددة المترابطة، والجداول التسلسلية. - نمذجة تعتمد على البيانات الوصفية: أنواع أعمدة البيانات، والمفاتيح الأساسية، والعلاقات موصوفة في البيانات الوصفية. - التقييم والتصور: مقارنة البيانات الاصطناعية بالحقيقية عبر تقارير الجودة ورسوم الأعمدة. - المعالجة المسبقة، وخيارات إخفاء الهوية، والقيود المنطقية لتشفير قواعد الأعمال. - مجموعات بيانات تجريبية ودروس تعليمية عبر دفاتر Colab، بالإضافة إلى توثيق ومنتدى مجتمعي. سير العمل النموذجي: تنزيل مجموعة بيانات تجريبية وبياناتها الوصفية، إنشاء مُصنِّع مثل GaussianCopulaSynthesizer، تدريبه على البيانات الحقيقية، ثم أخذ عينات من الصفوف الاصطناعية. يقدم تقرير الجودة درجة إجمالية بالإضافة إلى تفاصيل شكل الأعمدة واتجاهات أزواج الأعمدة. المشروع جزء من مشروع The Synthetic Data Vault، الذي أُنشئ أصلاً في مختبر MIT Data to AI في عام 2016 وطُوِّر لاحقاً بواسطة DataCebo. يُوزَّع بموجب رخصة Business Source License ويمكن تثبيته عبر pip أو conda.