প্রকল্প সম্পর্কে
SDV (Synthetic Data Vault) হল ট্যাবুলার সিন্থেটিক ডেটা তৈরির জন্য একটি পাইথন লাইব্রেরি। এটি বিভিন্ন মেশিন লার্নিং মডেল ব্যবহার করে বাস্তব ডেটা থেকে প্যাটার্ন শেখে এবং সেগুলো তৈরি করা ডেটায় পুনরুৎপাদন করে।
README-তে বর্ণিত মূল ক্ষমতাগুলো:
- একাধিক সিন্থেসাইজার, ক্লাসিক্যাল পরিসংখ্যান পদ্ধতি (GaussianCopula) থেকে ডিপ লার্নিং (CTGAN) পর্যন্ত।
- একক টেবিল, একাধিক সংযুক্ত টেবিল এবং সিকোয়েন্সিয়াল টেবিলের জন্য সমর্থন।
- মেটাডেটা-চালিত মডেলিং: কলাম ডেটা টাইপ, প্রাইমারি কী এবং সম্পর্ক মেটাডেটায় বর্ণিত থাকে।
- মূল্যায়ন ও ভিজ্যুয়ালাইজেশন: কোয়ালিটি রিপোর্ট এবং কলাম প্লট দিয়ে সিন্থেটিক বনাম বাস্তব ডেটা তুলনা।
- প্রিপ্রসেসিং, অ্যানোনিমাইজেশন অপশন এবং ব্যবসায়িক নিয়ম এনকোড করার জন্য লজিক্যাল কনস্ট্রেইন্ট।
- ডেমো ডেটাসেট এবং Colab নোটবুকের মাধ্যমে টিউটোরিয়াল, সাথে ডকুমেন্টেশন এবং একটি কমিউনিটি ফোরাম।
সাধারণ কর্মপ্রবাহ: একটি ডেমো ডেটাসেট এবং মেটাডেটা ডাউনলোড করুন, GaussianCopulaSynthesizer-এর মতো একটি সিন্থেসাইজার ইনস্ট্যানশিয়েট করুন, বাস্তব ডেটায় ফিট করুন, তারপর সিন্থেটিক সারি স্যাম্পল করুন। একটি কোয়ালিটি রিপোর্ট সামগ্রিক স্কোর এবং কলাম শেপ ও কলাম পেয়ার ট্রেন্ড ব্রেকডাউন গণনা করে।
প্রকল্পটি The Synthetic Data Vault Project-এর অংশ, যা মূলত ২০১৬ সালে MIT-এর Data to AI Lab-এ তৈরি হয়েছিল এবং পরে DataCebo দ্বারা বিকশিত হয়। এটি Business Source License-এর অধীনে বিতরণ করা হয় এবং pip বা conda-এর মাধ্যমে ইনস্টলযোগ্য।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.