প্রকল্প সম্পর্কে

SDV (Synthetic Data Vault) হল ট্যাবুলার সিন্থেটিক ডেটা তৈরির জন্য একটি পাইথন লাইব্রেরি। এটি বিভিন্ন মেশিন লার্নিং মডেল ব্যবহার করে বাস্তব ডেটা থেকে প্যাটার্ন শেখে এবং সেগুলো তৈরি করা ডেটায় পুনরুৎপাদন করে। README-তে বর্ণিত মূল ক্ষমতাগুলো: - একাধিক সিন্থেসাইজার, ক্লাসিক্যাল পরিসংখ্যান পদ্ধতি (GaussianCopula) থেকে ডিপ লার্নিং (CTGAN) পর্যন্ত। - একক টেবিল, একাধিক সংযুক্ত টেবিল এবং সিকোয়েন্সিয়াল টেবিলের জন্য সমর্থন। - মেটাডেটা-চালিত মডেলিং: কলাম ডেটা টাইপ, প্রাইমারি কী এবং সম্পর্ক মেটাডেটায় বর্ণিত থাকে। - মূল্যায়ন ও ভিজ্যুয়ালাইজেশন: কোয়ালিটি রিপোর্ট এবং কলাম প্লট দিয়ে সিন্থেটিক বনাম বাস্তব ডেটা তুলনা। - প্রিপ্রসেসিং, অ্যানোনিমাইজেশন অপশন এবং ব্যবসায়িক নিয়ম এনকোড করার জন্য লজিক্যাল কনস্ট্রেইন্ট। - ডেমো ডেটাসেট এবং Colab নোটবুকের মাধ্যমে টিউটোরিয়াল, সাথে ডকুমেন্টেশন এবং একটি কমিউনিটি ফোরাম। সাধারণ কর্মপ্রবাহ: একটি ডেমো ডেটাসেট এবং মেটাডেটা ডাউনলোড করুন, GaussianCopulaSynthesizer-এর মতো একটি সিন্থেসাইজার ইনস্ট্যানশিয়েট করুন, বাস্তব ডেটায় ফিট করুন, তারপর সিন্থেটিক সারি স্যাম্পল করুন। একটি কোয়ালিটি রিপোর্ট সামগ্রিক স্কোর এবং কলাম শেপ ও কলাম পেয়ার ট্রেন্ড ব্রেকডাউন গণনা করে। প্রকল্পটি The Synthetic Data Vault Project-এর অংশ, যা মূলত ২০১৬ সালে MIT-এর Data to AI Lab-এ তৈরি হয়েছিল এবং পরে DataCebo দ্বারা বিকশিত হয়। এটি Business Source License-এর অধীনে বিতরণ করা হয় এবং pip বা conda-এর মাধ্যমে ইনস্টলযোগ্য।