프로젝트 소개

SDV(Synthetic Data Vault)는 표 형식의 합성 데이터를 생성하기 위한 Python 라이브러리입니다. 다양한 머신러닝 모델을 사용해 실제 데이터에서 패턴을 학습하고 이를 생성 데이터에 재현합니다. README에 설명된 주요 기능: - 고전적 통계 방법(GaussianCopula)부터 딥러닝(CTGAN)까지 다양한 합성기. - 단일 테이블, 서로 연결된 여러 테이블, 순차 테이블 지원. - 메타데이터 기반 모델링: 열 데이터 유형, 기본 키 및 관계가 메타데이터에 설명됩니다. - 평가 및 시각화: 품질 보고서와 열 플롯으로 합성 데이터와 실제 데이터를 비교합니다. - 전처리, 익명화 옵션, 비즈니스 규칙을 인코딩하기 위한 논리적 제약. - Colab 노트북을 통한 데모 데이터셋과 튜토리얼, 문서 및 커뮤니티 포럼. 일반적인 워크플로: 데모 데이터셋과 메타데이터를 다운로드하고, GaussianCopulaSynthesizer와 같은 합성기를 인스턴스화한 뒤 실제 데이터에 적합시키고, 합성 행을 샘플링합니다. 품질 보고서는 전체 점수와 열 형태 및 열 쌍 추세 분석을 계산합니다. 이 프로젝트는 The Synthetic Data Vault Project의 일부로, 2016년 MIT의 Data to AI Lab에서 처음 만들어졌고 이후 DataCebo에서 개발되었습니다. Business Source License에 따라 배포되며 pip 또는 conda로 설치할 수 있습니다.