Об этом проекте

SDV (Synthetic Data Vault) — это библиотека Python для создания табличных синтетических данных. Она изучает закономерности из реальных данных с помощью ряда моделей машинного обучения и воспроизводит их в сгенерированных данных. Ключевые возможности, описанные в README: - Несколько синтезаторов: от классических статистических методов (GaussianCopula) до глубокого обучения (CTGAN). - Поддержка одиночных таблиц, нескольких связанных таблиц и последовательных таблиц. - Моделирование на основе метаданных: типы данных столбцов, первичные ключи и связи описываются в метаданных. - Оценка и визуализация: сравнение синтетических и реальных данных с помощью отчетов о качестве и графиков столбцов. - Предобработка, параметры анонимизации и логические ограничения для кодирования бизнес-правил. - Демонстрационные наборы данных и учебные пособия через блокноты Colab, а также документация и форум сообщества. Типичный рабочий процесс: загрузка демонстрационного набора данных и метаданных, создание экземпляра синтезатора, такого как GaussianCopulaSynthesizer, обучение на реальных данных, затем генерация синтетических строк. Отчет о качестве вычисляет общий балл, а также разбивку по форме столбцов и тенденциям пар столбцов. Проект является частью The Synthetic Data Vault Project, первоначально созданного в лаборатории Data to AI в MIT в 2016 году, а затем разработанного DataCebo. Он распространяется под лицензией Business Source License и устанавливается через pip или conda.