Об этом проекте
SDV (Synthetic Data Vault) — это библиотека Python для создания табличных синтетических данных. Она изучает закономерности из реальных данных с помощью ряда моделей машинного обучения и воспроизводит их в сгенерированных данных.
Ключевые возможности, описанные в README:
- Несколько синтезаторов: от классических статистических методов (GaussianCopula) до глубокого обучения (CTGAN).
- Поддержка одиночных таблиц, нескольких связанных таблиц и последовательных таблиц.
- Моделирование на основе метаданных: типы данных столбцов, первичные ключи и связи описываются в метаданных.
- Оценка и визуализация: сравнение синтетических и реальных данных с помощью отчетов о качестве и графиков столбцов.
- Предобработка, параметры анонимизации и логические ограничения для кодирования бизнес-правил.
- Демонстрационные наборы данных и учебные пособия через блокноты Colab, а также документация и форум сообщества.
Типичный рабочий процесс: загрузка демонстрационного набора данных и метаданных, создание экземпляра синтезатора, такого как GaussianCopulaSynthesizer, обучение на реальных данных, затем генерация синтетических строк. Отчет о качестве вычисляет общий балл, а также разбивку по форме столбцов и тенденциям пар столбцов.
Проект является частью The Synthetic Data Vault Project, первоначально созданного в лаборатории Data to AI в MIT в 2016 году, а затем разработанного DataCebo. Он распространяется под лицензией Business Source License и устанавливается через pip или conda.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.