Об этом проекте
Spotlight — это библиотека Python, которая помогает быстро понимать неструктурированные наборы данных. Начиная с существующего pandas DataFrame или набора данных Hugging Face, вы можете запустить интерактивную визуализацию в браузере с помощью нескольких строк кода и использовать обогащения данных, такие как эмбеддинги, предсказания и неопределённости, чтобы выявлять критически важные кластеры.
Поддерживаемые типы данных включают изображения, аудио, текст, видео, временные ряды и геометрические данные. Минимальный пример загружает CSV в DataFrame и вызывает spotlight.show с сопоставлением dtype, чтобы средство просмотра знало, как отображать такие столбцы, как изображения или эмбеддинги.
Типичные сценарии использования, показанные в README, охватывают классификацию изображений (поиск проблем в наборах данных, таких как CIFAR-100, дообучение на основе поиска изображений Bing), классификацию аудио (отладка и сравнение моделей определения пола на наборе данных emodb, проблемы со спикерами в данных Whisper/CommonVoice), классификацию текста и смешанный исследовательский анализ данных, например результаты гонок Formula 1 и данные моделирования аварий. Каждый сценарий использования содержит ссылки на фрагменты кода, интерактивные демонстрации и статьи в блоге.
Установка выполняется через pip (renumics-spotlight), с дополнительными опциями для анализаторов и эмбеддингов на основе torch. Требуется Python 3.10 или выше. В README отмечено, что использование наборов данных Hugging Face версии 4 с аудиоданными также требует дополнительной опции torch и FFmpeg.
Spotlight поддерживает предопределённые макеты, например макет debug_classification, который принимает столбцы метки, предсказания, эмбеддинга и признаков; макеты также можно создавать программно или через пользовательский интерфейс. Проект документирует отслеживание использования: он собирает отчёты о сбоях и агрегированную статистику производительности под анонимизированным идентификатором машины, и от этого можно отказаться с помощью переменной окружения SPOTLIGHT_OPT_OUT. Он не собирает имена папок, имена наборов данных или данные строк.
README содержит ссылки на документацию, справочник по API, playbook по data-centric AI, связанную библиотеку обнаружения срезов (Sliceguard), примеры пространств Hugging Face, канал Discord и руководство по внесению вклада.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.