À propos du projet

Spotlight est une bibliothèque Python qui vous aide à comprendre rapidement des jeux de données non structurées. À partir d'un DataFrame pandas existant ou d'un jeu de données Hugging Face, vous pouvez lancer une visualisation interactive dans le navigateur en quelques lignes de code et utiliser des enrichissements de données tels que les embeddings, les prédictions et les incertitudes pour identifier les clusters critiques. Les types de données pris en charge incluent les images, l'audio, le texte, les vidéos, les séries temporelles et les données géométriques. Un exemple minimal charge un CSV dans un DataFrame et appelle spotlight.show avec un mapping de dtype afin que la visionneuse sache comment afficher des colonnes comme les images ou les embeddings. Les cas d'usage typiques présentés dans le README couvrent la classification d'images (détection de problèmes dans des jeux de données comme CIFAR-100, fine-tuning à partir de la recherche d'images Bing), la classification audio (débogage et comparaison de modèles de détection de genre sur le jeu de données emodb, problèmes de locuteurs dans les données Whisper/CommonVoice), la classification de texte, et l'analyse exploratoire de données mixtes comme les résultats de courses de Formule 1 et les données de simulation de crash. Chaque cas d'usage renvoie à des extraits de code, des démos interactives et des articles de blog. L'installation se fait via pip (renumics-spotlight), avec des extras optionnels pour les analyseurs et les embeddings basés sur torch. Python 3.10 ou supérieur est requis. Le README précise que l'utilisation des jeux de données Hugging Face version 4 avec des données audio nécessite également l'extra torch et FFmpeg. Spotlight prend en charge des dispositions prédéfinies, par exemple une disposition debug_classification qui prend des colonnes de label, prédiction, embedding et caractéristiques, et les dispositions peuvent aussi être construites par programmation ou via l'interface utilisateur. Le projet documente le suivi d'usage : il collecte des rapports de plantage et des statistiques de performance agrégées sous un identifiant machine anonymisé, et peut être désactivé via la variable d'environnement SPOTLIGHT_OPT_OUT. Il ne collecte pas les noms de dossiers, les noms de jeux de données ni les données des lignes. Le README renvoie à la documentation, à une référence d'API, à un playbook d'IA centrée sur les données, à une bibliothèque connexe de détection de tranches (Sliceguard), à des espaces d'exemple Hugging Face, à un canal Discord et à des directives de contribution.