这个项目能做什么

Spotlight 是一个 Python 库,可帮助你快速理解非结构化数据集。从现有的 pandas DataFrame 或 Hugging Face 数据集开始,你只需几行代码即可启动交互式浏览器可视化,并使用嵌入、预测和不确定性等数据增强功能来识别关键聚类。 支持的数据类型包括图像、音频、文本、视频、时间序列和几何数据。一个最小示例将 CSV 加载到 DataFrame 中,并调用 spotlight.show,同时传入 dtype 映射,以便查看器知道如何渲染图像或嵌入等列。 README 中展示的典型用例涵盖图像分类(在 CIFAR-100 等数据集中发现问题、基于 Bing 图像搜索进行微调)、音频分类(在 emodb 数据集上调试和比较性别检测模型、Whisper/CommonVoice 数据中的说话人问题)、文本分类,以及混合探索性数据分析,例如 Formula 1 比赛结果和碰撞模拟数据。每个用例都链接到代码片段、交互式演示和博客文章。 安装通过 pip(renumics-spotlight)进行,并提供用于分析器和基于 torch 的嵌入的可选附加项。需要 Python 3.10 或更高版本。README 指出,将 Hugging Face datasets 版本 4 与音频数据一起使用时,还需要 torch 附加项和 FFmpeg。 Spotlight 支持预定义布局,例如 debug_classification 布局,它接受标签、预测、嵌入和特征列,布局也可以通过编程方式或通过 UI 构建。该项目记录了使用情况跟踪:它在匿名机器 ID 下收集崩溃报告和聚合性能统计信息,并可通过 SPOTLIGHT_OPT_OUT 环境变量选择退出。它不收集文件夹名称、数据集名称或行数据。 README 指向文档、API 参考、以数据为中心的 AI 手册、相关的切片检测库(Sliceguard)、Hugging Face 示例空间、Discord 频道和贡献指南。