このプロジェクトについて

Spotlightは、非構造化データセットを素早く理解するためのPythonライブラリです。既存のpandas DataFrameまたはHugging Faceデータセットから始めて、数行のコードでインタラクティブなブラウザ可視化を起動し、埋め込み、予測、不確実性などのデータエンリッチメントを用いて重要なクラスタを特定できます。 対応するデータ型には、画像、音声、テキスト、動画、時系列、幾何データが含まれます。最小限の例では、CSVをDataFrameに読み込み、dtypeマッピングを指定してspotlight.showを呼び出します。これにより、ビューアは画像や埋め込みなどの列をどのようにレンダリングするかを把握できます。 READMEに示されている典型的なユースケースには、画像分類(CIFAR-100などのデータセットの問題発見、Bing画像検索からのファインチューニング)、音声分類(emodbデータセットでの性別検出モデルのデバッグと比較、Whisper/CommonVoiceデータにおける話者問題)、テキスト分類、そしてFormula 1のレース結果や衝突シミュレーションデータなどの混合探索的データ分析が含まれます。各ユースケースには、コードスニペット、インタラクティブなデモ、ブログ記事へのリンクがあります。 インストールはpip(renumics-spotlight)で行い、アナライザーやtorchベースの埋め込み用のオプションのextrasがあります。Python 3.10以上が必要です。READMEには、音声データでHugging Face datasetsバージョン4を使用する場合、torch extraとFFmpegも必要であると記載されています。 Spotlightは事前定義されたレイアウトをサポートしています。例えば、label、prediction、embedding、feature列を受け取るdebug_classificationレイアウトがあり、レイアウトはプログラムで、またはUIを通じて構築することもできます。このプロジェクトは使用状況の追跡について文書化しています。匿名化されたマシンIDの下でクラッシュレポートと集計されたパフォーマンス統計を収集し、SPOTLIGHT_OPT_OUT環境変数でオプトアウトできます。フォルダ名、データセット名、行データは収集しません。 READMEは、ドキュメント、APIリファレンス、データ中心AIプレイブック、関連するスライス検出ライブラリ(Sliceguard)、Hugging Faceのサンプルスペース、Discordチャンネル、コントリビューションガイドラインを参照しています。