Sobre o projeto
Spotlight é uma biblioteca Python que ajuda a compreender rapidamente conjuntos de dados não estruturados. A partir de um DataFrame pandas existente ou de um dataset do Hugging Face, você pode iniciar uma visualização interativa no navegador com poucas linhas de código e usar enriquecimentos de dados, como embeddings, previsões e incertezas, para identificar clusters críticos.
Os tipos de dados suportados incluem imagens, áudio, texto, vídeos, séries temporais e dados geométricos. Um exemplo mínimo carrega um CSV em um DataFrame e chama spotlight.show com um mapeamento de tipos (dtype) para que o visualizador saiba como renderizar colunas como imagens ou embeddings.
Os casos de uso típicos mostrados no README cobrem classificação de imagens (encontrando problemas em conjuntos como CIFAR-100, ajuste fino a partir de busca de imagens no Bing), classificação de áudio (depuração e comparação de modelos de detecção de gênero no dataset emodb, problemas de locutor em dados Whisper/CommonVoice), classificação de texto e análise exploratória mista, como resultados de corridas de Fórmula 1 e dados de simulação de colisões. Cada caso de uso vincula a trechos de código, demonstrações interativas e artigos de blog.
A instalação é feita via pip (renumics-spotlight), com extras opcionais para analisadores e embeddings baseados em torch. É necessário Python 3.10 ou superior. O README observa que usar datasets do Hugging Face versão 4 com dados de áudio também requer o extra torch e FFmpeg.
O Spotlight suporta layouts predefinidos, por exemplo, um layout debug_classification que recebe colunas de rótulo, previsão, embedding e características, e os layouts também podem ser construídos programaticamente ou pela interface. O projeto documenta o rastreamento de uso: coleta relatórios de falhas e estatísticas agregadas de desempenho sob um ID de máquina anônimo, e pode ser desativado via variável de ambiente SPOTLIGHT_OPT_OUT. Não coleta nomes de pastas, nomes de datasets ou dados de linhas.
O README aponta para documentação, referência de API, um manual de IA centrada em dados, uma biblioteca relacionada de detecção de fatias (Sliceguard), espaços de exemplo no Hugging Face, um canal no Discord e diretrizes de contribuição.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.