Sobre o projeto
O Punjab Data Project fornece um explorador interativo para o registro de impressão do Punjab britânico de 1910-1912, contendo 4.502 entradas de livros que representam 6.944.051 cópias registradas. O explorador apresenta uma tabela de entradas filtrável, visualização de rede impressor-editor, análise de script-mercado, exibições selecionadas e visualização integrada de digitalizações de páginas.
O repositório inclui um pipeline de extração de dados que processa imagens de páginas de catálogos em registros literais e uma camada de dados normalizada, com verificações de validação e filas de adjudicação para leituras incertas. Ferramentas de análise geram grafos de rede e relatórios de script-mercado. O projeto documenta peculiaridades dos dados, como o campo 'copies' baseado em texto que requer conversão numérica e a variação de completude por idioma.
Os dados de origem provêm dos British Library India Office Records (domínio público). O site pode ser reconstruído a partir do pipeline usando os scripts fornecidos. O código é GPLv3, os dados são CC0 e a prosa é CC BY 4.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.