À propos du projet
Le Punjab Data Project propose un explorateur interactif pour le registre d'impression du Pendjab britannique de 1910-1912, contenant 4 502 entrées de livres représentant 6 944 051 exemplaires enregistrés. L'explorateur comprend un tableau d'entrées filtrable, une visualisation du réseau imprimeur-éditeur, une analyse du marché des écritures, des expositions organisées et une visionneuse intégrée pour les scans de pages.
Le dépôt inclut un pipeline d'extraction de données qui transforme les images de pages de catalogue en enregistrements verbatim et en une couche de données normalisées, avec des vérifications de validation et des files d'arbitrage pour les lectures incertaines. Des outils d'analyse génèrent des graphes de réseau et des rapports sur le marché des écritures. Le projet documente les particularités des données, telles que le champ « copies » textuel nécessitant une conversion numérique et la variation du niveau de complétude selon la langue.
Les données sources proviennent des India Office Records de la British Library (domaine public). Le site peut être reconstruit à partir du pipeline à l'aide des scripts fournis. Le code est sous licence GPLv3, les données sont CC0 et les textes sont CC BY 4.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.