Sobre el proyecto

El Punjab Data Project proporciona un explorador interactivo para el registro de imprenta del Punjab británico de 1910-1912, que contiene 4,502 entradas de libros que representan 6,944,051 copias registradas. El explorador cuenta con una tabla de entradas filtrable, visualización de redes de impresores y editores, análisis de mercado de escritura, exhibiciones seleccionadas y visualización integrada de escaneos de páginas. El repositorio incluye un pipeline de extracción de datos que procesa imágenes de páginas de catálogos en registros textuales y una capa de datos normalizada, con verificaciones de validación y colas de adjudicación para lecturas inciertas. Las herramientas de análisis generan grafos de red e informes de mercado de escritura. El proyecto documenta peculiaridades de los datos, como el campo 'copies' basado en texto que requiere conversión numérica y la variabilidad de la completitud según el idioma. Los datos de origen provienen de los British Library India Office Records (dominio público). El sitio puede reconstruirse a partir del pipeline utilizando los scripts proporcionados. El código es GPLv3, los datos son CC0 y la prosa es CC BY 4.0.