このプロジェクトについて

Punjab Data Projectは、4,502件の書籍エントリー(登録コピー数6,944,051部)を含む1910-1912年の英領パンジャブ州印刷登録データのインタラクティブ・エクスプローラーを提供します。このエクスプローラーには、フィルタリング可能なエントリーテーブル、印刷業者と出版者のネットワーク可視化、文字・市場分析、キュレーションされた展示、および統合されたページスキャン閲覧機能が備わっています。 リポジトリには、カタログページの画像を逐語的なレコードと正規化されたデータレイヤーに処理するデータ抽出パイプラインが含まれており、不確実な読み取りに対する検証チェックと判定キューが設けられています。分析ツールは、ネットワークグラフや文字・市場レポートを生成します。また、本プロジェクトでは、数値変換が必要なテキストベースの「copies」フィールドや、言語による完全性の違いなど、データの特異性についても文書化しています。 ソースデータはBritish Library India Office Records(パブリックドメイン)から提供されています。提供されたスクリプトを使用して、パイプラインからサイトを再構築することが可能です。コードはGPLv3、データはCC0、文章はCC BY 4.0でライセンスされています。