这个项目能做什么
Punjab Data Project 为 1910-1912 年英国旁遮普(Punjab)印刷登记簿提供了一个交互式探索器,其中包含 4,502 条书籍条目,代表 6,944,051 册登记副本。该探索器的功能包括可筛选的条目表、印刷商-出版商网络可视化、脚本市场分析、精选展示以及集成的页面扫描查看功能。
该仓库包含一个数据提取流水线,可将目录页图像处理为逐字记录和标准化数据层,并设有针对不确定读数的验证检查和裁决队列。分析工具可生成网络图和脚本市场报告。该项目记录了数据的特殊性,例如基于文本的“copies”字段需要转换为数字,且不同语言的数据完整度有所不同。
源数据来自大英图书馆印度办公室记录(公共领域)。可以使用提供的脚本通过流水线重建该站点。代码采用 GPLv3 协议,数据采用 CC0 协议,正文采用 CC BY 4.0 协议。
评论
0 评分人数达到10人后显示
登录后参与讨论。