عن المشروع

يوفر Punjab Data Project مستكشفاً تفاعلياً لسجل المطبوعات في البنجاب البريطانية للفترة 1910-1912، والذي يحتوي على 4,502 إدخال كتاب تمثل 6,944,051 نسخة مسجلة. يتميز المستكشف بجدول إدخالات قابل للتصفية، وتصور لشبكة الطابعين والناشرين، وتحليل لسوق النصوص، ومعارض منسقة، وعرض متكامل للمسحات الضوئية للصفحات. يتضمن المستودع مسار استخراج بيانات يقوم بمعالجة صور صفحات الفهرس إلى سجلات حرفية وطبقة بيانات موحدة، مع فحوصات تحقق وطوابير تحكيم للقراءات غير المؤكدة. وتعمل أدوات التحليل على إنشاء رسوم بيانية للشبكات وتقارير عن سوق النصوص. يوثق المشروع خصوصيات البيانات، مثل حقل 'النسخ' القائم على النصوص والذي يتطلب تحويلاً رقمياً، وتفاوت درجة الاكتمال حسب اللغة. تأتي البيانات المصدرية من سجلات مكتب الهند في المكتبة البريطانية (الملكية العامة). ويمكن إعادة بناء الموقع من مسار البيانات باستخدام النصوص البرمجية المقدمة. الكود مرخص بموجب GPLv3، والبيانات بموجب CC0، والنصوص بموجب CC BY 4.0.