প্রকল্প সম্পর্কে

Punjab Data Project ১৯১০-১৯১২ সালের ব্রিটিশ পাঞ্জাব প্রিন্ট রেজিস্টারের জন্য একটি ইন্টারঅ্যাক্টিভ এক্সপ্লোরার প্রদান করে, যাতে ৪,৫০২টি বইয়ের এন্ট্রি রয়েছে যা ৬,৯৪৪,০৫১টি নিবন্ধিত কপির প্রতিনিধিত্ব করে। এই এক্সপ্লোরারটিতে একটি ফিল্টারযোগ্য এন্ট্রি টেবিল, মুদ্রাকর-প্রকাশক নেটওয়ার্ক ভিজ্যুয়ালাইজেশন, স্ক্রিপ্ট-মার্কেট বিশ্লেষণ, কিউরেটেড প্রদর্শনী এবং সমন্বিত পেজ স্ক্যান ভিউয়িং সুবিধা রয়েছে। এই রিপোজিটরিতে একটি ডেটা এক্সট্রাকশন পাইপলাইন অন্তর্ভুক্ত রয়েছে যা ক্যাটালগ পেজের ছবিগুলোকে শব্দশঃ রেকর্ডে এবং একটি নরমালাইজড ডেটা লেয়ারে রূপান্তর করে, যেখানে অনিশ্চিত পাঠের জন্য ভ্যালিডেশন চেক এবং অ্যাডজুডিকেশন কিউ রয়েছে। বিশ্লেষণ সরঞ্জামগুলো নেটওয়ার্ক গ্রাফ এবং স্ক্রিপ্ট-মার্কেট রিপোর্ট তৈরি করে। প্রকল্পটি ডেটার বিশেষ বৈশিষ্ট্যগুলো নথিভুক্ত করে, যেমন টেক্সট-ভিত্তিক 'copies' ফিল্ডটির জন্য নিউমেরিক কনভার্সন প্রয়োজন এবং ভাষাভেদে তথ্যের পূর্ণতার ভিন্নতা। উৎস ডেটা ব্রিটিশ লাইব্রেরি ইন্ডিয়া অফিস রেকর্ডস (পাবলিক ডোমেইন) থেকে নেওয়া হয়েছে। প্রদত্ত স্ক্রিপ্ট ব্যবহার করে পাইপলাইনের মাধ্যমে সাইটটি পুনরায় তৈরি করা সম্ভব। কোডটি GPLv3, ডেটা CC0 এবং গদ্য CC BY 4.0 লাইসেন্সের অধীনে।