প্রকল্প সম্পর্কে
Punjab Data Project ১৯১০-১৯১২ সালের ব্রিটিশ পাঞ্জাব প্রিন্ট রেজিস্টারের জন্য একটি ইন্টারঅ্যাক্টিভ এক্সপ্লোরার প্রদান করে, যাতে ৪,৫০২টি বইয়ের এন্ট্রি রয়েছে যা ৬,৯৪৪,০৫১টি নিবন্ধিত কপির প্রতিনিধিত্ব করে। এই এক্সপ্লোরারটিতে একটি ফিল্টারযোগ্য এন্ট্রি টেবিল, মুদ্রাকর-প্রকাশক নেটওয়ার্ক ভিজ্যুয়ালাইজেশন, স্ক্রিপ্ট-মার্কেট বিশ্লেষণ, কিউরেটেড প্রদর্শনী এবং সমন্বিত পেজ স্ক্যান ভিউয়িং সুবিধা রয়েছে।
এই রিপোজিটরিতে একটি ডেটা এক্সট্রাকশন পাইপলাইন অন্তর্ভুক্ত রয়েছে যা ক্যাটালগ পেজের ছবিগুলোকে শব্দশঃ রেকর্ডে এবং একটি নরমালাইজড ডেটা লেয়ারে রূপান্তর করে, যেখানে অনিশ্চিত পাঠের জন্য ভ্যালিডেশন চেক এবং অ্যাডজুডিকেশন কিউ রয়েছে। বিশ্লেষণ সরঞ্জামগুলো নেটওয়ার্ক গ্রাফ এবং স্ক্রিপ্ট-মার্কেট রিপোর্ট তৈরি করে। প্রকল্পটি ডেটার বিশেষ বৈশিষ্ট্যগুলো নথিভুক্ত করে, যেমন টেক্সট-ভিত্তিক 'copies' ফিল্ডটির জন্য নিউমেরিক কনভার্সন প্রয়োজন এবং ভাষাভেদে তথ্যের পূর্ণতার ভিন্নতা।
উৎস ডেটা ব্রিটিশ লাইব্রেরি ইন্ডিয়া অফিস রেকর্ডস (পাবলিক ডোমেইন) থেকে নেওয়া হয়েছে। প্রদত্ত স্ক্রিপ্ট ব্যবহার করে পাইপলাইনের মাধ্যমে সাইটটি পুনরায় তৈরি করা সম্ভব। কোডটি GPLv3, ডেটা CC0 এবং গদ্য CC BY 4.0 লাইসেন্সের অধীনে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.