প্রকল্প সম্পর্কে

eurlex-builder হলো EUR-Lex / Cellar আইনপ্রণয়ন উপাদান থেকে গবেষণার উপযোগী ডেটাসেট তৈরির জন্য একটি কনফিগারযোগ্য Python কমান্ড-লাইন পাইপলাইন। এটি directives, regulations, decisions, communications এবং অন্যান্য EU act সংগ্রহ করে, তারপর নির্বাচনযোগ্য granularity-তে টেক্সট বের করে: সম্পূর্ণ article, সংখ্যাযুক্ত paragraph, বা অক্ষরযুক্ত point। এই টুলটি EU আইনপ্রণয়নের quantitative legal research, NLP, classification এবং network analysis-এর জন্য লক্ষ্যযুক্ত। পাইপলাইনটি একটি DuckDB কার্যকরী ডেটাবেস এবং চারটি Parquet টেবিল তৈরি করে: works, text_units, relations এবং eurovoc। এটি দুটি প্রধান query mode সমর্থন করে: fixed mode, যেখানে ব্যবহারকারীরা CELEX ID বা procedure number দেন, এবং descriptive mode, যেখানে ব্যবহারকারীরা document type, date range এবং ঐচ্ছিক EuroVoc keyword filter নির্বাচন করেন। এটি একাধিক EUR-Lex HTML কাঠামো পরিচালনা করে এবং পুরোনো বা machine-readable নয় এমন নথির জন্য Docling ও pymupdf ব্যবহার করে PDF fallback extraction অন্তর্ভুক্ত করে। মূল সক্ষমতাগুলোর মধ্যে রয়েছে sub-article decomposition, boilerplate stripping, recital/article/annex extraction, citation, amendment, legal base, repeal এবং consolidation-এর মতো আন্তঃনথি সম্পর্ক capture, এবং Helsinki-NLP Opus-MT revision ব্যবহার করে অ-ইংরেজি কনটেন্টের ঐচ্ছিক অনুবাদ। অনুবাদ token-bounded retry এবং quality check দিয়ে সুরক্ষিত, এবং প্রত্যাখ্যাত output মূল টেক্সট প্রতিস্থাপনের বদলে source language-এ থাকে। টুলটি reproducibility এবং resumability-তে জোর দেয়। একটি একক YAML ফাইল ডেটাসেট সংজ্ঞায়িত করে, আর DuckDB checkpoint, run manifest, validated configuration hash, dependency version এবং completion status সংরক্ষণ করে। CLI command-এর মধ্যে রয়েছে run, translate, enrich, status এবং validate। Enrichment SPARQL-এর মাধ্যমে post-hoc metadata যোগ করতে পারে, যার মধ্যে entry-into-force date, ELI, author institution, subject matter, procedure detail, EuroVoc descriptor এবং repeal relation অন্তর্ভুক্ত। validate command ডেটাবেস পরিবর্তন না করে read-only integrity check সম্পাদন করে। README উল্লেখ করে যে full-text retrieval ব্যাপকভাবে কাজ করে, তবে granular extraction regulations, directives এবং decisions-এর জন্য সবচেয়ে নির্ভরযোগ্য। Communications ভালোভাবে extract হয় কিন্তু পরিচিত ঘাটতি রয়েছে, অন্যদিকে proposals, staff working documents এবং case law structural unit হারাতে পারে বা কোনো text unit তৈরি করতে পারে না। এটি প্রকল্পটিকে EU আইনপ্রণয়ন টেক্সটের structured, auditable corpus তৈরিকারী গবেষকদের জন্য বিশেষভাবে উপযোগী করে তোলে।