منصوبے کے بارے میں

eurlex-builder ایک قابلِ ترتیب Python کمانڈ لائن پائپ لائن ہے جو EUR-Lex / Cellar قانون سازی مواد سے تحقیقی استعمال کے لیے تیار ڈیٹا سیٹ بناتی ہے۔ یہ directives، regulations، decisions، communications اور دیگر EU acts حاصل کرتی ہے، پھر متن کو منتخب کردہ granularity پر extract کرتی ہے: مکمل articles، numbered paragraphs، یا lettered points۔ یہ ٹول EU قانون سازی کی مقداری قانونی تحقیق، NLP، classification اور network analysis کے لیے بنایا گیا ہے۔ یہ پائپ لائن ایک DuckDB working database کے ساتھ چار Parquet tables بناتی ہے: works، text_units، relations اور eurovoc۔ یہ دو بنیادی query modes کی سہولت دیتی ہے: fixed mode، جس میں صارفین CELEX IDs یا procedure numbers فراہم کرتے ہیں، اور descriptive mode، جس میں صارفین document types، date ranges اور اختیاری EuroVoc keyword filters منتخب کرتے ہیں۔ یہ متعدد EUR-Lex HTML structures کو سنبھالتی ہے اور پرانے یا غیر machine-readable دستاویزات کے لیے Docling اور pymupdf کے ذریعے PDF fallback extraction شامل کرتی ہے۔ اہم صلاحیتوں میں sub-article decomposition، boilerplate stripping، recital/article/annex extraction، بین دستاویزی تعلقات کی گرفت جیسے citations، amendments، legal bases، repeals اور consolidations، اور Helsinki-NLP Opus-MT revisions کے ذریعے غیر انگریزی مواد کا اختیاری ترجمہ شامل ہے۔ ترجمہ token-bounded retries اور quality checks کے ساتھ محفوظ کیا جاتا ہے، اور مسترد شدہ outputs اصل متن کو بدلنے کے بجائے source language میں رہتے ہیں۔ یہ ٹول reproducibility اور resumability پر زور دیتا ہے۔ ایک واحد YAML فائل dataset کی تعریف کرتی ہے، جبکہ DuckDB checkpoints، run manifests، validated configuration hashes، dependency versions اور completion status محفوظ کرتا ہے۔ CLI commands میں run، translate، enrich، status اور validate شامل ہیں۔ Enrichment SPARQL کے ذریعے post-hoc metadata شامل کر سکتی ہے، بشمول entry-into-force dates، ELI، author institutions، subject matter، procedure details، EuroVoc descriptors اور repeal relations۔ validate command database میں تبدیلی کیے بغیر read-only integrity checks انجام دیتا ہے۔ README نوٹ کرتا ہے کہ full-text retrieval وسیع پیمانے پر کام کرتی ہے، لیکن granular extraction regulations، directives اور decisions کے لیے سب سے زیادہ قابلِ اعتماد ہے۔ Communications اچھی طرح extract ہوتی ہیں مگر ان میں معلوم خلا موجود ہیں، جبکہ proposals، staff working documents اور case law structural units کھو سکتی ہیں یا کوئی text units پیدا نہیں کر سکتیں۔ یہ پروجیکٹ خاص طور پر ان محققین کے لیے مفید ہے جو EU قانون سازی کے متنی مواد کے structured، auditable corpora بناتے ہیں۔