Sobre el proyecto

eurlex-builder es un pipeline configurable de línea de comandos en Python para construir conjuntos de datos listos para investigación a partir de material legislativo de EUR-Lex / Cellar. Recupera directivas, reglamentos, decisiones, comunicaciones y otros actos de la UE, y luego extrae texto con granularidad seleccionable: artículos completos, párrafos numerados o puntos con letras. La herramienta está orientada a la investigación jurídica cuantitativa, el PLN, la clasificación y el análisis de redes de la legislación de la UE. El pipeline produce una base de datos de trabajo DuckDB más cuatro tablas Parquet: works, text_units, relations y eurovoc. Admite dos modos principales de consulta: el modo fijo, donde los usuarios proporcionan identificadores CELEX o números de procedimiento, y el modo descriptivo, donde los usuarios seleccionan tipos de documentos, rangos de fechas y filtros opcionales de palabras clave EuroVoc. Maneja múltiples estructuras HTML de EUR-Lex e incluye extracción de respaldo desde PDF para documentos antiguos o no legibles por máquina mediante Docling y pymupdf. Las capacidades clave incluyen la descomposición sub-articular, la eliminación de texto repetitivo, la extracción de considerandos/artículos/anexos, la captura de relaciones entre documentos como citas, modificaciones, bases jurídicas, derogaciones y consolidaciones, y la traducción opcional de contenido no inglés mediante revisiones Helsinki-NLP Opus-MT. La traducción está protegida con reintentos limitados por tokens y controles de calidad, y las salidas rechazadas permanecen en el idioma de origen en lugar de reemplazar el texto original. La herramienta enfatiza la reproducibilidad y la capacidad de reanudación. Un único archivo YAML define el conjunto de datos, mientras que DuckDB almacena puntos de control, manifiestos de ejecución, hashes de configuración validados, versiones de dependencias y estado de finalización. Los comandos de la CLI incluyen run, translate, enrich, status y validate. El enriquecimiento puede añadir metadatos a posteriori mediante SPARQL, incluidas fechas de entrada en vigor, ELI, instituciones autoras, materia, detalles del procedimiento, descriptores EuroVoc y relaciones de derogación. El comando validate realiza comprobaciones de integridad de solo lectura sin modificar la base de datos. El README señala que la recuperación de texto completo funciona de forma amplia, pero la extracción granular es más fiable para reglamentos, directivas y decisiones. Las comunicaciones se extraen bien, pero tienen lagunas conocidas, mientras que las propuestas, los documentos de trabajo del personal y la jurisprudencia pueden perder unidades estructurales o no producir unidades de texto. Esto hace que el proyecto sea especialmente útil para investigadores que construyen corpus estructurados y auditables de textos legislativos de la UE.