Sobre el proyecto
BanglaNLP Hub es un catálogo mantenido por la comunidad de recursos de procesamiento de lenguaje natural (PLN) en bengalí (bangla), que sirve como directorio centralizado para investigadores y profesionales que trabajan con el idioma bengalí. El proyecto agrega artículos, conjuntos de datos, modelos, herramientas y puntos de referencia en 13 tareas de PLN, y actualmente contiene 712 artículos, 63 conjuntos de datos, 20 modelos y 9 herramientas.
El sitio está construido como un sitio estático con Astro y TypeScript, sin framework en el lado del cliente; solo pequeñas islas de JavaScript vainilla para la búsqueda en el catálogo, el cambio de tema, la navegación móvil, las pestañas de tareas, la ordenación de tablas y la copia de BibTeX. Todo el contenido se renderiza a partir de archivos YAML en el directorio /data, sin nada codificado de forma fija en las páginas.
Una característica definitoria del proyecto es su estricta política de honestidad de datos. El catálogo aplica varias reglas: no se inventan valores (las puntuaciones, los recuentos de citas y las entradas BibTeX nunca se sintetizan), las tablas de clasificación permanecen vacías hasta que se citan con referencias adecuadas, todos los enlaces publicados se verifican cada noche, y las entradas se verifican a mano contra fuentes autorizadas como ACL Anthology, arXiv y OpenAlex. El proyecto tiene un historial de eliminación de entradas fabricadas heredadas de un prototipo de diseño original, incluido un modelo que no existía, un duplicado con un título inventado y un artículo sin publicación.
El catálogo admite filtros compartibles mediante parámetros de URL. Los conjuntos de datos se pueden filtrar por consulta, tarea, licencia y año; los artículos se pueden filtrar por consulta, tarea, sede y año. Los filtros de licencia agrupan el texto de licencia del catálogo en categorías (abierta, nc, investigación, otras), pero no verifican ni certifican la licencia de un conjunto de datos. La categoría abierta solo coincide con MIT, Apache 2.0, CC0, ODC-BY, CC BY 4.0 y CC BY-SA 4.0.
El proyecto incluye un sistema de validación con esquemas Zod que comprueba campos faltantes o malformados, URL incorrectas, fechas de verificación obsoletas, identificadores o enlaces duplicados, y clasificaciones que referencian conjuntos de datos o artículos desconocidos. Esta validación se ejecuta en CI en cada solicitud de extracción y controla el despliegue.
Las contribuciones son bienvenidas por dos vías: abrir un issue «Submit a resource» con un enlace (la forma más rápida de participar) o abrir un PR directamente editando archivos YAML. El proyecto acredita a todos los contribuyentes en CONTRIBUTORS.md. Las áreas clave que necesitan ayuda incluyen revisar la asignación de tareas de los artículos (la mayoría se importaron en bloque con asignaciones basadas en heurísticas de títulos), completar las clasificaciones vacías (9 de 11 puntos de referencia se publican vacíos), añadir entradas BibTeX faltantes, verificar tamaños de conjuntos de datos y añadir nuevos recursos.
El proyecto también incluye un directorio de referencia de diseño con los datos originales del prototipo Claude Design del que se migró el YAML, conservados por procedencia pero no utilizados en el momento de la compilación. El código del sitio tiene licencia MIT, mientras que las entradas del catálogo enlazan a recursos de terceros que tienen sus propias licencias.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.