À propos du projet
BanglaNLP Hub est un catalogue maintenu par la communauté de ressources en traitement automatique du langage naturel (TAL) pour le bengali (bangla), servant de répertoire centralisé pour les chercheurs et praticiens travaillant avec la langue bengalie. Le projet agrège des articles, des jeux de données, des modèles, des outils et des référentiels (benchmarks) à travers 13 tâches de TAL, contenant actuellement 712 articles, 63 jeux de données, 20 modèles et 9 outils. Le site est construit comme un site statique utilisant Astro et TypeScript, sans framework côté client — seulement de petites îles JavaScript vanilla pour la recherche dans le catalogue, le changement de thème, la navigation mobile, les onglets de tâches, le tri des tableaux et la copie BibTeX. Tout le contenu est rendu à partir de fichiers YAML dans le répertoire /data, sans rien en dur dans les pages. Une caractéristique déterminante du projet est sa politique stricte d'honnêteté des données. Le catalogue impose plusieurs règles : aucune valeur inventée (les scores, les comptes de citations et les entrées BibTeX ne sont jamais synthétisés), les classements (leaderboards) restent vides jusqu'à ce qu'ils soient sourcés avec des citations appropriées, tous les liens publiés sont vérifiés chaque nuit, et les entrées sont vérifiées à la main contre des sources faisant autorité comme l'ACL Anthology, arXiv et OpenAlex. Le projet a un historique de suppression d'entrées fabriquées héritées d'un prototype de conception original, notamment un modèle qui n'existait pas, un doublon sous un titre inventé, et un article sans publication. Le catalogue prend en charge des filtres partageables via des paramètres d'URL. Les jeux de données peuvent être filtrés par requête, tâche, licence et année ; les articles par requête, tâche, lieu de publication et année. Les filtres de licence regroupent le texte de licence du catalogue en catégories (ouverte, NC, recherche, autre) mais ne vérifient ni ne certifient la licence d'un jeu de données. La catégorie ouverte ne correspond qu'à MIT, Apache 2.0, CC0, ODC-BY, CC BY 4.0 et CC BY-SA 4.0. Le projet comprend un système de validation utilisant des schémas Zod qui vérifie les champs manquants ou malformés, les URL invalides, les dates de vérification périmées, les identifiants ou liens en double, et les classements référençant des jeux de données ou des articles inconnus. Cette validation s'exécute dans l'intégration continue (CI) à chaque demande de tirage (pull request) et conditionne le déploiement. Les contributions sont les bienvenues par deux voies : ouvrir un ticket "Soumettre une ressource" avec un lien (le moyen le plus rapide), ou ouvrir une PR directement en modifiant les fichiers YAML. Le projet crédite tous les contributeurs dans CONTRIBUTORS.md. Les principaux domaines nécessitant de l'aide comprennent la révision des attributions de tâches des articles (la plupart des articles ont été importés en masse avec des attributions de tâches basées sur une heuristique de titre), le remplissage des classements vides (9 des 11 benchmarks sont livrés vides), l'ajout des entrées BibTeX manquantes, la vérification des tailles des jeux de données et l'ajout de nouvelles ressources. Le projet comprend également un répertoire de référence de conception contenant les données originales du prototype Claude Design à partir desquelles le YAML a été migré, conservé pour la provenance mais non utilisé au moment de la construction. Le code du site est sous licence MIT, tandis que les entrées du catalogue renvoient à des ressources tierces qui portent leurs propres licences.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.