这个项目能做什么
BanglaNLP Hub 是一个社区维护的孟加拉语(孟加拉语)自然语言处理资源目录,为研究孟加拉语的研究人员和从业者提供集中式目录。该项目聚合了13项NLP任务的论文、数据集、模型、工具和基准,目前包含712篇论文、63个数据集、20个模型和9个工具。
该网站使用Astro和TypeScript构建为静态站点,无客户端框架——仅使用小型原生JavaScript片段实现目录搜索、主题切换、移动导航、任务标签、表格排序和BibTeX复制。所有内容均从/data目录下的YAML文件渲染,页面中无硬编码内容。
该项目的一个显著特点是其严格的数据真实性政策。目录强制执行多项规则:不虚构值(分数、引用次数和BibTeX条目从不合成),排行榜在获得适当引用来源前保持为空,所有发布链接每晚验证,条目通过人工对照权威来源(如ACL Anthology、arXiv和OpenAlex)进行核实。项目曾移除从原始设计原型继承的虚构条目,包括一个不存在的模型、一个以虚构标题重复的条目,以及一篇无出版记录的论文。
目录支持通过URL参数进行可分享过滤。数据集可按查询、任务、许可证和年份过滤;论文可按查询、任务、会议和年份过滤。许可证过滤器将目录中的许可证文本分组为类别(开放、非商业、研究、其他),但不验证或认证数据集的许可证。开放类别仅匹配MIT、Apache 2.0、CC0、ODC-BY、CC BY 4.0和CC BY-SA 4.0。
项目包含使用Zod模式验证系统,检查缺失或格式错误的字段、无效URL、过期的验证日期、重复ID或链接,以及引用未知数据集或论文的排行榜。此验证在每个拉取请求的CI中运行,并控制部署。
贡献可通过两种方式:打开“提交资源”问题并附链接(最快方式),或直接编辑YAML文件打开PR。项目在CONTRIBUTORS.md中致谢所有贡献者。需要帮助的关键领域包括审查论文任务分配(大多数论文通过标题启发式批量导入任务分配)、填充空排行榜(11个基准中有9个为空)、添加缺失的BibTeX条目、验证数据集大小,以及添加新资源。
项目还包含一个设计参考目录,其中包含原始Claude设计原型数据(YAML从中迁移),用于溯源但不在构建时使用。站点代码采用MIT许可证,而目录条目链接到第三方资源,这些资源自带许可证。
评论
0 评分人数达到10人后显示
登录后参与讨论。