Об этом проекте
BanglaNLP Hub — это поддерживаемый сообществом каталог ресурсов по обработке естественного языка для бенгальского языка (бангла), служащий централизованным справочником для исследователей и практиков, работающих с бенгальским языком. Проект объединяет статьи, наборы данных, модели, инструменты и бенчмарки по 13 задачам NLP; в настоящее время содержит 712 статей, 63 набора данных, 20 моделей и 9 инструментов.
Сайт построен как статический сайт на Astro и TypeScript, без клиентского фреймворка — только небольшие островки на чистом JavaScript для поиска по каталогу, переключения темы, мобильной навигации, вкладок задач, сортировки таблиц и копирования BibTeX. Весь контент рендерится из YAML-файлов в каталоге /data, на страницах ничего не захардкожено.
Определяющая характеристика проекта — строгая политика честности данных. Каталог соблюдает несколько правил: никаких выдуманных значений (показатели, количество цитирований и записи BibTeX никогда не синтезируются), таблицы лидеров остаются пустыми, пока не будут подкреплены надлежащими ссылками, все опубликованные ссылки проверяются каждую ночь, а записи вручную сверяются с авторитетными источниками, такими как ACL Anthology, arXiv и OpenAlex. Проект имеет историю удаления выдуманных записей, унаследованных от исходного прототипа дизайна, включая несуществующую модель, дубликат под вымышленным названием и статью без публикации.
Каталог поддерживает общие фильтры через параметры URL. Наборы данных можно фильтровать по запросу, задаче, лицензии и году; статьи — по запросу, задаче, месту публикации и году. Фильтры лицензий группируют текст лицензий каталога по категориям (open, nc, research, other), но не проверяют и не подтверждают лицензию набора данных. Категория open соответствует только MIT, Apache 2.0, CC0, ODC-BY, CC BY 4.0 и CC BY-SA 4.0.
Проект включает систему валидации на основе схем Zod, которая проверяет отсутствующие или некорректные поля, неработающие URL, устаревшие даты проверки, дублирующиеся идентификаторы или ссылки, а также таблицы лидеров, ссылающиеся на неизвестные наборы данных или статьи. Эта валидация запускается в CI при каждом pull request и является обязательным условием для развертывания.
Вклад приветствуется двумя способами: открыть issue «Submit a resource» со ссылкой (самый быстрый способ) или открыть PR напрямую, отредактировав YAML-файлы. Проект указывает всех участников в CONTRIBUTORS.md. Ключевые области, требующие помощи, включают проверку назначения задач статьям (большинство статей были импортированы массово с назначением задач по эвристике на основе заголовков), заполнение пустых таблиц лидеров (9 из 11 бенчмарков поставляются пустыми), добавление недостающих записей BibTeX, проверку размеров наборов данных и добавление новых ресурсов.
Проект также включает справочный каталог дизайна, содержащий исходные данные прототипа Claude Design, из которых был мигрирован YAML; он хранится для отслеживания происхождения, но не используется при сборке. Код сайта лицензирован под MIT, а записи каталога ссылаются на сторонние ресурсы, у которых есть собственные лицензии.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.