Sobre o projeto

O BanglaNLP Hub é um catálogo mantido pela comunidade de recursos de processamento de linguagem natural (PLN) para a língua bengali (bengalês), servindo como um diretório centralizado para pesquisadores e profissionais que trabalham com o idioma bengali. O projeto agrega artigos, conjuntos de dados, modelos, ferramentas e benchmarks em 13 tarefas de PLN, atualmente contendo 712 artigos, 63 conjuntos de dados, 20 modelos e 9 ferramentas. O site é construído como um site estático usando Astro e TypeScript, sem framework no lado do cliente — apenas pequenas ilhas de JavaScript vanilla para pesquisa no catálogo, alternância de tema, navegação móvel, abas de tarefas, ordenação de tabelas e cópia de BibTeX. Todo o conteúdo é renderizado a partir de arquivos YAML no diretório /data, sem nada codificado nas páginas. Uma característica definidora do projeto é sua política estrita de honestidade de dados. O catálogo impõe várias regras: nenhum valor inventado (pontuações, contagens de citações e entradas BibTeX nunca são sintetizados), leaderboards permanecem vazios até serem verificados com citações adequadas, todos os links publicados são verificados diariamente, e as entradas são verificadas manualmente contra fontes autoritativas como ACL Anthology, arXiv e OpenAlex. O projeto tem um histórico de remoção de entradas fabricadas herdadas de um protótipo de design original, incluindo um modelo que não existia, um duplicado sob um título inventado e um artigo sem publicação. O catálogo suporta filtros compartilháveis via parâmetros de URL. Conjuntos de dados podem ser filtrados por consulta, tarefa, licença e ano; artigos podem ser filtrados por consulta, tarefa, veículo de publicação e ano. Os filtros de licença agrupam o texto de licença do catálogo em categorias (aberta, não comercial, pesquisa, outros), mas não verificam nem certificam a licença de um conjunto de dados. A categoria aberta corresponde apenas a MIT, Apache 2.0, CC0, ODC-BY, CC BY 4.0 e CC BY-SA 4.0. O projeto inclui um sistema de validação usando esquemas Zod que verifica campos ausentes ou malformados, URLs inválidas, datas de verificação desatualizadas, IDs ou links duplicados e leaderboards que referenciam conjuntos de dados ou artigos desconhecidos. Essa validação é executada na integração contínua (CI) em cada pull request e impede a implantação se falhar. Contribuições são bem-vindas por dois caminhos: abrir uma issue "Enviar um recurso" com um link (a maneira mais rápida de entrar), ou abrir um PR diretamente editando arquivos YAML. O projeto credita todos os contribuidores em CONTRIBUTORS.md. As áreas que precisam de ajuda incluem revisar atribuições de tarefas de artigos (a maioria dos artigos foi importada em massa com atribuições de tarefas por heurística de títulos), preencher leaderboards vazios (9 dos 11 benchmarks vêm vazios), adicionar entradas BibTeX ausentes, verificar tamanhos de conjuntos de dados e adicionar novos recursos. O projeto também inclui um diretório de referência de design contendo os dados do protótipo do Claude Design, dos quais o YAML foi migrado, mantidos para proveniência, mas não usados no momento da construção. O código do site é licenciado sob MIT, enquanto as entradas do catálogo vinculam a recursos de terceiros que possuem suas próprias licenças.