这个项目能做什么

大规模中文自然语言处理语料库项目(nlp_chinese_corpus)旨在为中文自然语言处理领域的发展贡献高质量语料。项目包含了多个百万级至千万级的结构化中文数据集,可广泛用于大模型预训练、词向量训练、文本分类、问答系统以及机器翻译等任务。 主要包含以下数据集: 1. 维基百科 (wiki2019zh):包含100万个结构良好的中文词条,提供id、url、title和text字段,适合作为通用中文预训练语料或构建知识问答。 2. 新闻语料 (news2016zh):包含250万篇新闻,涵盖6.3万个媒体源,含有标题、关键词、描述、正文及发布时间,适用于新闻分类、标题与关键词生成。 3. 百科类问答 (baike2018qa):包含150万个预过滤的高质量问题和答案,归类于近500个主题,适合用于监督训练、句子相似度计算及问答系统构建。 4. 社区问答 (webtext2019zh):包含410万个高质量问答,经过点赞数筛选(至少3个点赞),涵盖2.8万个话题,适合训练超大规模NLP模型、话题预测及cQA系统。 5. 中英文翻译语料 (translation2019zh):包含520万对中英文平行语料,可用于机器翻译系统训练或单独提取中文语料库。