このプロジェクトについて
大规模中文自然语言处理语料库プロジェクト(nlp_chinese_corpus)は、中文自然言語処理分野の発展に高品質なコーパスを提供することを目的としています。このプロジェクトには、数百万から数千万規模の構造化された中国語データセットが複数含まれており、大規模モデルの事前学習、単語ベクトル学習、テキスト分類、質問応答システム、機械翻訳などのタスクに広く利用できます。
主なデータセットは以下の通りです。
1. ウィキペディア(wiki2019zh):構造の整った中国語の項目を100万件含み、id、url、title、textの各フィールドを提供します。汎用の中国語事前学習コーパスや知識ベースの質問応答構築に適しています。
2. ニュースコーパス(news2016zh):250万件のニュースを含み、6万3000のメディアソースを網羅しています。タイトル、キーワード、説明、本文、公開時刻を備え、ニュース分類、タイトル・キーワード生成に適しています。
3. 百科事典型QA(baike2018qa):事前にフィルタリングされた高品質な質問と回答を150万件含み、約500のトピックに分類されています。教師あり学習、文の類似度計算、質問応答システムの構築に適しています。
4. コミュニティQA(webtext2019zh):高品質な質問応答を410万件含み、いいね数(最低3件)でフィルタリングされており、2万8000のトピックをカバーしています。超大規模NLPモデルの学習、トピック予測、cQAシステムに適しています。
5. 中英翻訳コーパス(translation2019zh):中英のパラレルコーパスを520万ペア含み、機械翻訳システムの学習や、中国語コーパス単独の抽出に利用できます。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.