Об этом проекте
Проект крупномасштабного корпуса китайского языка для обработки естественного языка (nlp_chinese_corpus) нацелен на создание высококачественных данных для развития китайского NLP. Он включает несколько структурированных наборов данных от миллионов до десятков миллионов записей, которые могут использоваться для предобучения больших моделей, обучения векторных представлений слов, классификации текстов, систем вопросов-ответов и машинного перевода.
Основные наборы данных:
1. Википедия (wiki2019zh): 1 миллион хорошо структурированных китайских статей с полями id, url, title и text, подходит для общего предобучения или создания вопросно-ответных систем на основе знаний.
2. Новости (news2016zh): 2,5 миллиона новостных статей из 63 000 источников, включая заголовки, ключевые слова, описания, основной текст и время публикации, подходит для классификации новостей, генерации заголовков и ключевых слов.
3. Энциклопедические вопросы-ответы (baike2018qa): 1,5 миллиона предварительно отфильтрованных высококачественных вопросов и ответов, охватывающих около 500 тем, подходит для обучения с учителем, вычисления сходства предложений и построения систем вопросов-ответов.
4. Общественные вопросы-ответы (webtext2019zh): 4,1 миллиона высококачественных вопросов и ответов, отобранных по количеству лайков (не менее 3), охватывающих 28 000 тем, подходит для обучения сверхбольших NLP-моделей, прогнозирования тем и систем cQA.
5. Китайско-английский перевод (translation2019zh): 5,2 миллиона параллельных пар китайский-английский, может использоваться для обучения систем машинного перевода или извлечения китайского корпуса.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.