Sobre el proyecto
El proyecto de corpus chino a gran escala para PNL (nlp_chinese_corpus) tiene como objetivo contribuir con datos lingüísticos de alta calidad al desarrollo del campo del procesamiento del lenguaje natural en chino. El proyecto incluye múltiples conjuntos de datos chinos estructurados que van desde millones hasta decenas de millones de muestras, y se pueden utilizar ampliamente en tareas como preentrenamiento de grandes modelos, entrenamiento de vectores de palabras, clasificación de texto, sistemas de preguntas y respuestas, y traducción automática.
Los conjuntos de datos principales incluyen:
1. Wikipedia (wiki2019zh): contiene 1 millón de entradas chinas bien estructuradas, con campos de id, url, título y texto, adecuado como corpus general de preentrenamiento en chino o para construir preguntas y respuestas basadas en conocimiento.
2. Corpus de noticias (news2016zh): contiene 2.5 millones de noticias de 63,000 fuentes de medios, con título, palabras clave, descripción, cuerpo y hora de publicación, útil para clasificación de noticias, generación de títulos y palabras clave.
3. Preguntas y respuestas de enciclopedia (baike2018qa): contiene 1.5 millones de preguntas y respuestas de alta calidad previamente filtradas, clasificadas en casi 500 temas, adecuado para entrenamiento supervisado, cálculo de similitud de oraciones y construcción de sistemas de preguntas y respuestas.
4. Preguntas y respuestas de comunidad (webtext2019zh): contiene 4.1 millones de preguntas y respuestas de alta calidad, filtradas por número de votos positivos (al menos 3), que abarcan 28,000 temas, adecuado para entrenar modelos de PNL a gran escala, predicción de temas y sistemas de preguntas y respuestas de comunidad (cQA).
5. Corpus de traducción chino-inglés (translation2019zh): contiene 5.2 millones de pares de corpus paralelos chino-inglés, que se pueden utilizar para entrenar sistemas de traducción automática o extraer corpus chino por separado.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.