À propos du projet
Ce dépôt est un jeu de données de vocabulaire anglais avec correspondance chinois-anglais, couvrant différents niveaux de difficulté : collège, lycée, CET-4, CET-6, examen d'entrée en master, TOEFL et SAT, soit environ 54 356 entrées. Les données sont fournies dans quatre formats : txt, json, jsonl et tsv. Le contenu s'étend progressivement des entrées et définitions de base aux expressions, à la phonétique, aux exemples de phrases, aux synonymes, aux mots de même racine et aux informations issues d'épreuves réelles.
- txt : contient uniquement les entrées et les définitions, adapté à une consultation rapide ou à des applications simples.
- json : contient les entrées, la nature grammaticale et les définitions, ainsi que les expressions courantes et leur traduction en chinois.
- jsonl : stocké ligne par ligne, réparti en trois niveaux de détail : simple (entrée, explication, expressions), sentence (ajout de la phonétique et d'exemples de phrases) et full (structure complète, incluant synonymes et quasi-synonymes, mots de même racine, épreuves réelles, etc.).
- tsv : correspond au jsonl, en dépliant les structures imbriquées dans un format séparé par des tabulations, ce qui facilite l'utilisation avec des outils de tableur ou des scripts de traitement de données.
Le dépôt propose également deux listes de vocabulaire, en ordre normal et en ordre aléatoire, accompagnées d'une description des formats et d'un script permettant de générer des fichiers TSV à partir des JSONL. Ce projet est issu de kajweb/dict, simplifié pour former la version actuelle, et a donné naissance à des outils d'apprentissage tels que Word Wind et Canshi. Il convient à la préparation de données pour des applications de mémorisation de vocabulaire, le développement d'outils d'apprentissage des langues ou le traitement automatique du langage naturel.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.