इस प्रोजेक्ट के बारे में

यह भंडार एक अंग्रेजी-चीनी शब्दावली डेटासेट है, जो मध्य विद्यालय, उच्च विद्यालय, कॉलेज अंग्रेजी परीक्षा स्तर 4 (CET4), स्तर 6 (CET6), स्नातक प्रवेश परीक्षा, TOEFL और SAT जैसे विभिन्न कठिनाई स्तरों को कवर करता है, जिसमें कुल लगभग 54,356 शब्द हैं। डेटा चार प्रारूपों में उपलब्ध है: txt, json, jsonl और tsv। सामग्री बुनियादी शब्दों और अर्थों से शुरू होकर धीरे-धीरे वाक्यांशों, ध्वन्यात्मक प्रतीकों, उदाहरण वाक्यों, समानार्थी शब्दों, सजातीय शब्दों और परीक्षा-संबंधी जानकारी तक विस्तारित होती है। - txt: केवल शब्द और अर्थ शामिल हैं, त्वरित खोज या सरल अनुप्रयोगों के लिए उपयुक्त। - json: शब्द, शब्दभेद और अर्थ, साथ ही सामान्य वाक्यांश और उनके चीनी अनुवाद शामिल हैं। - jsonl: पंक्ति-दर-पंक्ति संग्रहीत, तीन विस्तार स्तरों में विभाजित: simple (शब्द, स्पष्टीकरण, वाक्यांश), sentence (ध्वन्यात्मक और उदाहरण वाक्य जोड़ता है) और full (पूर्ण संरचना, जिसमें समानार्थी, सजातीय, परीक्षा आदि शामिल हैं)। - tsv: jsonl के अनुरूप, नेस्टेड संरचना को टैब-पृथक प्रारूप में विस्तारित करता है, जो स्प्रेडशीट टूल या डेटा प्रोसेसिंग स्क्रिप्ट के लिए सुविधाजनक है। भंडार क्रमबद्ध और यादृच्छिक दोनों शब्द सूचियाँ प्रदान करता है, साथ ही प्रारूप विवरण और JSONL से TSV उत्पन्न करने के लिए एक स्क्रिप्ट भी शामिल है। यह परियोजना kajweb/dict से उत्पन्न हुई है, सरलीकरण के बाद वर्तमान संस्करण बनाती है, और Word Wind और蚕食 जैसे शिक्षण उपकरणों को जन्म दिया है। यह शब्द-सीखने वाले ऐप्स, भाषा सीखने के उपकरण विकास, या प्राकृतिक भाषा प्रसंस्करण से संबंधित डेटा तैयार करने के लिए उपयुक्त है।