عن المشروع

ستanza هي مكتبة معالجة اللغة الطبيعية الرسمية بلغة بايثون التابعة لمجموعة ستانفورد NLP. توفر دعمًا لتشغيل أدوات معالجة اللغة الطبيعية الدقيقة عبر أكثر من 60 لغة بشرية، وتتضمن غلاف بايثون رسميًا للوصول إلى برنامج Java Stanford CoreNLP. الميزات الرئيسية - خط أنابيب عصبي مع نماذج مدربة مسبقًا للترميز، وتوسيع الرموز متعددة الكلمات، ووسم أجزاء الكلام/الصرف، والتجذيع، وتحليل التبعية، والتعرف على الكيانات المسماة (NER) - دعم جميع بنوك الأشجار Universal Dependencies الإصدار 2.8، إلى جانب نماذج NER للغات واسعة الانتشار - حزم نماذج إنجليزية طبية حيوية وسريرية للتحليل النحوي والتعرف على الكيانات المسماة من الأدبيات الطبية الحيوية والملاحظات السريرية - وصول كامل إلى وظائف Java Stanford CoreNLP عبر عميل بايثون - تدريب النماذج من بيانات مخصصة بتنسيق CoNULL-U أو BIOES - دفاتر تجريبية تفاعلية متاحة على Google Colab التثبيت يتطلب ستanza بايثون 3.6 أو أحدث ويمكن تثبيته عبر pip أو Anaconda: ``` pip install stanza conda install -c stanfordnlp stanza ``` الاستخدام الأساسي ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` تشمل نصائح الأداء تجميع المستندات معًا (مفصولة بأسطر فارغة) لتعظيم سرعة خط الأنابيب بدلاً من معالجة جملة واحدة في كل مرة. لتدريب النماذج المخصصة، يجب على المستخدمين استنساخ المستودع وتشغيل التدريب من المصدر. يتطلب المُرمِّز، وموسّع MWT، ووسم أجزاء الكلام، والمُجذِّع، ومحلل التبعية بيانات بتنسيق CoNLL-U؛ بينما تتطلب نماذج NER تنسيق BIOES. الترخيص: رخصة أباتشي، الإصدار 2.0