इस प्रोजेक्ट के बारे में
Spark NLP Apache Spark के ऊपर निर्मित एक प्राकृतिक भाषा प्रसंस्करण लाइब्रेरी है, जिसे वितरित वातावरण में स्केल करने वाली मशीन लर्निंग पाइपलाइनों के लिए NLP एनोटेशन प्रदान करने के लिए डिज़ाइन किया गया है। इसे John Snow Labs द्वारा विकसित किया गया है और Apache 2.0 के तहत जारी किया गया है।
मुख्य क्षमताएँ
लाइब्रेरी NLP कार्यों की एक विस्तृत श्रृंखला को कवर करती है, जिसमें टोकनाइज़ेशन, शब्द विभाजन, भाषण के भाग टैगिंग, शब्द और वाक्य एम्बेडिंग, नामित इकाई पहचान, निर्भरता पार्सिंग, वर्तनी जाँच, पाठ वर्गीकरण, भावना विश्लेषण, टोकन वर्गीकरण, मशीन अनुवाद (180+ भाषाएँ), सारांशीकरण, प्रश्न उत्तर, तालिका प्रश्न उत्तर, पाठ निर्माण, छवि वर्गीकरण, छवि-से-पाठ कैप्शनिंग, स्वचालित भाषण पहचान, और शून्य-शॉट लर्निंग शामिल हैं।
यह BERT, CamemBERT, ALBERT, ELECTRA, XLNet, DistilBERT, RoBERTa, DeBERTa, XLM-RoBERTa, Longformer, ELMo, Universal Sentence Encoder, Llama-2, M2M100, BART, Instructor, E5, Google T5, MarianMT, OpenAI GPT2, Vision Transformers, OpenAI Whisper, Llama, Mistral, Phi, और Qwen2 जैसे ट्रांसफॉर्मर आर्किटेक्चर का समर्थन करता है। ये न केवल Python और R के लिए बल्कि Apache Spark को मूल रूप से विस्तारित करके JVM पारिस्थितिकी तंत्र (Java, Scala, Kotlin) के लिए भी उजागर किए गए हैं।
मॉडल और पाइपलाइन
परियोजना बताती है कि यह 200 से अधिक भाषाओं में 100,000+ प्रीट्रेन्ड पाइपलाइन और मॉडल भेजता है, जिन्हें ब्राउज़ करने के लिए एक Models Hub है। मॉडल आयात समर्थन में TensorFlow, ONNX, OpenVINO, और Llama.cpp (GGUF) शामिल हैं, जो अन्य फ्रेमवर्क से मॉडल के एकीकरण की अनुमति देते हैं।
प्लेटफ़ॉर्म समर्थन
Spark NLP 7.0.0 Apache Spark 3.x (Scala 2.12) और मान्य Apache Spark 4 संस्करणों (Scala 2.13) का समर्थन करता है। चूंकि Apache Spark 4.0.0 ने एक बाइनरी-असंगत Param परिवर्तन पेश किया, इसलिए अलग-अलग आर्टिफैक्ट हैं: Spark 3.0.x-3.5.x के लिए spark-nlp_2.12, Spark 4.0.0 के लिए spark-nlp-spark400_2.13, और Spark 4.0.1 और बाद के मान्य Spark 4 संस्करणों के लिए spark-nlp_2.13। CPU, GPU, AArch64 (Linux), और Apple Silicon वेरिएंट मौजूद हैं, जिनमें M1/M2 और AArch64 प्रयोगात्मक के रूप में वर्णित हैं।
Python समर्थन Spark 3.x लेन पर 3.7 से 3.10 और Spark 4.x लेन पर 3.9 से 3.12 तक फैला हुआ है। README Databricks रनटाइम (14.x से 16.4, CPU और GPU), Amazon EMR 6.13 से 7.8, और emr-spark-8.0.0 पर Spark 4.0.2, Scala 2.13, और Java 17 के साथ एक EMR Serverless लेन के साथ संगतता भी सूचीबद्ध करता है।
स्थापना और उपयोग
स्थापना pip, conda, और Maven Central के माध्यम से उपलब्ध है, जिसमें sparknlp.start(), explain_document_dl जैसे PretrainedPipeline को लोड करना, और संस्थाओं, लेम्मा, POS टैग, टोकन और अन्य एनोटेशन प्राप्त करने के लिए पाठ को एनोटेट करना दिखाने वाला एक त्वरित-प्रारंभ उदाहरण है। लाइब्रेरी पूरी तरह से ऑफ़लाइन चल सकती है, और कॉन्फ़िगरेशन Spark गुणों के माध्यम से समायोज्य है। NerDLApproach द्वारा उपयोग किए जाने वाले प्रशिक्षण लॉग निर्यात करने और TensorFlow ग्राफ़ संग्रहीत करने के लिए S3 एकीकरण उपलब्ध है।
दस्तावेज़ीकरण और समुदाय
आधिकारिक दस्तावेज़ीकरण, उदाहरण, डेमो और एक मॉडल हब sparknlp.org पर होस्ट किए गए हैं। सामुदायिक चैनलों में Slack, GitHub मुद्दे और चर्चाएँ, Medium, और YouTube शामिल हैं। परियोजना का Software Impacts में एक प्रकाशित पेपर है और विचारों, प्रतिक्रिया, दस्तावेज़ीकरण, बग रिपोर्ट, कॉर्पोरा और परीक्षण जैसे योगदानों का स्वागत करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.