منصوبے کے بارے میں

NVIDIA NeMo Speech ایک اوپن سورس فریم ورک ہے جو محققین اور PyTorch ڈویلپرز کے لیے ہے جو تقریری ماڈلز پر کام کرتے ہیں۔ اس کے README کے مطابق، یہ خودکار تقریر کی شناخت (ASR)، متن سے تقریر (TTS) اور تقریری LLMs کو نشانہ بناتا ہے، اور اس کا مقصد صارفین کو موجودہ کوڈ اور پہلے سے تربیت یافتہ چیک پوائنٹس کو دوبارہ استعمال کرکے نئے ماڈلز بنانے، تخصیص کرنے اور تعینات کرنے میں مدد کرنا ہے۔ دائرہ کار اور پوزیشننگ - ریپوزٹری بیان کرتی ہے کہ اس نے آڈیو، تقریر اور ملٹی موڈل LLMs پر توجہ مرکوز کرنے کے لیے تبدیلی کی ہے؛ اضافی موڈیلٹیز کو شامل کرنے والی آخری پری اسپلٹ NeMo ریلیز v2.7.3 ہے۔ - موجودہ لائن NeMo Speech 3.0 ہے، جو v3.0.0 ریلیز کے طور پر شائع ہوئی ہے اور NGC کنٹینر میں بھیجی گئی ہے۔ - ماڈل چیک پوائنٹس اور ڈیمو ایک HuggingFace مجموعہ میں جمع کیے گئے ہیں جس کا حوالہ README میں دیا گیا ہے۔ دستاویزات اور ریلیزز - ڈویلپر دستاویزات تازہ ترین ریلیز (3.0.0) اور نائٹلی مین برانچ کے لیے میزبانی کی جاتی ہیں۔ - README میں تاریخ شدہ اپ ڈیٹس درج ہیں جو ماڈل ریلیزز کی وضاحت کرتی ہیں جیسے کثیر لسانی TTS چیک پوائنٹس، اسٹریمنگ ASR ماڈلز، متحد آف لائن/اسٹریمنگ ASR، اور یورپی زبانوں کے لیے تقریر کی شناخت/ترجمہ ماڈلز۔ یہ ریلیز نوٹ ہیں؛ یہاں کوئی آزاد بینچ مارک تصدیق فراہم نہیں کی گئی ہے۔ تقاضے - Python 3.12 یا اس سے اوپر، PyTorch 2.7 یا اس سے اوپر (CPU یا CUDA)، اور تربیت کے لیے CUDA کے ساتھ NVIDIA GPU (انفرنس کے لیے تجویز کردہ)۔ - پروجیکٹ کہتا ہے کہ یہ موجودہ Python/PyTorch/CUDA اسٹیک کے اوپر انسٹال ہوتا ہے بغیر اسے تبدیل کیے؛ uv.lock اور سرکاری کنٹینر میں پن کیے گئے ورژن (Python 3.13، PyTorch 2.11 بمعہ CUDA 12.9 یا PyTorch 2.12 بمعہ CUDA 13.2) کو سخت تقاضوں کے بجائے فعال طور پر آزمائے گئے مجموعے کے طور پر بیان کیا گیا ہے۔ - ایک نوٹ خبردار کرتا ہے کہ چونکہ PyTorch 2.6 سے torch.load ڈیفالٹ طور پر weights_only=True استعمال کرتا ہے، اور کچھ چیک پوائنٹس کو TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1 کی ضرورت ہو سکتی ہے، جو صرف قابل اعتماد فائلوں کے ساتھ استعمال کی جانی چاہیے کیونکہ ناقابل اعتماد فائلیں لوڈ کرنے سے صوابدیدی کوڈ پر عمل درآمد کا خطرہ ہو سکتا ہے۔ انسٹالیشن کے اختیارات - تجویز کردہ: uv کے ساتھ سورس سے انسٹال کریں، تمام اور cu13 (یا cu12) جیسے ایکسٹرا کو ہم آہنگ کریں، جو .venv میں آزمائے گئے اسٹیک کو دوبارہ تیار کرتا ہے؛ اختیاری گروپ ٹیسٹ یا دستاویزات شامل کرتے ہیں۔ - Docker: پہلے سے تیار NGC کنٹینر کھینچیں یا فراہم کردہ Dockerfile سے تعمیر کریں، H100+ یا A100 کے لیے GPU_TARGET اختیارات کے ساتھ۔ - pip فال بیک: پہلے PyTorch انسٹال کریں، پھر asr اور tts ایکسٹرا کے ساتھ nemo-toolkit؛ README نوٹ کرتا ہے کہ uv sync --locked کو اپنے اسٹیک کے لیے استعمال نہیں کیا جانا چاہیے کیونکہ یہ لاک فائل لاگو کرتا ہے اور موجودہ Python/PyTorch/CUDA کو تبدیل کرتا ہے۔ - اختیاری تیز رفتار بیک اینڈز (Transformer Engine، FlashAttention، Mamba، grouped-GEMM/MoE، DeepEP) کو مرتب شدہ ایکسٹرا سے سورس سے تعمیر شدہ کرنل کے طور پر بیان کیا گیا ہے، جس میں Automodel بیک اینڈ مرتب شدہ انحصار کے بغیر چل سکتا ہے۔ لائسنسنگ اور شراکت - Apache License 2.0 کے تحت لائسنس یافتہ۔ - کمیونٹی کی شراکت کا CONTRIBUTING.md عمل کے ذریعے خیر مقدم کیا جاتا ہے۔ یہ جائزہ صرف وہی ظاہر کرتا ہے جو ریپوزٹری README بیان کرتا ہے؛ یہ ریلیز نوٹس میں کیے گئے درستگی، کارکردگی یا درجہ بندی کے دعووں کی تصدیق نہیں کرتا۔