প্রকল্প সম্পর্কে

NVIDIA NeMo Speech হলো একটি ওপেন-সোর্স ফ্রেমওয়ার্ক যা গবেষক এবং PyTorch ডেভেলপারদের জন্য তৈরি যারা speech মডেল নিয়ে কাজ করেন। এর README অনুযায়ী, এটি Automatic Speech Recognition (ASR), Text-to-Speech (TTS) এবং Speech LLM-কে লক্ষ্য করে এবং ব্যবহারকারীদের বিদ্যমান কোড ও প্রি-ট্রেইন্ড checkpoint পুনঃব্যবহার করে নতুন মডেল তৈরি, কাস্টমাইজ ও ডিপ্লয় করতে সাহায্য করার উদ্দেশ্যে তৈরি। সুযোগ ও অবস্থান - রিপোজিটরি জানায় যে এটি অডিও, speech এবং multimodal LLM-তে ফোকাস করার জন্য পিভট করেছে; অতিরিক্ত modality কভার করা শেষ pre-split NeMo রিলিজ হলো v2.7.3। - বর্তমান লাইন হলো NeMo Speech 3.0, যা v3.0.0 রিলিজ হিসেবে প্রকাশিত এবং NGC কন্টেইনারে shipped। - মডেল checkpoint এবং ডেমো README-এ উল্লেখিত HuggingFace সংগ্রহে সংরক্ষিত। ডকুমেন্টেশন ও রিলিজ - ডেভেলপার ডকুমেন্টেশন সর্বশেষ রিলিজ (3.0.0) এবং nightly main branch-এর জন্য হোস্ট করা হয়েছে। - README-এ তারিখযুক্ত আপডেট তালিকাভুক্ত আছে যা মডেল রিলিজ বর্ণনা করে, যেমন multilingual TTS checkpoint, streaming ASR মডেল, unified offline/streaming ASR এবং ইউরোপীয় ভাষার জন্য speech recognition/translation মডেল। এগুলো রিলিজ নোট; এখানে কোনো স্বাধীন benchmark যাচাই দেওয়া হয়নি। প্রয়োজনীয়তা - Python 3.12 বা তার বেশি, PyTorch 2.7 বা তার বেশি (CPU বা CUDA), এবং প্রশিক্ষণের জন্য CUDA সহ একটি NVIDIA GPU (ইনফারেন্সের জন্য সুপারিশকৃত)। - প্রকল্পটি বলে যে এটি বিদ্যমান Python/PyTorch/CUDA স্ট্যাকের উপরে ইনস্টল হয়, প্রতিস্থাপন না করে; uv.lock এবং অফিসিয়াল কন্টেইনারে পিন করা সংস্করণ (Python 3.13, PyTorch 2.11 with CUDA 12.9 বা PyTorch 2.12 with CUDA 13.2) কঠোর প্রয়োজনীয়তার চেয়ে সক্রিয়ভাবে পরীক্ষিত কম্বিনেশন হিসেবে বর্ণনা করা হয়েছে। - একটি নোট সতর্ক করে যে PyTorch 2.6 থেকে torch.load ডিফল্টভাবে weights_only=True ব্যবহার করে, এবং কিছু checkpoint-এর জন্য TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1 প্রয়োজন হতে পারে, যা শুধুমাত্র বিশ্বস্ত ফাইলের সাথে ব্যবহার করা উচিত কারণ অবিশ্বস্ত ফাইল লোড করলে arbitrary code execution-এর ঝুঁকি থাকতে পারে। ইনস্টলেশন বিকল্প - প্রস্তাবিত: উৎস থেকে uv দিয়ে ইনস্টল করুন, all এবং cu13 (বা cu12) এর মতো extras sync করে, যা .venv-এ পরীক্ষিত স্ট্যাক পুনরুৎপাদন করে; ঐচ্ছিক গ্রুপ টেস্ট বা ডক্স যোগ করে। - Docker: পূর্বনির্মিত NGC কন্টেইনার পুল করুন বা প্রদত্ত Dockerfile থেকে বিল্ড করুন, GPU_TARGET বিকল্প সহ H100+ বা A100-এর জন্য। - pip fallback: প্রথমে PyTorch ইনস্টল করুন, তারপর asr এবং tts extras সহ nemo-toolkit ইনস্টল করুন; README নোট করে যে bring-your-own স্ট্যাকের জন্য uv sync --locked ব্যবহার করা উচিত নয় কারণ এটি lockfile প্রয়োগ করে এবং বিদ্যমান Python/PyTorch/CUDA প্রতিস্থাপন করে। - ঐচ্ছিক অ্যাক্সেলারেটেড ব্যাকএন্ড (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) কম্পাইলড extras থেকে সোর্স-নির্মিত কার্নেল হিসেবে বর্ণনা করা হয়েছে, Automodel ব্যাকএন্ড কম্পাইল করা নির্ভরতা ছাড়াই চলতে সক্ষম। লাইসেন্সিং ও অবদান - Apache License 2.0-এর অধীনে লাইসেন্সপ্রাপ্ত। - CONTRIBUTING.md প্রক্রিয়ার মাধ্যমে কমিউনিটি অবদান স্বাগত। এই ওভারভিউ শুধুমাত্র রিপোজিটরি README-এ যা বলা হয়েছে তা প্রতিফলিত করে; এটি রিলিজ নোটে করা নির্ভুলতা, কর্মক্ষমতা বা র্যাংকিং দাবি যাচাই করে না।