منصوبے کے بارے میں

SenseVoice ایک اسپیچ فاؤنڈیشن ماڈل ہے جس میں متعدد اسپیچ فہم کی صلاحیتیں ہیں: خودکار اسپیچ ریکگنیشن (ASR)، بولے جانے والے زبان کی شناخت (LID)، اسپیچ ایموشن ریکگنیشن (SER)، اور آڈیو ایونٹ ڈیٹیکشن (AED)۔ جاری کردہ چیک پوائنٹ کا دائرہ: SenseVoiceSmall مینڈارن، کینٹونیز، انگریزی، جاپانی اور کورین کے لیے ASR اور زبان کی شناخت کو سپورٹ کرتا ہے، ساتھ ہی جذبات اور آڈیو ایونٹ ٹیگز بھی۔ وسیع تر SenseVoice تحقیقی کام 400,000 گھنٹوں سے زیادہ تربیت اور 50 سے زیادہ زبانوں کی حمایت کی اطلاع دیتا ہے، لیکن جاری کردہ چھوٹا چیک پوائنٹ مذکورہ پانچ زبانوں کا احاطہ کرتا ہے۔ اسپیکر ڈائریزیشن خود چیک پوائنٹ کی پیداوار نہیں ہے؛ یہ ایک مربوط FunASR پائپ لائن ہے جو الگ FSMN-VAD اور CAM++ ماڈلز استعمال کرتی ہے۔ نمایاں پہلوؤں - بھرپور نقل: جذبات کی شناخت کے ٹیگز اور صوتی واقعات کا پتہ لگانا جیسے پس منظر موسیقی، تالیاں، ہنسی، رونا، کھانسی اور چھینک۔ - موثر انفرنس: کم لیٹنسی انفرنس کے لیے ایک غیر خود رجعت اینڈ ٹو اینڈ فریم ورک۔ پروجیکٹ کے بینچ مارک سیٹ اپ میں، SenseVoiceSmall کو Whisper-Small سے 5 گنا زیادہ تیز اور Whisper-Large سے 15 گنا زیادہ تیز بتایا گیا ہے جبکہ پیرامیٹرز کی تعداد یکساں ہے۔ - لانگ ٹیل ڈیٹا کے مطابق ڈھالنے کے لیے فائن ٹیوننگ اسکرپٹس اور حکمت عملی۔ - سروس ڈیپلائمنٹ پائپ لائن جو متعدد ہمزمان درخواستوں کو سپورٹ کرتی ہے، جس میں کلائنٹ سائیڈ زبانیں Python، C++، HTML، Java اور C# شامل ہیں۔ استعمال پائپ انسٹال -r requirements.txt کے ساتھ انحصار انسٹال کریں۔ مثالیں اور مربوط ڈائریزیشن پاتھ funasr>=1.3.26 کی ضرورت ہے (موجودہ ڈیپلائمنٹ پاتھ funasr==1.4.14 تجویز کرتا ہے)۔ بنیادی انفرنس FunASR کے AutoModel کو iic/SenseVoiceSmall ماڈل کے ساتھ استعمال کرتا ہے، اختیاری FSMN-VAD سیگمنٹیشن لمبی آڈیو کے لیے، زبان کا انتخاب (آٹو، zh، en، yue، ja، ko، nospeech)، معکوس ٹیکسٹ نارملائزیشن، ڈائنامک بیچنگ اور VAD مرجنگ۔ rich_transcription_postprocess مددگار خام آؤٹ پٹ کو فارمیٹ کرتا ہے۔ VAD کے بغیر لمبی آڈیو: ایک گھنٹے کی ویوفارم کو ایک ہی generate کال میں دینا انکوڈر میموری کو آڈیو سائز سے کہیں زیادہ بڑھا سکتا ہے۔ long_audio_no_vad.py اسکرپٹ ffmpeg کے ذریعے ڈی کوڈ کرتا ہے اور SenseVoice کو مقررہ 30 سیکنڈ کی ونڈوز پر 2 سیکنڈ کے اوورلیپ کے ساتھ چلاتا ہے، خام چنک آؤٹ پٹس کو JSONL فائل میں رکھتا ہے۔ ونڈو آفسیٹ ان پٹ باؤنڈریز کی وضاحت کرتے ہیں، لفظوں کے ٹائم اسٹیمپ نہیں، اور مقررہ باؤنڈریز کٹ کے ارد گرد شناخت کو متاثر کر سکتی ہیں۔ اسپیکر ڈائریزیشن: FunASR کے ذریعے FSMN-VAD، CAM++ اسپیکر لیبلز اور punctuation ماڈل کے ساتھ مرتب کیا گیا۔ اسپیکر لیبل گمنام کلسٹرز ہیں، پہچانی گئی ذاتی شناختیں نہیں۔ output_timestamp=True کے ساتھ، ٹائم اسٹیمپ [start_ms, end_ms] جوڑے ہیں جو الفاظ کے ساتھ ایک سے ایک ترتیب میں ہیں۔ ایکسپورٹ اور ایج ڈیپلائمنٹ: ONNX اور Libtorch ایکسپورٹ پاتھ دستاویز کیے گئے ہیں، اور ایک llama.cpp/GGUF رن ٹائم SenseVoice کو ایک خود مختار بائنری کے طور پر چلانے کی اجازت دیتا ہے جس میں بلٹ ان FSMN-VAD ہے اور رن ٹائم پر Python کی ضرورت نہیں ہے، جو CPU اور ایج ڈیوائسز کے لیے ہے۔ سروس اور کنٹینرز: ایک FastAPI ڈیپلائمنٹ پورٹ 50000 پر سنتا ہے، اور Docker/Docker Compose فائلیں CPU اور GPU رنز کو ماڈل کیش والیوم کے ساتھ سپورٹ کرتی ہیں۔ فائن ٹیوننگ: ڈیٹا کی تیاری JSONL ریکارڈز پر مشتمل ہے جس میں key، source، target، language، emotion اور event لیبلز ہیں؛ مددگار کمانڈ wav.scp اور text فائلوں کو ٹرین/ویلی JSONL میں تبدیل کرتے ہیں۔ جذبات کے لیبلز میں HAPPY، SAD، ANGRY، NEUTRAL، FEARFUL، DISGUSTED اور SURPRISED شامل ہیں؛ ایونٹ لیبلز میں BGM، Speech، Applause، Laughter، Cry، Sneeze، Breath اور Cough شامل ہیں۔ ایک finetune.sh اسکرپٹ اور webui.py ڈیمو فراہم کیا گیا ہے۔ بینچ مارکس: پروجیکٹ AISHELL-1، AISHELL-2، Wenetspeech، LibriSpeech اور Common Voice پر Whisper کے مقابلے میں کثیر لسانی ASR کا موازنہ کرتا ہے، چینی اور کینٹونیز شناخت کے لیے فوائد کی اطلاع دیتا ہے۔ جذبات کی شناخت کے لیے یہ چینی اور انگریزی ٹیسٹ سیٹس پر مسابقتی زیرو شاٹ نتائج رپورٹ کرتا ہے، ایک قابل تولید SER تشخیصی معاہدے کے ساتھ۔ آڈیو ایونٹ ڈیٹیکشن کے لیے یہ ESC-50 پر BEATS اور PANN کے مقابلے میں موازنہ کرتا ہے، خصوصی AED ماڈلز کے مقابلے میں خلا کو نوٹ کرتا ہے۔ ایکوسسٹم: SenseVoice FunAudioLLM خاندان کا حصہ ہے جس میں FunASR، Fun-ASR اور CosyVoice شامل ہیں۔ تھرڈ پارٹی انٹیگریشنز میں Triton/TensorRT ڈیپلائمنٹ، sherpa-onnx (بہت سی پروگرامنگ زبانوں اور پلیٹ فارمز جیسے iOS، Android اور Raspberry Pi کی حمایت)، SenseVoice.cpp، streaming-sensevoice، OmniSenseVoice اور hotword-enhanced variants شامل ہیں۔