প্রকল্প সম্পর্কে

SenseVoice একটি স্পিচ ফাউন্ডেশন মডেল যা একাধিক স্পিচ বোঝার ক্ষমতা রাখে: স্বয়ংক্রিয় বক্তৃতা শনাক্তকরণ (ASR), কথ্য ভাষা শনাক্তকরণ (LID), বক্তৃতা আবেগ শনাক্তকরণ (SER), এবং অডিও ইভেন্ট সনাক্তকরণ (AED)। প্রকাশিত চেকপয়েন্টের সুযোগ: SenseVoiceSmall ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষার জন্য ASR এবং ভাষা শনাক্তকরণ সমর্থন করে, সাথে আবেগ এবং অডিও-ইভেন্ট ট্যাগ। বিস্তৃত SenseVoice গবেষণা কাজ ৪০০,০০০ ঘণ্টার বেশি প্রশিক্ষণ এবং ৫০টির বেশি ভাষার সমর্থন রিপোর্ট করে, কিন্তু প্রকাশিত ছোট চেকপয়েন্টটি উপরের পাঁচটি ভাষা কভার করে। স্পিকার ডায়ারাইজেশন চেকপয়েন্টের নিজস্ব আউটপুট নয়; এটি একটি কম্পোজড FunASR পাইপলাইন যা পৃথক FSMN-VAD এবং CAM++ মডেল ব্যবহার করে। হাইলাইটস - সমৃদ্ধ ট্রান্সক্রিপশন: আবেগ শনাক্তকরণ ট্যাগ এবং সাউন্ড ইভেন্ট সনাক্তকরণ যেমন ব্যাকগ্রাউন্ড মিউজিক, করতালি, হাসি, কান্না, কাশি এবং হাঁচি। - দক্ষ ইনফারেন্স: কম-লেটেন্সি ইনফারেন্সের জন্য একটি নন-অটোরিগ্রেসিভ এন্ড-টু-এন্ড ফ্রেমওয়ার্ক। প্রকল্পের বেঞ্চমার্ক সেটআপে, SenseVoiceSmall একই প্যারামিটার সংখ্যায় Whisper-Small এর চেয়ে ৫ গুণের বেশি এবং Whisper-Large এর চেয়ে ১৫ গুণ দ্রুত চলে বলে রিপোর্ট করা হয়েছে। - লং-টেইল ডেটার সাথে অভিযোজনের জন্য ফাইনটিউনিং স্ক্রিপ্ট এবং কৌশল। - মাল্টি-কনকারেন্ট অনুরোধ সমর্থনকারী সার্ভিস ডিপ্লয়মেন্ট পাইপলাইন, ক্লায়েন্ট-সাইড ভাষা যেমন Python, C++, HTML, Java এবং C#। ব্যবহার pip install -r requirements.txt দিয়ে নির্ভরতা ইনস্টল করুন। উদাহরণ এবং কম্পোজড ডায়ারাইজেশন পাথের জন্য funasr>=1.3.26 প্রয়োজন (বর্তমান ডিপ্লয়মেন্ট পাথ funasr==1.4.14 সুপারিশ করে)। মৌলিক ইনফারেন্স FunASR-এর AutoModel ব্যবহার করে iic/SenseVoiceSmall মডেলের সাথে, দীর্ঘ অডিওর জন্য ঐচ্ছিক FSMN-VAD সেগমেন্টেশন, ভাষা নির্বাচন (auto, zh, en, yue, ja, ko, nospeech), ইনভার্স টেক্সট নরমালাইজেশন, ডাইনামিক ব্যাচিং এবং VAD মার্জিং। একটি rich_transcription_postprocess হেল্পার কাঁচা আউটপুট ফরম্যাট করে। VAD ছাড়া দীর্ঘ অডিও: একটি একক generate কলে এক ঘণ্টার ওয়েভফর্ম পাস করলে এনকোডার মেমরি অডিও আকারের চেয়ে অনেক বেশি বাড়তে পারে। long_audio_no_vad.py স্ক্রিপ্ট ffmpeg দিয়ে ডিকোড করে এবং SenseVoice ৩০ সেকেন্ডের নির্দিষ্ট উইন্ডোতে ২ সেকেন্ডের ওভারল্যাপ সহ চালায়, কাঁচা চাঙ্ক আউটপুট JSONL ফাইলে রাখে। উইন্ডো অফসেট ইনপুট সীমানা বর্ণনা করে, শব্দ টাইমস্ট্যাম্প নয়, এবং নির্দিষ্ট সীমানা কাটার চারপাশে শনাক্তকরণকে প্রভাবিত করতে পারে। স্পিকার ডায়ারাইজেশন: FunASR দিয়ে FSMN-VAD, CAM++ স্পিকার লেবেল এবং একটি বিরামচিহ্ন মডেল দিয়ে কম্পোজ করা হয়। স্পিকার লেবেলগুলি বেনামী ক্লাস্টার, স্বীকৃত ব্যক্তিগত পরিচয় নয়। output_timestamp=True হলে, টাইমস্ট্যাম্প [start_ms, end_ms] জোড়া যা শব্দের সাথে এক-থেকে-এক সারিবদ্ধ। এক্সপোর্ট এবং এজ ডিপ্লয়মেন্ট: ONNX এবং Libtorch এক্সপোর্ট পাথ নথিভুক্ত, এবং একটি llama.cpp/GGUF রানটাইম SenseVoice কে একটি স্বয়ংসম্পূর্ণ বাইনারি হিসাবে চালানোর অনুমতি দেয় যার মধ্যে FSMN-VAD অন্তর্নির্মিত এবং রানটাইমে Python নেই, যা CPU এবং এজ ডিভাইসের লক্ষ্য। সার্ভিস এবং কন্টেইনার: একটি FastAPI ডিপ্লয়মেন্ট পোর্ট ৫০০০০-এ শোনে, এবং Docker/Docker Compose ফাইল CPU এবং GPU রান সমর্থন করে মডেল ক্যাশ ভলিউম সহ। ফাইনটিউনিং: ডেটা প্রস্তুতি JSONL রেকর্ড ব্যবহার করে key, source, target, language, emotion এবং event লেবেল সহ; হেল্পার কমান্ড wav.scp এবং text ফাইলকে train/val JSONL-এ রূপান্তর করে। আবেগ লেবেলগুলির মধ্যে HAPPY, SAD, ANGRY, NEUTRAL, FEARFUL, DISGUSTED এবং SURPRISED অন্তর্ভুক্ত; ইভেন্ট লেবেলগুলির মধ্যে BGM, Speech, Applause, Laughter, Cry, Sneeze, Breath এবং Cough অন্তর্ভুক্ত। একটি finetune.sh স্ক্রিপ্ট এবং একটি webui.py ডেমো প্রদান করা হয়েছে। বেঞ্চমার্ক: প্রকল্পটি AISHELL-1, AISHELL-2, Wenetspeech, LibriSpeech এবং Common Voice-এ Whisper-এর বিরুদ্ধে বহুভাষিক ASR তুলনা করে, চীনা এবং ক্যান্টোনিজ শনাক্তকরণের জন্য সুবিধা রিপোর্ট করে। আবেগ শনাক্তকরণের জন্য এটি চীনা এবং ইংরেজি পরীক্ষা সেটে প্রতিযোগিতামূলক জিরো-শট ফলাফল রিপোর্ট করে, একটি পুনরুত্পাদনযোগ্য SER মূল্যায়ন চুক্তি সহ। অডিও ইভেন্ট সনাক্তকরণের জন্য এটি ESC-50-এ BEATS এবং PANN-এর বিরুদ্ধে তুলনা করে, বিশেষায়িত AED মডেলের তুলনায় ফাঁক উল্লেখ করে। ইকোসিস্টেম: SenseVoice FunAudioLLM পরিবারের অংশ FunASR, Fun-ASR এবং CosyVoice-এর সাথে। থার্ড-পার্টি ইন্টিগ্রেশনের মধ্যে রয়েছে Triton/TensorRT ডিপ্লয়মেন্ট, sherpa-onnx (অনেক প্রোগ্রামিং ভাষা এবং প্ল্যাটফর্ম যেমন iOS, Android এবং Raspberry Pi সমর্থন করে), SenseVoice.cpp, streaming-sensevoice, OmniSenseVoice এবং হটওয়ার্ড-বর্ধিত ভেরিয়েন্ট।