প্রকল্প সম্পর্কে
VibeVoice হলো মাইক্রোসফটের একটি ওপেন-সোর্স ভয়েস AI প্রজেক্ট যাতে Automatic Speech Recognition (ASR) এবং Text-to-Speech (TTS) উভয় মডেলই রয়েছে। এর একটি মূল কৌশলগত বৈশিষ্ট্য হলো টানা 7.5 Hz ফ্রেম রেটে অপারেট করা কন্টিনুয়াস স্পিচ টোকেনাইজার ব্যবহার করা, যা অডিও গুণমান বজায় রাখতে সাহায্য করে দীর্ঘ সিকোয়েন্সের জন্য কম্পিউটেশনাল দক্ষতা বাড়ায়, পাশাপাশি নেক্সট-টোকেন ডিফিউশন ফ্রেমওয়ার্কও অন্তর্ভুক্ত।
রিপোজিটরিতে নথিভুক্ত মূল মডেল ও ক্ষমতা:
১. VibeVoice-ASR: একটি ইউনিফাইড স্পিচ-টু-টেক্সট মডেল যা একক পাসে ৬০ মিনিট পর্যন্ত কন্টিনিউয়াস অডিও প্রক্রিয়া করতে সক্ষম। এটি কাঠামোবদ্ধ ট্রান্সক্রিপশন তৈরি করে যেখানে স্পিকার পরিচয় (কে), সময়সীমা (কখন), এবং বিষয়বস্তু (কী) থাকে। এটি ডোমেইন-নির্দিষ্ট শব্দের জন্য ব্যবহারকারী-কাস্টমাইজড হটওয়ার্ড সমর্থন করে এবং ৫০-এর বেশি ভাষায় প্রাকৃতিক বহুভাষিকভাবে সক্ষম। একটি স্ট্রিমিং সংস্করণ অডিও আসার সাথে সাথে ট্রান্সক্রাইব করে। এটি Hugging Face Transformers-এ ইন্টিগ্রেশন এবং vLLM ইনফারেন্স সমর্থন করে।
২. VibeVoice-ASR-BitNet: এইচটেরোজিনিয়াস কোয়ান্টিজেশন (I8_S + I2_S) ব্যবহার করে একটি এজ CPU ইনফারেন্স ইঞ্জিন, যা ৪.৬২ GB থেকে সংকুচিত করে ১.৫৮ GB-তে নিয়ে আসে GPU ছাড়াই CPU থ্রেডে রিয়েল-টাইম ইনফারেন্সের জন্য।
৩. VibeVoice-TTS: দীর্ঘ ফর্ম বহু-স্পিকার টেক্সট-টু-স্পিচ মডেল যা একক পাসে ৯০ মিনিট পর্যন্ত speech সিন্থেসাইজ করতে সক্ষম, সর্বোচ্চ ৪টি স্বতন্ত্র স্পিকার দিয়ে। এটি অভিব্যক্তিপূর্ণ speech এবং ইংরেজি ও চাইনিজ সহ একাধিক ভাষা সমর্থন করে। মনে রাখবেন: দায়িত্বশীল AI সংক্রান্ত উদ্বেগের কারণে, দুর্ব্যবহারের ঘটনার পর TTS কোড রিপোজিটরি থেকে সরিয়ে নেওয়া হয়েছে।
৪. VibeVoice-Realtime-0.5B: একটি হালকা (০.৫ বিলিয়ন প্যারামিটার) রিয়েল-টাইম স্ট্রিমিং TTS মডেল যা স্ট্রিমিং টেক্সট ইনপুট এবং শক্তিশালী দীর্ঘ ফর্ম speech জেনারেশন সমর্থন করে, পরীক্ষামূলক বহুভাষিক ভয়েসসহ।
রিপোজিটরিতে ডকুমেন্টেশন, ASR-এর জন্য ফাইনটিউনিং কোড, ডেমো এবং Hugging Face-এ মডেল ওয়েটের লিংক রয়েছে। প্রজেক্টটি কেবল গবেষণা ও উন্নয়নের উদ্দেশ্যে তৈরি; কোনো বাণিজ্যিক বা বাস্তব-প্রয়োগের জন্য এটি আরও পরীক্ষার পরামর্শ দেওয়া হচ্ছে না।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.