প্রকল্প সম্পর্কে
ChatTTS একটি জেনারেটিভ টেক্সট-টু-স্পিচ মডেল, যা বিশেষভাবে LLM সহায়কদের মতো সংवाद পরিস্থিতির জন্য ডিজাইন করা হয়েছে। রিপোজিটরিটি অ্যালগরিদম ইনফ্রাস্ট্রাকচার, প্রি-ট্রেইনড মডেল ওজন, এবং inference চালানোর জন্য সহজ উদাহরণ প্রদান করে।
সমর্থিত ভাষাগুলি ইংরেজি এবং চীনা, এবং ভবিষ্যতে যোগ होने वाली অতিরিক্ত भाषাগুলি তালিকাভুক্ত করা হয়েছে। মডেলটি চীনা এবং ইংরেজি অডিও ডেটা پر প্রশিক্ষিত, এবং HuggingFace-এ ওপেন-সোর্স রিলিজকে ৪০,০০০ ঘন্টার প্রি-ট্রেইনড মডেল হিসেবে বর্ণনা করা হয়েছে, SFT ছাড়া।
README-এ বর্ণিত মূল ক্ষमतাসমূহ:
- সংवाद-ভিত্তিক কাজের জন্য অপ্টিমাইজড কনভারসেশনাল TTS, বহু স্পিকার সমর্থন সহ।
- প্রসোডিক বৈশিষ্ট্য-dessus সূক্ষ্ম নিয়ন্ত্রণ, হাসি, বিরাম এবং বিস্ময়াদিবোধক অন্তর্ভুক্ত।
- টোকেন-স্তরের নিয়ন্ত্রণ ইউনিট যেমন [laugh], [uv_break] এবং [lbreak], এবং [oral_2][laugh_0][break_6] এর মতো প্রম্পটের মাধ্যমে বাক্য-স্তরের নিয়ন্ত্রণ।
- গাউসিয়ান বিতরণ থেকে স্পিকার নমুনা নেওয়া, এবং নমুনা করা স্পিকার এম্বেডিং ভবিষ্যতে টিম্বার পুনরুদ্ধারের জন্য সংরক্ষিত।
- তাপমাত্রা, top_P এবং top_K এর মতো সেটযোগ্য ডিকোডিং প্যারামিটার।
- স্ট্রিমিং অডিও জেনারেশন।
শুরু করার বিকল্পগুলি রিপোজিটরিটি ক্লোন করা, pip বা conda এর মাধ্যমে প্রয়োজনীয়তা ইনস্টল করা, PyPI বা GitHub থেকে প্যাকেজ ইনস্টল করা, এবং একটি WebUI উদাহরণ বা কমান্ড-লাইন inference স্ক্রিপ্ট চালানো অন্তর্ভুক্ত। একটি মৌলিক Python ব্যবহার উদাহরণ মডেল লোড করে, টেক্সটের একটি তালিকায় inference চালায়, এবং ২৪ kHz-এ আউটপুট WAV ফাইল সংরক্ষণ করে। উন্নত উদাহরণগুলি স্পিকার নমুনা, বাক্য-স্তর এবং শব্দ-স্তরের নিয়ন্ত্রণ, এবং একটি خود-পরিচয় নমুনা কভার করে।
README-এ হার্ডওয়্যার আশা নোট করা হয়েছে: ৩০ সেকেন্ডের অডিও ক্লিপের জন্য কমপক্ষে ৪ GB GPU মেমরি, এবং ৪০৯০ GPU-এ RTFBounds ০.৩। এতে আরও উল্লেখ করা হয়েছে যে অটো-রিগ্রেসিভ মডেলগুলি বহু স্পিকার আউটপুট বা খারাপ অডিও গুণমানের মতো অস্থিতিশীলতা দেখাতে পারে, এবং একাধিক নমুনা চেষ্টা করার সুপারিশ দেয়।
লাইসেন্সিং: কোডটি AGPLv3+ এর অধীনে প্রকাশিত হয়েছে, ενώ মডেলটি শিক্ষা ও গবেষণা ব্যবহার জন্য CC BY-NC 4.0 এর অধীনে প্রকাশিত হয়েছে, বাণিজ্যিক বা অবৈধ উদ্দেশ্যে নয়। README-এ বলা হয়েছে যে ৪০,০০০ ঘন্টার মডেলের প্রশিক্ষণের সময় একটি ছোট পরিমাণ উচ্চ-ফ্রিকোয়েন্সি শোর যোগ করা হয়েছিল এবং অডিও গুণমানকে MP3 ফরম্যাটে সংকুচিত করা হয়েছিল সম্ভাব্য দুরব্যবহার সীমিত করার জন্য, এবং একটি অভ্যন্তরীণভাবে प्रशिक्षিত ডিটেকশন মডেল ওপেন-সোর্স রিলিজের জন্য পরিকল্পিত।
প্রজেক্ট bark, XTTSv2, valle, fish-speech এবং vocos এর মতো পূর্বের কাজের স্বীকৃতি জানায়, এবং প্রসারিত শেষ-ব্যবহারকারী পণ্যের জন্য কমিউনিটি-বজায়ুক্ত সূচী রিপো Awesome-ChatTTS-কে নির্দেশ করে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.