প্রকল্প সম্পর্কে

Pocket TTS হলো Kyutai Labs-এর তৈরি একটি ওপেন-সোর্স টেক্সট-টু-স্পিচ (TTS) অ্যাপ্লিকেশন, যা বিশেষভাবে CPU-তে দক্ষতার সাথে চালানোর জন্য ডিজাইন করা হয়েছে এবং এতে কোনো GPU বা ওয়েব API-র প্রয়োজন হয় না। মডেলটিতে প্রায় ১০০ মিলিয়ন প্যারামিটার রয়েছে এবং এটি কম লেটেন্সিতে অডিও তৈরির জন্য অপ্টিমাইজ করা হয়েছে। এটি প্রথম অডিও চাঙ্ক পেতে প্রায় ২০০ মিলিসেকেন্ড সময় নেয় এবং শুধুমাত্র ২টি CPU কোর ব্যবহার করে MacBook Air M4-এ প্রায় ৬ গুণ রিয়েল-টাইম গতি অর্জন করে। প্রজেক্টটি Python 3.10 থেকে 3.14 পর্যন্ত সমর্থন করে এবং এতে PyTorch 2.5 বা তার পরবর্তী সংস্করণ প্রয়োজন (শুধুমাত্র CPU বিল্ড সমর্থিত)। এটি একটি Python লাইব্রেরি API এবং একটি কমান্ড-লাইন ইন্টারফেস (CLI) উভয়ই প্রদান করে, যেখানে অডিও তৈরি করার জন্য (`generate`), লোকাল HTTP সার্ভার চালানোর জন্য (`serve`) এবং ভয়েস এমবেডিংগুলোকে safetensors ফাইলে এক্সপোর্ট করার জন্য (`export-voice`) কমান্ড রয়েছে। প্রধান বৈশিষ্ট্যগুলোর মধ্যে রয়েছে: - অডিও স্যাম্পল থেকে ভয়েস ক্লোনিং (wav বা mp3 ফাইল) - ইংরেজি, ফরাসি, জার্মান, পর্তুগিজ, ইতালীয় এবং স্প্যানিশ ভাষার জন্য বহুভাষিক সমর্থন - অসীমভাবে দীর্ঘ টেক্সট ইনপুট সমর্থনসহ অডিও স্ট্রিমিং - Hugging Face-এ উপলব্ধ বিভিন্ন ভয়েসসহ প্রি-বিল্ট ভয়েস ক্যাটালগ - চেক, হিন্দি, কোরিয়ান, পার্সিয়ান, ইন্দোনেশিয়ান এবং এস্টোনিয়ানসহ অতিরিক্ত ভাষার জন্য কমিউনিটি-প্রশিক্ষিত মডেল - ব্যবহারকারীদের নিজস্ব মডেল প্রশিক্ষণের জন্য ট্রেনিং কোড প্রকাশিত হয়েছে প্রজেক্টটিতে অসংখ্য কমিউনিটি বাস্তবায়ন এবং ইন্টিগ্রেশনও রয়েছে, যার মধ্যে রয়েছে WebAssembly/ব্রাউজার সংস্করণ, Rust পোর্ট, C++ বাস্তবায়ন, Apple Silicon-এর জন্য MLX ব্যাকএন্ড এবং Home Assistant, Discord, Unity ও ComfyUI-এর মতো প্ল্যাটফর্মগুলোর সাথে ইন্টিগ্রেশন। README-তে উল্লেখ করা হয়েছে যে GPU সমর্থন আনুষ্ঠানিকভাবে সমর্থিত নয়, তবে মডেলটিকে ম্যানুয়ালি CUDA-তে স্থানান্তরিত করে এটি অর্জন করা যেতে পারে, এবং নির্দিষ্ট হার্ডওয়্যার কনফিগারেশনে পরিমাপকৃত গতিবৃদ্ধি পাওয়া গেছে।