প্রকল্প সম্পর্কে

FluidAudio হলো Fluid Inference দ্বারা ডিজাইন করা একটি Swift SDK, যা iOS এবং macOS-এ সম্পূর্ণ স্থানীয়, কম-বিলম্বিত অডিও AI অ্যাপ্লিকেশন তৈরির জন্য তৈরি। এটি Apple-এর Neural Engine (ANE) ব্যবহার করে অত্যাধুনিক ওপেন-সোর্স মডেলগুলো উচ্চ দক্ষতা এবং কম শক্তি খরচে চালায়। মূল বৈশিষ্ট্যসমূহ: - স্বয়ংক্রিয় বক্তৃতা শনাক্তকরণ (ASR): Parakeet TDT, SenseVoice এবং Paraformer-এর মতো মডেল ব্যবহার করে স্ট্রিমিং এবং ব্যাচ ট্রান্সক্রিপশন সমর্থন করে, যা ২৫+ ভাষায় কাজ করে, যার মধ্যে ইংরেজি, ইউরোপীয় ভাষা, জাপানি এবং ম্যান্ডারিন চাইনিজ অন্তর্ভুক্ত। - টেক্সট-টু-স্পিচ (TTS): Kokoro (৯টি ভাষা), PocketTTS (ভয়েস ক্লোনিংসহ স্ট্রিমিং) এবং Chatterbox Multilingual/Nano (১৮টি ভাষা, প্যারালিঙ্গুইস্টিক ট্যাগ) দিয়ে উচ্চমানের ভয়েস সংশ্লেষণ অফার করে। - স্পিকার ডায়ারাইজেশন: Sortformer এবং PyanNote মডেল ব্যবহার করে স্পিকার পৃথকীকরণ এবং শনাক্তকরণের জন্য অনলাইন স্ট্রিমিং এবং অফলাইন ব্যাচ পাইপলাইন উভয়ই প্রদান করে। - ভয়েস অ্যাক্টিভিটি ডিটেকশন (VAD): দক্ষ ভয়েস শনাক্তকরণের জন্য সমন্বিত Silero মডেল। - স্পিকার এমবেডিং এক্সট্রাকশন: ভয়েস তুলনা এবং ক্লাস্টারিংয়ের জন্য এমবেডিং তৈরি করুন। - অফলাইন ও প্রাইভেট: ক্লাউড নির্ভরতা ছাড়াই সম্পূর্ণ ডিভাইস-ভিত্তিক প্রসেসিং, যা ব্যবহারকারীর গোপনীয়তা নিশ্চিত করে। এয়ার-গ্যাপড পরিবেশের জন্য অফলাইন-অনলি মোড এবং কাস্টম রেজিস্ট্রি/প্রক্সি কনফিগারেশন অন্তর্ভুক্ত। - ক্রস-প্ল্যাটফর্ম র্যাপার: React Native/Expo এবং Rust/Tauri-এর জন্য অফিসিয়াল র্যাপার উপলব্ধ। SDKটি ডিক্টেশন, মিটিং ট্রান্সক্রিপশন, লাইভ প্রোডাকশন কন্ট্রোল এবং ভয়েস অ্যাসিস্ট্যান্টের জন্য অসংখ্য অ্যাপে সংহত করা হয়েছে, যা মাত্র কয়েক লাইন Swift কোডে গোপনীয়তা, গতি এবং ব্যবহারের সহজতার উপর জোর দেয়।