इस प्रोजेक्ट के बारे में
FluidAudio Fluid Inference द्वारा डिज़ाइन किया गया एक Swift SDK है, जो iOS और macOS पर पूरी तरह से स्थानीय, कम-विलंबता वाले ऑडियो AI अनुप्रयोगों के निर्माण के लिए है। यह उच्च दक्षता और कम बिजली खपत के साथ अत्याधुनिक ओपन-सोर्स मॉडल चलाने के लिए Apple के Neural Engine (ANE) का लाभ उठाता है।
मुख्य विशेषताएं:
- स्वचालित वाक् पहचान (ASR): Parakeet TDT, SenseVoice, और Paraformer जैसे मॉडल का उपयोग करके स्ट्रीमिंग और बैच ट्रांसक्रिप्शन का समर्थन करता है, जो अंग्रेजी, यूरोपीय भाषाओं, जापानी और मंदारिन चीनी सहित 25+ भाषाओं में काम करता है।
- टेक्स्ट-टू-स्पीच (TTS): Kokoro (9 भाषाएं), PocketTTS (वॉयस क्लोनिंग के साथ स्ट्रीमिंग), और Chatterbox Multilingual/Nano (18 भाषाएं, पैरालिंग्विस्टिक टैग) के साथ उच्च-गुणवत्ता वाला वॉयस संश्लेषण प्रदान करता है।
- स्पीकर डायराइज़ेशन: स्पीकर पृथक्करण और पहचान के लिए ऑनलाइन स्ट्रीमिंग और ऑफलाइन बैच पाइपलाइन दोनों प्रदान करता है, जो Sortformer और PyanNote मॉडल का उपयोग करता है।
- वॉयस एक्टिविटी डिटेक्शन (VAD): कुशल वॉयस डिटेक्शन के लिए एकीकृत Silero मॉडल।
- स्पीकर एम्बेडिंग निष्कर्षण: वॉयस तुलना और क्लस्टरिंग के लिए एम्बेडिंग उत्पन्न करें।
- ऑफलाइन और निजी: क्लाउड निर्भरता के बिना पूर्ण ऑन-डिवाइस प्रोसेसिंग, उपयोगकर्ता की गोपनीयता सुनिश्चित करता है। एयर-गैप्ड वातावरण के लिए ऑफलाइन-ओनली मोड और कस्टम रजिस्ट्री/प्रॉक्सी कॉन्फ़िगरेशन शामिल है।
- क्रॉस-प्लेटफ़ॉर्म रैपर: React Native/Expo और Rust/Tauri के लिए आधिकारिक रैपर उपलब्ध हैं।
SDK को कई ऐप्स द्वारा डिक्टेशन, मीटिंग ट्रांसक्रिप्शन, लाइव प्रोडक्शन कंट्रोल और वॉयस असिस्टेंट के लिए एकीकृत किया गया है, जो गोपनीयता, गति और Swift कोड की कुछ पंक्तियों के साथ उपयोग में आसानी पर जोर देता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.