इस प्रोजेक्ट के बारे में
Speech To Speech एक पूरी तरह से मॉड्यूलर फ्रेमवर्क है जो ओपन-सोर्स मॉडल्स का उपयोग करके वॉइस एजेंट बनाने के लिए बनाया गया है। यह वॉइस इंटरैक्शन पाइपलाइन को चार आदान-प्रदान योग्य चरणों में व्यवस्थित करता है: Voice Activity Detection (VAD), Speech-to-Text (STT), Large Language Model (LLM), और Text-to-Speech (TTS).
मुख्य क्षमताएं:
- **मॉड्यूलर आर्किटेक्चर**: प्रत्येक घटक परिवर्तनीय है। यह MLX (Apple Silicon), CUDA (NVIDIA GPUs), और OpenAI-कम्पैटिबल APIs (vLLM, llama.cpp जैसे होस्टेड या सेल्फ-होस्टेड सर्वर्स) सहित विभिन्न बैकएंड का समर्थन करता है।
- **Realtime API**: WebSocket और WebRTC के माध्यम से ओपनएआई Realtime GA ईवेंट सेट प्रस्तुत करता है, जिससे कम लेटेंसी वाला टर्न-टेकिंग और लाइव ट्रांसक्रिप्शन संभव होता है।
- **लचीला डिप्लॉयमेंट**: इसे पूरी तरह से लोकली (Mac या Linux पर), हाइब्रिड मोड में (लोकल स्पीच + होस्टेड LLM), या बाहरी क्लाइंट्स के लिए सर्वर के रूप में चलाया जा सकता है।
- **विस्तृत मॉडल समर्थन**:
- STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, और Qwen3-ASR.
- LLM: Transformers, mlx-lm, और विभिन्न OpenAI-कम्पैटिबल प्रदाता।
- TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, और OmniVoice.
- **टूल इंटीग्रेशन**: पैकेज किया गया Python क्लाइंट एक विशिष्ट मॉड्यूल अनुबंध के माध्यम से लोकल टूल कॉलिंग का समर्थन करता है।
- **LLM Proxy**: वैकल्पिक रूप से कॉन्फ़िगर किए गए रिमोट LLM को एक मानक OpenAI-कम्पैटिबल एंडपॉइंट के रूप में concurrently साइड टार्क्स के लिए प्रस्तुत करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.