প্রকল্প সম্পর্কে
Speech To Speech একটি সম্পূর্ণ মডুলার ফ্রেমওয়ার্ক যা ওপেন-সোর্স মডেল ব্যবহার করে ভয়েস এজেন্ট তৈরির কাজটি সহজ করে। এটি ভয়েস ইন্টার্যাকশন পাইপলাইনটিকে চারটি বিনিময়যোগ্য ধাপে সাজিয়েছে: Voice Activity Detection (VAD), Speech-to-Text (STT), Large Language Model (LLM), এবং Text-to-Speech (TTS)।
প্রধান বৈশিষ্ট্যগুলো হলো:
- **মডুলার আর্কিটেকচার**: প্রতিটি কম্পোনেন্ট পরিবর্তনযোগ্য। এটি MLX (Apple Silicon), CUDA (NVIDIA GPUs), এবং OpenAI-সঙ্গতিপূর্ণ API (যেমন vLLM, llama.cpp) সহ বিভিন্ন ব্যাকএন্ড সমর্থন করে।
- **রিয়েলটাইম API**: WebSocket এবং WebRTC এর মাধ্যমে মূল OpenAI Realtime GA ইভেন্ট সেট উন্মুক্ত করে, যা নিম্ন-ল্যাটেন্সি টার্ন-টেకిং এবং লাইভ ট্রান্সক্রিপশন সক্ষম করে।
- **নমনীয় ডিপ্লয়মেন্ট**: পুরোপুরি লোকালি (Mac বা Linux-এ), হাইব্রিড মোডে (লোকাল স্পিচ + হোস্টেড LLM), বা এক্সটার্নাল ক্লায়েন্টদের জন্য সার্ভার হিসেবে চালানো যায়।
- **বহুমুখী মডেল সাপোর্ট**:
- STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, এবং Qwen3-ASR।
- LLM: Transformers, mlx-lm, এবং বিভিন্ন OpenAI-সঙ্গতিপূর্ণ প্রদানকারী।
- TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, এবং OmniVoice।
- **টুল ইন্টিগ্রেশন**: প্যাকেজ করা Python ক্লায়েন্ট একটি নির্দিষ্ট মডিউল কনট্রাক্টের মাধ্যমে লোকাল টুল কলিং সমর্থন করে।
- **LLM প্রক্সি**: ঐচ্ছিকভাবে কনফিগার করা রিমোট LLM-কে OpenAI-সঙ্গতিপূর্ণ এন্ডপয়েন্ট হিসেবে একাধিক কাজের জন্য উন্মুক্ত করে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.