প্রকল্প সম্পর্কে

Speech To Speech একটি সম্পূর্ণ মডুলার ফ্রেমওয়ার্ক যা ওপেন-সোর্স মডেল ব্যবহার করে ভয়েস এজেন্ট তৈরির কাজটি সহজ করে। এটি ভয়েস ইন্টার‍্যাকশন পাইপলাইনটিকে চারটি বিনিময়যোগ্য ধাপে সাজিয়েছে: Voice Activity Detection (VAD), Speech-to-Text (STT), Large Language Model (LLM), এবং Text-to-Speech (TTS)। প্রধান বৈশিষ্ট্যগুলো হলো: - **মডুলার আর্কিটেকচার**: প্রতিটি কম্পোনেন্ট পরিবর্তনযোগ্য। এটি MLX (Apple Silicon), CUDA (NVIDIA GPUs), এবং OpenAI-সঙ্গতিপূর্ণ API (যেমন vLLM, llama.cpp) সহ বিভিন্ন ব্যাকএন্ড সমর্থন করে। - **রিয়েলটাইম API**: WebSocket এবং WebRTC এর মাধ্যমে মূল OpenAI Realtime GA ইভেন্ট সেট উন্মুক্ত করে, যা নিম্ন-ল্যাটেন্সি টার্ন-টেకిং এবং লাইভ ট্রান্সক্রিপশন সক্ষম করে। - **নমনীয় ডিপ্লয়মেন্ট**: পুরোপুরি লোকালি (Mac বা Linux-এ), হাইব্রিড মোডে (লোকাল স্পিচ + হোস্টেড LLM), বা এক্সটার্নাল ক্লায়েন্টদের জন্য সার্ভার হিসেবে চালানো যায়। - **বহুমুখী মডেল সাপোর্ট**: - STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, এবং Qwen3-ASR। - LLM: Transformers, mlx-lm, এবং বিভিন্ন OpenAI-সঙ্গতিপূর্ণ প্রদানকারী। - TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, এবং OmniVoice। - **টুল ইন্টিগ্রেশন**: প্যাকেজ করা Python ক্লায়েন্ট একটি নির্দিষ্ট মডিউল কনট্রাক্টের মাধ্যমে লোকাল টুল কলিং সমর্থন করে। - **LLM প্রক্সি**: ঐচ্ছিকভাবে কনফিগার করা রিমোট LLM-কে OpenAI-সঙ্গতিপূর্ণ এন্ডপয়েন্ট হিসেবে একাধিক কাজের জন্য উন্মুক্ত করে।