عن المشروع

Speech To Speech هو إطار عمل كامل النموذجية لبناء وكلاء صوتيين باستخدام نماذج مفتوحة المصدر. ينظم خط أنابيب تفاعل الصوت إلى أربع مراحل قابلة للتبديل: كشف نشاط الصوت (VAD)، والتحويل من كلام إلى نص (STT)، والنموذج اللغوي الكبير (LLM)، ومن نص إلى كلام (TTS). القدرات الرئيسية تشمل: - **هندسة معمارية模块化**: كل مكون قابل للاستبدال. يدعم خلفيات متنوعة بما في ذلك MLX لأجهزة Apple Silicon، وCUDA لبطاقات NVIDIA GPU، وواجهات برمجة متوافقة مع OpenAI للخوادم المستضافة أو ذاتية الاستضافة (مثل vLLM وllama.cpp). - **واجهة Realtime API**: تعرض مجموعة أحداث OpenAI Realtime GA الأساسية عبر WebSocket وWebRTC، مما يتيح تبادل الأدوار منخفض الزيادة وإجراء النصوص المباشرة. - **نشر مرن**: يمكن تشغيله محلياً بالكامل (على Mac أو Linux)، أو بنمط هجين (صوت محلي مع LLM مستضاف)، أو كخادم للعملاء الخارجيين. - **دعم نماذج واسع**: - STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, وQwen3-ASR. - LLM: Transformers, mlx-lm, ومقدمون متعددون متوافقون مع OpenAI. - TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, وOmniVoice. - **تكامل الأدوات**: عميل Python المغلف يدعم استدعاء الأدوات محلياً عبر عقد وحدة محددة. - **وكيل LLM**: يعرض اختياري LLM البعيد المحدد كنقطة نهاية قياسية متوافقة مع OpenAI للمهام الجانبية المتزامنة.