عن المشروع
Speech To Speech هو إطار عمل كامل النموذجية لبناء وكلاء صوتيين باستخدام نماذج مفتوحة المصدر. ينظم خط أنابيب تفاعل الصوت إلى أربع مراحل قابلة للتبديل: كشف نشاط الصوت (VAD)، والتحويل من كلام إلى نص (STT)، والنموذج اللغوي الكبير (LLM)، ومن نص إلى كلام (TTS).
القدرات الرئيسية تشمل:
- **هندسة معمارية模块化**: كل مكون قابل للاستبدال. يدعم خلفيات متنوعة بما في ذلك MLX لأجهزة Apple Silicon، وCUDA لبطاقات NVIDIA GPU، وواجهات برمجة متوافقة مع OpenAI للخوادم المستضافة أو ذاتية الاستضافة (مثل vLLM وllama.cpp).
- **واجهة Realtime API**: تعرض مجموعة أحداث OpenAI Realtime GA الأساسية عبر WebSocket وWebRTC، مما يتيح تبادل الأدوار منخفض الزيادة وإجراء النصوص المباشرة.
- **نشر مرن**: يمكن تشغيله محلياً بالكامل (على Mac أو Linux)، أو بنمط هجين (صوت محلي مع LLM مستضاف)، أو كخادم للعملاء الخارجيين.
- **دعم نماذج واسع**:
- STT: Parakeet TDT, Whisper, Faster Whisper, Paraformer, وQwen3-ASR.
- LLM: Transformers, mlx-lm, ومقدمون متعددون متوافقون مع OpenAI.
- TTS: Qwen3-TTS, Kokoro-82M, Pocket TTS, ChatTTS, وOmniVoice.
- **تكامل الأدوات**: عميل Python المغلف يدعم استدعاء الأدوات محلياً عبر عقد وحدة محددة.
- **وكيل LLM**: يعرض اختياري LLM البعيد المحدد كنقطة نهاية قياسية متوافقة مع OpenAI للمهام الجانبية المتزامنة.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.