عن المشروع

Voicebox هو استوديو صوتي مفتوح المصدر يعمل بالذكاء الاصطناعي ومصمَّم للتشغيل محليًا على جهازك الخاص، ويقدّم نفسه بديلًا مجانيًا للخدمات السحابية مثل ElevenLabs وWisprFlow. وهو يغطي كلاً من الإخراج الصوتي (تحويل النص إلى كلام واستنساخ الصوت) والإدخال الصوتي (الإملاء وتحويل الكلام إلى نص)، مع تضمين نموذج لغوي كبير محلي اختياري لتحسين النصوص وتحديد سمات صوتية لكل ملف تعريف. أبرز القدرات الموضّحة في المستودع: - **استنساخ الصوت وتحويل النص إلى كلام**: استنساخ بدون تدريب مسبق من عينة مرجعية قصيرة، بالإضافة إلى أكثر من 50 صوتًا جاهزًا منسّقًا. ويتضمن سبعة محركات لتحويل النص إلى كلام هي: Qwen3-TTS، وQwen CustomVoice، وLuxTTS، وChatterbox Multilingual، وChatterbox Turbo، وHumeAI TADA، وKokoro، مع دعم يصل إلى 23 لغة حسب المحرك. - **تحويل الكلام إلى نص**: يعمل محليًا باستخدام OpenAI Whisper، مع خيارات لأحجام النماذج من Base إلى Turbo، ويعمل عبر MLX على Apple Silicon أو PyTorch على CUDA/ROCm/DirectML/CPU. - **الإملاء العام**: يتيح اختصار عام على مستوى النظام للمستخدمين الإملاء في أي حقل نصي نشط. ويشير ملف README إلى لصق موجّه حسب الهدف مع إدخال تم التحقق منه عبر إمكانية الوصول في macOS، وتجربة أذونات عند التشغيل الأول لإمكانية الوصول ومراقبة الإدخال. - **المعالجة الصوتية اللاحقة**: ثمانية تأثيرات مبنية على مكتبة pedalboard من Spotify، تشمل تغيير طبقة الصوت، والصدى، والتأخير، والكورس، والضواغط، والكسب، والمرشحات، مع إعدادات مسبقة قابلة لإعادة الاستخدام. - **الإخراج الصوتي للوكلاء**: يتضمّن خادم MCP (بروتوكول سياق النموذج) مدمجًا يعرض أدوات مثل `voicebox.speak` و`voicebox.transcribe` و`voicebox.list_captures` و`voicebox.list_profiles`. ويمكن للوكلاء المتوافقين مع MCP مثل Claude Code وCursor وWindsurf وCline التحدث إلى المستخدم بصوت مستنسخ عبر استدعاء أداة واحدة. - **الخصوصية المحلية**: تبقى النماذج وبيانات الصوت والتسجيلات على جهاز المستخدم. - **محرر القصص**: خط زمني متعدد المسارات للمحادثات والبودكاست والسرديات، مع تأليف بالسحب والإفلات وتشغيل متزامن. - **الالتقاطات**: تُحفظ الإملاءات والتسجيلات داخل التطبيق والملفات المرفوعة مع الصوت والنص المكتوب، ويمكن إعادة تفريغها أو تحسينها أو تحريرها أو ترقيتها إلى عينات صوتية. - **واجهة برمجة التطبيقات**: تتوفر واجهة REST على `http://127.0.0.1:17493` لمسارات `/generate` و`/speak` و`/transcribe` و`/profiles`، مع وثائق على `/docs`. - **المنصات**: تتوفر تنزيلات جاهزة لأنظمة macOS (Apple Silicon وIntel) وWindows، بالإضافة إلى دعم Docker وتعليمات للبناء من المصدر على Linux. من الناحية التقنية، بُني تطبيق سطح المكتب باستخدام Tauri (Rust) وReact/TypeScript، مع واجهة خلفية بلغة Python عبر FastAPI، وتخزين SQLite، واستدلال عبر MLX أو PyTorch حسب المنصة ووحدة معالجة الرسوميات. وتذكر خارطة الطريق في ملف README أعمالًا مستقبلية تشمل اللصق التلقائي على Windows/Linux، ومحركات إضافية لتحويل الكلام إلى نص، والتفريغ الصوتي المتدفق، ونماذج لغوية صوتية متكاملة، وبنية إضافية للإضافات. والمشروع متاح على GitHub مع شارة ترخيص مذكورة في ملف README، ويتضمن المستودع إرشادات للمساهمة.