ESPnet هو مجموعة أدوات لمعالجة الكلام من الطرف إلى الطرف مبنية على PyTorch، تغطي التعرف التلقائي على الكلام، التحويل من نص إلى كلام، الترجمة الصوتية، المعالجة، التمييز بين المتكلمين، والمزيد، مع وصفات قابلة للتكرار ونماذج مسبقة التدريب.
مصدر مفتوح. آفاق جديدة.
اكتشف مشاريع مفتوحة المصدر عالية الجودة، وأرسل المشاريع بشكل مجهول، وطالب بمشروعك المفتوح المصدر وحرّره.
فضول صغير. عالم من المصادر المفتوحة.
THE FIRST COLLECTIONإضافة Local Multimodal LLM لمحرك Unreal Engine 5 توفر استنتاجاً محلياً غير متصل بالإنترنت للنصوص، وتحويل الكلام إلى نص، وتحويل النص إلى كلام.
FunTTS هي مكتبة لتحويل النص إلى كلام بواجهة موحدة، تدعم التبديل السلس بين محركات TTS مفتوحة المصدر، وتوفر ميزات مثل إنشاء الترجمات، والحوارات متعددة الأدوار، والمعالجة غير المتزامنة.
MoneyPrinterTurbo هي أداة مفتوحة المصدر لتوليد مقاطع فيديو قصيرة بالذكاء الاصطناعي، تكفي فيها فكرة أو كلمة مفتاحية لإنتاج السكربت والتعليق الصوتي والمواد والترجمات والموسيقى والمونتاج، بإخراج 9:16 و16:9 و1:1، مع دعم WebUI وAPI وCLI وAI Agent.
Mimora 是一款免费、完全本地的发音训练工具,适用于英语和西班牙语(西班牙语为实验性)。它使用本地模型进行发音、语音识别和词汇生成,不需要云服务或API密钥。工作流程包括用户输入文本后,由本地模型生成发音,然后通过定制的IPA或语音域比较工具,评估用户的发音质量,标注需要改进的词汇。支持英语(美式和英式)完全校正,西班牙语目前处于实验状态。核心功能包括一键录录、自动静音检测和对比录录与参考录录,支持Windows、macOS和Linux。安装推荐通过`uv`或`pipx`,模型首次运行后即可 download。包含设置窗口调整语言、口音、速度和翻译选项,提供 'No-LLM模式' 适用于慢速机器。
Unsloth هو تطبيق إطاري لسطح المكتب مخصص لتشغيل وتدريب النماذج اللغوية الكبيرة (LLMs) ونماذج الانتشار (diffusion models) محلياً على أنظمة Windows وmacOS وLinux.
Zara هو مساعد ذكاء اصطناعي تجريبي محلي أول ومساعد لسطح مكتب Linux، يجمع بين المنطق الرمزي (Prolog) والنماذج اللغوية الكبيرة (LLMs) لمعالجة النوايا والاستنتاج.
VoxCPM2 هو نظام تحويل النص إلى كلام مفتوح المصدر من OpenBMB، يستخدم نموذج انتشار ذاتي راجعي بحجم 2 مليار معامل، ويدعم 30 لغة بما في ذلك اللهجات الصينية، مع تصميم الصوت عبر أوصاف نصية واستنساخ صوتي قابل للتحكم وإخراج صوتي بدقة 48 كيلو هرتز.
خادم MCP مصمم لتعليم الموسيقية للذكاء الاصطناعي عبر البيانو والجيتار. يتضمن 120 أغنية مُعَلّقة، وستة محركات صوتية، وقمرة قيادة للتأليف مستندة إلى المتصفح، ومجموعة بيانات عامة لأثر استخدام الأدوات.
ستوديو فيلو للذكاء الاصطناعي هو أداة إنشاء فيديو مفتوحة المصدر ومستندة إلى المتصفح مصممة لتجميع مقاطع فيديو مصحوبة بسرد من النصوص والصوت والأصول البصرية المولدة بالذكاء الاصطناعي.
TaleWeaver هو محرك مغامرات نصية يعمل بالذكاء الاصطناعي ومستضاف ذاتيًا عبر المتصفح، مع مدير لعب ذكي، ومحرر مغامرات، وآليات لعبة أدوار، وسرد صوتي وإدخال كلامي، ونشر عبر Docker/SQLite.
OpenMontage هو نظام إنتاج فيديو وكيل مفتوح المصدر يحول مساعدي البرمجة بالذكاء الاصطناعي إلى استوديوهات فيديو متكاملة، ويدعم مسارات عمل شاملة من البحث حتى الرندرة النهائية.
ChatTTS نموذج توليد صوتي مفتوح المصدر مصمم للمحادثات، يدعم اللغة الإنجليزية والصينية مع إخراج متعدد المتكلمين والتحكم الدقيق في الضحك والانقطاعات وإيقاع النطق.
GPT-SoVITS نظام مفتوح المصدر لتحويل الصوت والنص-إلى-نطق، يدعم التوليد بأربع ثوانٍ وفي دقيقة واحدة، ويدعم الصينية واليابانية والكورية والكانتونية والإنجليزية. يتضمن أدوات WebUI لفصل الصوت والاستخلاص التلقائي للنص.
أداة pyVideoTrans مفتوحة المصدر لترجمة الفيديو، تتضمن التعرف على الكلام، ترجمة الترجمة، توليف الصوت، ودعم النشر المحلي والواجهات البرمجية عبر الإنترنت.