vtmate هي مجموعة أدوات صوتية تعمل بالذكاء الاصطناعي عبر الطرفية، تتميز بزمن استجابة منخفض للغاية ودعم 41 لغة وتكامل تحويل النص إلى كلام والكلام إلى نص. تتيح محادثات صوتية مباشرة ومناظرات واستنساخ صوتي وتصدير الجلسات ووضع خفي مع اختصارات عامة.
مصدر مفتوح. آفاق جديدة.
اكتشف مشاريع مفتوحة المصدر عالية الجودة، وأرسل المشاريع بشكل مجهول، وطالب بمشروعك المفتوح المصدر وحرّره.
فضول صغير. عالم من المصادر المفتوحة.
THE FIRST COLLECTIONمنصة OpenCreator هي بيئة عمل ذكاء اصطناعي مفتوحة المصدر تجمع بين أدوات إنشاء المحتوى متعدد الوسائط وفضاء عامل عام، مدعومة بمحرك Codex CLI مع أدوات متكاملة لترجمة الفيديو وتحميله وتوليد الصور والصوت والفيديو.
Unsloth هو تطبيق إطاري لسطح المكتب مخصص لتشغيل وتدريب النماذج اللغوية الكبيرة (LLMs) ونماذج الانتشار (diffusion models) محلياً على أنظمة Windows وmacOS وLinux.
فيربا هو تطبيق سطح مكتب يعمل دون اتصال بالإنترنت لتعلم لغة من خلال المحادثة مع مدرب ذكاء اصطناعي. يعمل محلياً باستخدام Ollama أو مفتاح المورد الخاص بك، ويقدم تصحيحات مدمجة، قراءة متدرجة، تكرار المفردات الموزون، بالإضافة إلى التحدث والكتابة الصوتية المدمجة.
إضافة للمتصفح تدعم Google Chrome و Mozilla Firefox، توفر ترجمة فورية ثنائية اللغة للترجمات المصاحبة لفيديوهات YouTube.
LocalAI هو محرك ذكاء اصطناعي مفتوح المصدر ومُستضاف ذاتيًا يشغل نماذج LLMs والرؤية والصوت والصورة والفيديو على أي جهاز، بما في ذلك الأجهزة التي تعتمد فقط على وحدة المعالجة المركزية. يوفر واجهات برمجة تطبيقات متوافقة مع OpenAI وAnthropic وElevenLabs، ووحدات خلفية modulaire تُجلب عند الطلب، ومصادقة متعددة المستخدمين، ووكلاء مدمجين يدعمون RAG وMCP.
VoxCPM2 هو نظام تحويل النص إلى كلام مفتوح المصدر من OpenBMB، يستخدم نموذج انتشار ذاتي راجعي بحجم 2 مليار معامل، ويدعم 30 لغة بما في ذلك اللهجات الصينية، مع تصميم الصوت عبر أوصاف نصية واستنساخ صوتي قابل للتحكم وإخراج صوتي بدقة 48 كيلو هرتز.
Pixelle-Video هو محرك مفتوح المصدر لتوليد مقاطع الفيديو القصيرة بالكامل بواسطة الذكاء الاصطناعي، حيث يقوم تلقائيًا بكتابة النصوص وتوليد الصور/الفيديو وتوليف الصوت والموسيقى وتركيب الفيديو النهائي.
دورة تدريبية لتعلم Python عبر الطرفية (terminal) تعتمد على التطبيق العملي في محرر نصوص بنمط Neovim، مع توجيه صوتي محلي (TTS) دون الحاجة للإنترنت، وتتضمن مساراً لمحاكاة السحابة وDevOps.
ChatTTS نموذج توليد صوتي مفتوح المصدر مصمم للمحادثات، يدعم اللغة الإنجليزية والصينية مع إخراج متعدد المتكلمين والتحكم الدقيق في الضحك والانقطاعات وإيقاع النطق.
GPT-SoVITS نظام مفتوح المصدر لتحويل الصوت والنص-إلى-نطق، يدعم التوليد بأربع ثوانٍ وفي دقيقة واحدة، ويدعم الصينية واليابانية والكورية والكانتونية والإنجليزية. يتضمن أدوات WebUI لفصل الصوت والاستخلاص التلقائي للنص.
أداة pyVideoTrans مفتوحة المصدر لترجمة الفيديو، تتضمن التعرف على الكلام، ترجمة الترجمة، توليف الصوت، ودعم النشر المحلي والواجهات البرمجية عبر الإنترنت.
إطار عمل NVIDIA NeMo Speech مفتوح المصدر مرخص برخصة أباتشي 2.0 مبني على PyTorch، يُستخدم لبناء نماذج ذكاء اصطناعي للكلام وتخصيصها ونشرها، ويغطي التعرف التلقائي على الكلام وتحويل النص إلى كلام ونماذج لغوية كبيرة للكلام، مع نقاط تفتيش مدربة مسبقاً ومسارات تثبيت عبر Docker أو uv.
FunTTS هي مكتبة لتحويل النص إلى كلام بواجهة موحدة، تدعم التبديل السلس بين محركات TTS مفتوحة المصدر، وتوفر ميزات مثل إنشاء الترجمات، والحوارات متعددة الأدوار، والمعالجة غير المتزامنة.