Batchalign3 هو خط أنابيب صوتي وتعلم آلي من TalkBank لإنتاج وإثراء نصوص CHAT، ويغطي التعرف التلقائي على الكلام (ASR)، والمحاذاة القسرية، ووضع العلامات المورفولوجية العصبية، والترجمة، وتجزئة الكلام. يتضمن واجهة سطر أوامر (CLI)، وحزمة بايثون، وجسر PyO3، ولوحة تحكم React، وواجهة سطح مكتب Tauri تجريبية.
مصدر مفتوح. آفاق جديدة.
اكتشف مشاريع مفتوحة المصدر عالية الجودة، وأرسل المشاريع بشكل مجهول، وطالب بمشروعك المفتوح المصدر وحرّره.
فضول صغير. عالم من المصادر المفتوحة.
THE FIRST COLLECTIONمكتبة Python لاسترداد ترجمة الفيديوهات على يوتيوب دون الحاجة لمفتاح API أو متصفح headless. تدعم لغات متعددة والترجمة وتنسيقات إخراج متنوعة.
Mimora 是一款免费、完全本地的发音训练工具,适用于英语和西班牙语(西班牙语为实验性)。它使用本地模型进行发音、语音识别和词汇生成,不需要云服务或API密钥。工作流程包括用户输入文本后,由本地模型生成发音,然后通过定制的IPA或语音域比较工具,评估用户的发音质量,标注需要改进的词汇。支持英语(美式和英式)完全校正,西班牙语目前处于实验状态。核心功能包括一键录录、自动静音检测和对比录录与参考录录,支持Windows、macOS和Linux。安装推荐通过`uv`或`pipx`,模型首次运行后即可 download。包含设置窗口调整语言、口音、速度和翻译选项,提供 'No-LLM模式' 适用于慢速机器。
Premove ITN هي مكتبة مفتوحة المصدر للتطبيع العكسي للنصوص المدرك للسياق لنسخ وكلاء الصوت بالإنجليزية، تحول مخرجات التعرف الآلي إلى صيغ كتابية عبر خط أنابيب توليد وتقييم وفك باستخدام تقييم سياقي من DeBERTa.
SenseVoiceSmall هو نموذج أساسي مفتوح المصدر للتعرف على الكلام، يغطي التعرف التلقائي على الكلام (ASR)، وتحديد اللغة، والتعرف على العواطف، واكتشاف الأحداث الصوتية، ويدعم الماندرين والكانتونية والإنجليزية واليابانية والكورية مع استدلال سريع غير تلقائي التتابع.
إطار عمل NVIDIA NeMo Speech مفتوح المصدر مرخص برخصة أباتشي 2.0 مبني على PyTorch، يُستخدم لبناء نماذج ذكاء اصطناعي للكلام وتخصيصها ونشرها، ويغطي التعرف التلقائي على الكلام وتحويل النص إلى كلام ونماذج لغوية كبيرة للكلام، مع نقاط تفتيش مدربة مسبقاً ومسارات تثبيت عبر Docker أو uv.
Douvo هو تطبيق إدخال صوتي خفيف لنظام macOS لأجهزة Apple Silicon، يستخدم محرك Doubao ASR مع معالجة لاحقة اختيارية بالذكاء الاصطناعي لتنظيف النص وترجمته وتحرير النص المحدد.