هاندي هو تطبيق سطح مكتب مجاني ومفتوح المصدر ومتعدد المنصات لتحويل الكلام إلى نص يعمل بالكامل دون اتصال. اضغط على اختصار، وتحدث، واحصل على النص المُفرَّغ الذي يُلصق في أي حقل نصي باستخدام نماذج Whisper أو Parakeet.
مصدر مفتوح. آفاق جديدة.
اكتشف مشاريع مفتوحة المصدر عالية الجودة، وأرسل المشاريع بشكل مجهول، وطالب بمشروعك المفتوح المصدر وحرّره.
فضول صغير. عالم من المصادر المفتوحة.
THE FIRST COLLECTIONمجموعة WhisperLiveKit هي خط أنابيب مفتوح المصدر للمعالجة الصوتية إلى نص، مصمم للكتابة الفورية فائقة السرعة. يدعم الترجمة والتمييز الصوتي عبر واجهات WebSocket وAPIs المتوافقة مع OpenAI وDeepgram.
Lamitype هو تطبيق مجاني ومفتوح المصدر لتحويل الصوت إلى نص على macOS، يركّز على الخصوصية ودعم الصينية التقليدية، ويعمل محليًا على Apple Silicon مع نموذج Qwen3-ASR، ويوفر ترجمة فورية وتدقيقًا نصيًا وإملاءً سحابيًا اختياريًا.
إضافة Local Multimodal LLM لمحرك Unreal Engine 5 توفر استنتاجاً محلياً غير متصل بالإنترنت للنصوص، وتحويل الكلام إلى نص، وتحويل النص إلى كلام.
إطار عمل صوتي كامل النموذجية يبني وكلاء صوتيين باستخدام نماذج مفتوحة المصدر، ينظم خط أنابيب التفاعل الصوتي إلى أربع مراحل قابلة للتبديل: كشف نشاط الصوت، والتحويل من كلام إلى نص، والنموذج اللغوي الكبير، ومن نص إلى كلام.
Douvo هو تطبيق إدخال صوتي خفيف لنظام macOS لأجهزة Apple Silicon، يستخدم محرك Doubao ASR مع معالجة لاحقة اختيارية بالذكاء الاصطناعي لتنظيف النص وترجمته وتحرير النص المحدد.
Lexos هو محرك معالجة مستندات بالذكاء الاصطناعي مدفوع بالأحداث يجمع بين بوابة Go وعمال Python وقوائم انتظار Redis ونماذج مستضافة ذاتيًا لـ RAG دون اتصال والتلخيص ونسخ الكلام.
SpeechRecognition مكتبة بايثون للتعرف على الكلام تدعم محركات وواجهات متعددة عبر الإنترنت ودون اتصال، بما في ذلك CMU Sphinx وGoogle وAzure وIBM وVosk وWhisper وOpenAI.
تنفيذ عالي الأداء بلغة C/C++ لاستنتاج نموذج OpenAI Whisper للتعرف التلقائي على الكلام (ASR)، مصمم للنشر الخفيف وعبر المنصات المختلفة.
Bolo هو تطبيق مجاني ومفتوح المصدر لتحليل الكلام على macOS، مكتوب بلغة Rust. اضغط على مفتاح اختصار، وتحدث، وسيتم لصق النص المنقول في مكان مؤشرك باستخدام تحليل الكلام من Telnyx AI، مع إمكانية تنظيف النص بواسطة LLM وسجل محلي للنصوص.
SkyClass Distill هي أداة خط إنتاج لتحويل فيديوهات التدريس إلى مهارات تدريس (Teaching Skills) مهيكلة، تدعم جمع الفيديوهات، والنسخ النصي، واستخراج الأدلة، والتقطير باستخدام LLM.
TypeNo هو تطبيق إدخال صوتي مجاني ومفتوح المصدر لنظام macOS يحول الكلام إلى نص محليًا ويلصق النص فورًا — بدون حسابات، بدون إعدادات، مع التركيز على الخصوصية.
ستوديو فيلو للذكاء الاصطناعي هو أداة إنشاء فيديو مفتوحة المصدر ومستندة إلى المتصفح مصممة لتجميع مقاطع فيديو مصحوبة بسرد من النصوص والصوت والأصول البصرية المولدة بالذكاء الاصطناعي.
إعادة تنفيذ سريعة لنموذج OpenAI Whisper باستخدام CTranslate2، مما يوفر سرعة تحويل أعلى واستهلاكاً أقل للذاكرة.
SenseVoiceSmall هو نموذج أساسي مفتوح المصدر للتعرف على الكلام، يغطي التعرف التلقائي على الكلام (ASR)، وتحديد اللغة، والتعرف على العواطف، واكتشاف الأحداث الصوتية، ويدعم الماندرين والكانتونية والإنجليزية واليابانية والكورية مع استدلال سريع غير تلقائي التتابع.
LazyEdit هو سير عمل للفيديو مدعوم بالذكاء الاصطناعي ويعتمد على التشغيل المحلي، مخصص لإنشاء المحتوى ومعالجته ونشره من البداية إلى النهاية.
أداة pyVideoTrans مفتوحة المصدر لترجمة الفيديو، تتضمن التعرف على الكلام، ترجمة الترجمة، توليف الصوت، ودعم النشر المحلي والواجهات البرمجية عبر الإنترنت.