عن المشروع

YazSes هو برنامج خفي مجاني ومفتوح المصدر للإملاء الصوتي وتحويل الكلام إلى نص، يعمل بالكامل دون اتصال على Linux (بما في ذلك X11 وWayland) وmacOS وWindows. وهو مبني على faster-whisper ويعمل بالكامل على وحدة المعالجة المركزية المحلية، دون الحاجة افتراضياً إلى سحابة أو حساب أو مفتاح API أو اشتراك. سير العمل الأساسي هو الإملاء بنمط الضغط للتحدث: اضغط باستمرار على مفتاح اختصار، وتحدث، ثم أفلت، فيُكتب النص المفرّغ في النافذة النشطة. يدعم أيضاً أوامر صوتية مثل التراجع والحفظ والانتقال إلى سطر وتشغيل الاختبارات وإعادة تسمية الرمز، منفذة عبر قواعد regex. ويمكن للمستخدمين تعريف وحدات ماكرو متعددة الخطوات ومفردات شخصية. إلى جانب الإملاء، يستطيع YazSes تفريغ ملفات الصوت أو الفيديو الموجودة إلى txt أو md أو srt أو vtt أو json، مع تمييز المتحدثين اختيارياً. ويقوم وضع الاجتماعات بتسجيل اجتماع كامل وإنتاج نص مفرّغ مع تسميات المتحدثين، مع إمكانية إنشاء محاضر محلية اختيارية بواسطة نموذج لغوي كبير تشمل الملخص والقرارات والمهام. وتعد تسميات المتحدثين ومحاضر الاجتماعات إضافات اختيارية ومعطلة افتراضياً. يوفر المشروع قنوات تثبيت أصلية لـ Linux وmacOS وWindows، إضافة إلى بديل pipx وحاوية Docker لتفريغ الملفات. وتتضمن واجهة سطر الأوامر أوامر quickstart وdoctor وenroll وstart وverify وtranscribe. ويُخزَّن الإعداد في ملف TOML. يستهدف YazSes المستخدمين المهتمين بالخصوصية والمطورين والكتّاب والباحثين وحالات إمكانية الوصول. وهو ليس وكيلاً لنموذج لغوي كبير، ومضبوط على الإنجليزية افتراضياً، ولا يوجد له حالياً إصدار للهواتف المحمولة أو الويب. ويتضمن ملف README معايير أداء منشورة وتفاصيل دعم المنصات ومقارنة صريحة مع بدائل مثل Dragon وTalon Voice وأدوات الإملاء السحابية.