عن المشروع
EnviousWispr هو تطبيق إملاء صوتي وتحويل الكلام إلى نص بالذكاء الاصطناعي، مجاني ومفتوح المصدر لنظام macOS، مصمم لشرائح Apple Silicon ويعمل بالكامل على الجهاز. تتم معالجة الصوت محليًا ولا يُرفع أبدًا؛ ولا يلزم حساب أو اشتراك، ويعمل التطبيق دون اتصال بالإنترنت.
سير العمل الأساسي: اضغط على اختصار لوحة مفاتيح عام من أي تطبيق، وتحدث، فيقوم التطبيق بالنسخ محليًا، واختياريًا بتحسين النص عبر LLM، ثم ينسخه إلى الحافظة ويمكنه اللصق تلقائيًا في التطبيق النشط. يصف README النسخ في أقل من ثانية، مع استغراق تدفق الاختصار إلى اللصق عادةً نحو ثانية ونصف عند تفعيل التحسين بالذكاء الاصطناعي. يكتشف Silero VAD عندما تتوقف عن الكلام وينهي التسجيل تلقائيًا. تشمل أوضاع الاختصار الضغط للتحدث، والتبديل، ووضع اليدين الحرتين (ضغط مزدوج للتثبيت في الإملاء الطويل).
يتوفر محركا ASR. Parakeet TDT v3 (من NVIDIA NeMo، عبر FluidAudio) هو الافتراضي، ويعمل على Apple Neural Engine، ويدعم 25 لغة أوروبية، ويحتاج نحو 460 ميغابايت من القرص. يعمل WhisperKit (OpenAI Whisper Large v3 Turbo، عبر argmax) على GPU، ويدعم أكثر من 99 لغة مع اكتشاف تلقائي للغة، ويحتاج نحو 1.6 غيغابايت. يعمل كلاهما عبر CoreML؛ ويقوم التشغيل الأول بتنزيل النموذج وترجمته.
التحسين بالذكاء الاصطناعي اختياري ويبقى افتراضيًا على الجهاز. تشمل الخيارات EG-1، وهو نموذج التنظيف الخاص بالمشروع والمضبوط بدقة (نحو 2.9 غيغابايت، macOS 14+)، وS1-mini من Superwhisper (نحو 484 ميغابايت، موجه للإنجليزية، مع إعدادات أسلوب Tone وStructure وContext)، وApple Intelligence (macOS 26+، دون تنزيل إضافي)، وOllama (محلي أو مستضاف). التحسين السحابي عبر OpenAI أو Gemini أو Claude يعتمد على مفتاحك الخاص ويرسل النص فقط، وليس الصوت أبدًا. يذكر README أن EG-1 موزع بموجب ترخيص نموذج خاص به وليس بموجب ترخيص GPLv3 الخاص بالتطبيق، وأنه مشتق مضبوط بدقة من Qwen3-4B-Instruct-2507.
تشمل أبرز الميزات المذكورة في README: المعاينة المباشرة للكلمات في كبسولة التسجيل أثناء التحدث؛ Escape Recovery، الذي يحتفظ بنص الإملاء الملغى لمدة 24 ساعة (النص فقط، وليس الصوت أبدًا)؛ Snippets التي تلصق نصًا محفوظًا حرفيًا مع تعبئات التاريخ أو الوقت أو الحافظة؛ Transcribe a File لملفات الصوت/الفيديو الموجودة (m4a، mp3، wav، aiff، caf، mp4، mov، flac) مع أدوار المتحدثين عند إمكانية فصل الأصوات؛ مفردات مخصصة وحزم مفردات مع استيراد جهات الاتصال؛ Quick Add لحفظ تهجئة مصححة من أي مكان في macOS؛ إملاء الرموز التعبيرية بالاسم؛ تنسيق حتمي للأرقام والتواريخ والأموال بالإنجليزية؛ السجل مع مرشحات All/Dictations/Transcripts؛ الحضور في شريط القوائم؛ وتحديثات تلقائية عبر Sparkle.
يوثق README أيضًا أعمال الموثوقية: يُحفظ المسار الحرج (التسجيل، النسخ، اللصق) منفصلًا عن التحسينات الاختيارية بحيث لا تؤدي أعطال التحسين أو حفظ السجل إلى عرقلة التسليم؛ ومسار لصق متعدد الخطوات يتراجع تلقائيًا للتطبيقات التي تقاوم اللصق القياسي؛ ويتطلب الإعداد الأولي إذن Accessibility ويعيد التحقق إذا أُلغي؛ ويعمل محرك الكلام داخل التطبيق بدلًا من مساعد منفصل لتجنب التجمد أثناء الخمول. توصف الإصدارات بأنها موقعة وموثقة ومراجعة عبر Gatekeeper.
المتطلبات هي macOS 14 (Sonoma) أو أحدث وApple Silicon (M1 أو أحدث). يتم التثبيت عبر Homebrew cask (saurabhav88/tap/enviouswispr) أو تنزيل DMG؛ وتُطلب أذونات الميكروفون وAccessibility و(عند أول تراجع للصق) Automation. يستخدم البناء من المصدر Swift Package Manager للترجمة، بينما يتم تجميع ملف .app القابل للتشغيل عبر Tuist ومحرك بناء Xcode؛ وتُنتج ملفات DMG للإصدار عبر سكربت يتطلب Xcode 26+ الكامل وmise وTuist.
تصف ملاحظات البنية في README آلة حالة للخط الأنابيب (خامل، تسجيل، نسخ، تحسين، اكتمال)، وSwift 6 مع تزامن صارم وعزل actor، وخلفيتين منفصلتين عمدًا لـ Parakeet وWhisperKit، ونمط "Heart & Limbs" حيث لا يفشل المسار الحرج أبدًا وتتدهور الميزات الاختيارية بلطف.
الخصوصية: تتم معالجة الصوت محليًا ولا يُرفع، رغم أن الاستعادة المحلية قد تحتفظ مؤقتًا بالصوت. تحليلات المنتج المجهولة (PostHog) والإبلاغ عن الأعطال (Sentry) مفعلة افتراضيًا ويمكن تعطيل كل منهما في الإعدادات؛ وتستبعد تقارير الأعطال النص المملى والصوت. المشروع مرخص بموجب GPLv3 لكود التطبيق، مع أوزان نموذج EG-1 تحت ترخيص نموذج مجتمعي منفصل يقيد إعادة التوزيع والاستخدام لتدريب نماذج منافسة. الاسم والشعار علامتان تجاريتان.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.