इस प्रोजेक्ट के बारे में

PUSH, ऑफ़लाइन वॉइस-टू-टेक्स्ट डिक्टेशन के लिए एक macOS यूटिलिटी है। यह उपयोगकर्ताओं को एक कुंजी (डिफ़ॉल्ट रूप से Right Option) दबाए रखने, बोलने और छोड़ने की सुविधा देता है, जिससे ट्रांसक्राइब किया गया टेक्स्ट किसी भी फ़ोकस किए गए टेक्स्ट फ़ील्ड में डाल दिया जाता है। यह वॉइस एक्टिविटी डिटेक्शन के साथ हैंड्स-फ़्री उपयोग के लिए wake word का भी समर्थन करता है। सभी भाषण पहचान स्थानीय रूप से Neural Engine पर चलती है, जिससे नेटवर्क राउंड ट्रिप, अकाउंट या API कुंजियों के बिना गोपनीयता सुनिश्चित होती है। मुख्य विशेषताएँ: - Hold-to-talk और wake word सक्रियण - किसी भी ऐप में टेक्स्ट सम्मिलन - स्व-सुधार (जैसे, "the red car, I mean the blue car" से "the blue car" बन जाता है) - भरने वाले शब्दों ("um", "uh") की सफ़ाई, समय, धन, प्रतिशत और उद्धरणों का प्रारूपण - "new line", "new paragraph", "bullet point" और क्रमांकित सूचियों जैसे लेआउट कमांड - आकस्मिक "like" को हटाने के लिए "California mode", जबकि सार्थक उपयोगों को बनाए रखना - नामों और शब्दजाल के लिए व्यक्तिगत शब्दकोश, iCloud के माध्यम से सिंक - सुनने की स्थिति और स्ट्रीमिंग ट्रांसक्रिप्शन दिखाने वाला लाइव पिल - केवल मेनू बार, कोई डॉक आइकन नहीं मॉडल: ऐप डिवाइस पर मौजूद मॉडल का उपयोग करता है, जो अंग्रेज़ी Mac पर डिफ़ॉल्ट रूप से Parakeet Streaming और अन्य जगहों पर Parakeet Ultra पर सेट होता है। Parakeet Ultra अंग्रेज़ी और लैटिन-स्क्रिप्ट यूरोपीय भाषाओं का समर्थन करता है; Nemotron Multilingual चीनी, जापानी, अरबी, हिंदी, रूसी और ग्रीक जैसी अन्य भाषाओं को कवर करता है। प्रत्येक मॉडल लगभग 600 MB का है और इन्हें Settings में प्रबंधित किया जा सकता है। बेंचमार्क (README से, दिनांक 30 सितंबर 2026) के अनुसार Parakeet Streaming के साथ औसत ट्रांसक्रिप्शन विलंबता 0.02s और Parakeet Ultra के साथ 0.04s बताई गई है, जबकि Wispr Flow (क्लाउड) के लिए यह 0.74s है, जिससे PUSH लगभग 20 गुना तेज़ हो जाता है। परीक्षण पैसेज पर सटीकता PUSH के लिए पूर्ण थी, जबकि Wispr Flow ने "Zürich" में umlaut को कभी-कभी गलत तरीके से संभाला। सेटअप: Releases से DMG डाउनलोड करें, Applications में खींचें, Microphone और Accessibility अनुमतियाँ दें, और अनुशंसित मॉडल डाउनलोड करें। `swift build`, `swift run`, `swift test` के साथ स्रोत से बिल्ड करें। गोपनीयता: ऑडियो केवल डिक्टेशन के दौरान रिकॉर्ड किया जाता है और स्थानीय रूप से संसाधित होता है। कोई ऑडियो, ट्रांसक्रिप्ट या टेलीमेट्री कहीं नहीं भेजी जाती। मॉडल स्थानीय रूप से संग्रहीत होते हैं और इन्हें हटाया जा सकता है। तकनीक: Swift, SwiftUI, FluidAudio (CoreML/ANE पर Parakeet + Silero VAD), अपडेट के लिए Sparkle। लाइसेंस: Proprietary (LICENSE और EULA देखें)। 8.2.2 तक के संस्करण MIT-लाइसेंस प्राप्त थे। ओपन-सोर्स घटकों का श्रेय third-party notices में दिया गया है।