Sobre o projeto

PUSH é um utilitário de macOS para ditado de voz para texto offline. Ele permite que os usuários mantenham uma tecla pressionada (por padrão, Option Direito), falem e soltem para inserir o texto transcrito em qualquer campo de texto em foco. Também suporta uma palavra de ativação para uso sem as mãos com detecção de atividade de voz. Todo o reconhecimento de fala é executado localmente no Neural Engine, garantindo privacidade sem idas e voltas pela rede, contas ou chaves de API. Os principais recursos incluem: - Ativação por manter para falar e palavra de ativação - Inserção de texto em qualquer aplicativo - Autocorreção (por exemplo, "o carro vermelho, quero dizer o carro azul" torna-se "o carro azul") - Limpeza de palavras de preenchimento ("um", "uh"), formatação de horários, dinheiro, porcentagens e citações - Comandos de layout como "nova linha", "novo parágrafo", "marcador" e listas numeradas - "Modo Califórnia" para remover o "like" casual, preservando usos significativos - Dicionário pessoal para nomes e jargões, sincronizado via iCloud - Pílula ao vivo mostrando o status de escuta e a transcrição em streaming - Apenas na barra de menus, sem ícone no dock Modelos: O aplicativo usa modelos no dispositivo, com padrão para Parakeet Streaming em Macs em inglês e Parakeet Ultra em outros casos. O Parakeet Ultra suporta inglês e idiomas europeus de escrita latina; o Nemotron Multilingual cobre outros idiomas como chinês, japonês, árabe, hindi, russo e grego. Os modelos têm cerca de 600 MB cada e podem ser gerenciados nas Configurações. Benchmarks (do README, datado de 30 de setembro de 2026) afirmam latência mediana de transcrição de 0,02s com Parakeet Streaming e 0,04s com Parakeet Ultra, em comparação com 0,74s do Wispr Flow (nuvem), tornando o PUSH cerca de 20x mais rápido. A precisão no trecho de teste foi perfeita para o PUSH, enquanto o Wispr Flow ocasionalmente errou o trema em "Zürich". Configuração: Baixe o DMG em Releases, arraste para Aplicativos, conceda permissões de Microfone e Acessibilidade e baixe o modelo recomendado. Compile a partir do código-fonte com `swift build`, `swift run`, `swift test`. Privacidade: O áudio é gravado apenas durante o ditado e processado localmente. Nenhum áudio, transcrição ou telemetria é enviado a lugar algum. Os modelos são armazenados localmente e podem ser excluídos. Tecnologia: Swift, SwiftUI, FluidAudio (Parakeet + Silero VAD em CoreML/ANE), Sparkle para atualizações. Licença: Proprietária (consulte LICENSE e EULA). Versões até 8.2.2 eram licenciadas sob MIT. Componentes de código aberto são creditados em avisos de terceiros.