프로젝트 소개

FluidVoice는 macOS용 오픈소스 음성-텍스트 받아쓰기 애플리케이션으로, 클라우드 받아쓰기 서비스에 대한 로컬 대안으로 자리매김하고 있습니다. GPLv3에 따라 배포되며 Homebrew cask 또는 수동 릴리스 다운로드로 설치할 수 있습니다. 핵심 기능은 전역 단축키로 실행되는 음성-텍스트 받아쓰기이며, 접근성 API를 통해 모든 앱에 텍스트가 직접 삽입됩니다. 말하는 동안 실시간 미리보기 오버레이가 전사 내용을 보여주며, MacBook을 위한 노치 인식 레이아웃도 포함합니다. 음성 인식은 온디바이스에서 실행됩니다. 지원되는 모델에는 Nemotron Speech 3.5 변형, Parakeet Flash, Parakeet TDT v3 및 v2, Cohere Transcribe, Apple Speech, 그리고 Tiny부터 Large까지의 Whisper 크기가 포함됩니다. 언어 지원 범위는 모델에 따라 다릅니다. Parakeet TDT v3는 25개 언어, Cohere Transcribe는 14개, Nemotron은 약 40개, Whisper는 최대 99개 언어를 지원합니다. 대부분의 모델에는 Apple Silicon이 필요하며, Intel Mac은 Whisper를 통해 지원됩니다. 단순 받아쓰기 외에도 이 앱은 음성으로 Mac을 제어하는 Command Mode(앱 실행, 단축어 실행, 시스템 동작 트리거)와 모든 텍스트 필드에서 텍스트를 작성하거나 다시 쓰는 Write Mode를 제공합니다. 선택적 AI 향상 기능은 OpenAI, Groq, 사용자 지정 제공자 또는 Fluid Intelligence라는 번들 로컬 모델을 사용하여 전사 내용을 후처리할 수 있으며, 데이터를 기기 외부로 전송하지 않고 서식, 대문자 표기, 정리를 처리합니다. 앱별 프롬프트 세트를 구성할 수 있습니다. 다른 기능으로는 예산 제어 및 ZIP 내보내기를 지원하는 선택적 로컬 오디오 기록, 일일 사용 통계, 적응형 라이트/다크 테마, 메뉴 막대 통합, 선택적 베타 채널을 포함한 자동 업데이트, 구성 가능한 오버레이 크기가 있습니다. 이 프로젝트는 로컬 우선을 표방합니다. 즉, 클라우드 AI 제공자를 명시적으로 활성화하지 않는 한 음성, 오디오, 전사된 텍스트는 기기에 남아 있습니다. 익명 주간 활동 분석은 기본적으로 전송되며 비활성화할 수 있습니다. 요구 사항은 macOS 15.0 이상, 마이크 접근, 접근성 권한, 그리고 음성 모델용 약 1GB의 디스크 공간(선택적 Fluid Intelligence 모델용으로 약 3.5GB 추가)입니다. 소스에서 빌드하려면 Swift Package Manager와 함께 Xcode를 사용합니다. 빌드 스크립트는 서명 및 미서명 빌드를 지원하며, 통합 테스트는 xcodebuild를 통해 실행됩니다. README에는 iOS 및 Windows 버전이 계획되어 있지만 아직 사용할 수 없다고 명시되어 있습니다.