À propos du projet
FluidVoice est une application open source de dictée vocale pour macOS, positionnée comme une alternative locale aux services de dictée cloud. Elle est distribuée sous GPLv3 et installable via le cask Homebrew ou par téléchargement manuel d'une version.
Sa capacité principale est la dictée vocale déclenchée par un raccourci global, avec insertion directe du texte dans n'importe quelle application via les API d'accessibilité. Une superposition d'aperçu en direct affiche la transcription pendant que vous parlez, avec une disposition adaptée à l'encoche des MacBooks.
La reconnaissance vocale s'exécute sur l'appareil. Les modèles pris en charge incluent les variantes Nemotron Speech 3.5, Parakeet Flash, Parakeet TDT v3 et v2, Cohere Transcribe, Apple Speech, et les tailles Whisper de Tiny à Large. La couverture linguistique varie selon le modèle : Parakeet TDT v3 couvre 25 langues, Cohere Transcribe 14, Nemotron environ 40, et Whisper jusqu'à 99. Apple Silicon est requis pour la plupart des modèles ; les Mac Intel sont pris en charge via Whisper.
Au-delà de la dictée simple, l'application propose un mode Commande pour contrôler le Mac à la voix (lancement d'applications, exécution de raccourcis, déclenchement d'actions système) et un mode Écriture pour rédiger ou réécrire du texte dans n'importe quel champ de texte. Une amélioration IA optionnelle peut post-traiter les transcriptions via OpenAI, Groq, des fournisseurs personnalisés, ou un modèle local intégré appelé Fluid Intelligence, qui gère le formatage, les majuscules et le nettoyage sans envoyer de données hors de la machine. Des ensembles d'invites par application sont configurables.
D'autres fonctionnalités incluent un historique audio local optionnel avec contrôles de budget et export ZIP, des statistiques d'utilisation quotidiennes, un thème clair/sombre adaptatif, une intégration à la barre de menus, des mises à jour automatiques avec un canal bêta optionnel, et des tailles de superposition configurables. Le projet se dit local-first : la voix, l'audio et le texte transcrit restent sur l'appareil sauf si un fournisseur d'IA cloud est explicitement activé. Des statistiques d'activité hebdomadaires anonymes sont envoyées par défaut et peuvent être désactivées.
Les prérequis sont macOS 15.0 ou ultérieur, l'accès au microphone, les autorisations d'accessibilité, et environ 1 Go d'espace disque pour un modèle vocal (environ 3,5 Go de plus pour le modèle optionnel Fluid Intelligence). La compilation depuis les sources utilise Xcode avec Swift Package Manager ; un script de build prend en charge les builds signés et non signés, et les tests d'intégration s'exécutent via xcodebuild. Le README indique que des versions iOS et Windows sont prévues mais pas encore disponibles.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.