À propos du projet

Pocket TTS est une application open source de synthèse vocale (TTS) développée par Kyutai Labs, conçue pour fonctionner efficacement sur CPU sans nécessiter de GPU ni d’API web. Le modèle compte environ 100 millions de paramètres et est optimisé pour une génération audio à faible latence, atteignant environ 200 ms avant le premier fragment audio et une vitesse approximative de 6 fois le temps réel sur un MacBook Air M4 en utilisant seulement 2 cœurs CPU. Le projet prend en charge Python 3.10 à 3.14 et nécessite PyTorch 2.5 ou une version ultérieure (les versions CPU uniquement sont prises en charge). Il fournit à la fois une API de bibliothèque Python et une interface en ligne de commande (CLI) avec des commandes permettant de générer de l’audio (`generate`), d’exécuter un serveur HTTP local (`serve`) et d’exporter des embeddings vocaux vers des fichiers safetensors (`export-voice`). Les principales fonctionnalités incluent : - Le clonage vocal à partir d’échantillons audio (fichiers wav ou mp3) - La prise en charge multilingue de l’anglais, du français, de l’allemand, du portugais, de l’italien et de l’espagnol - La diffusion audio en continu avec prise en charge d’entrées textuelles de longueur illimitée - Un catalogue de voix prédéfinies avec diverses voix disponibles sur Hugging Face - Des modèles entraînés par la communauté pour des langues supplémentaires, notamment le tchèque, l’hindi, le coréen, le persan, l’indonésien et l’estonien - La publication du code d’entraînement permettant aux utilisateurs d’entraîner leurs propres modèles Le projet dispose également de nombreuses implémentations et intégrations communautaires, notamment des versions WebAssembly/navigateur, des portages en Rust, des implémentations en C++, un backend MLX pour Apple Silicon, ainsi que des intégrations avec des plateformes telles que Home Assistant, Discord, Unity et ComfyUI. Le README indique que la prise en charge du GPU n’est pas officiellement supportée, mais qu’elle peut être obtenue en déplaçant manuellement le modèle vers CUDA, avec des accélérations mesurées sur certaines configurations matérielles.