Sobre el proyecto

ESPnet es una herramienta de procesamiento de voz end-to-end construida sobre PyTorch. Cubre una amplia gama de tareas, incluyendo reconocimiento automático de voz (ASR), síntesis de texto a voz (TTS), traducción de voz (ST), mejora y separación de voz (SE/SS), diarización de hablantes, comprensión del lenguaje hablado (SLU), síntesis de voz cantada (SVS), modelos de lenguaje de voz (SpeechLM), códecs de audio neuronales y más. La herramienta proporciona recetas reproducibles al estilo Kaldi que gestionan todo, desde la preparación de datos hasta la evaluación, y ofrece cientos de modelos preentrenados en Hugging Face. Las características clave incluyen: - **ASR**: CTC/attention híbrido, Transductor, streaming, Conformer/E-Branchformer, Whisper, frontales SSL y aprendizaje por transferencia. - **TTS**: Tacotron2, FastSpeech2, VITS, JETS, soporte multihablante/multilingüe e integración con vocoders neuronales. - **ST/MT**: Traducción de voz end-to-end y en cascada, traducción automática y traducción de voz a voz. - **SE/SS**: Codificador-separador-decodificador unificado, TasNet/DPRNN, beamformers y mejora integrada con ASR. - **SLU**: Multitarea de intención y transcripción, codificadores ASR/NLP preentrenados. - **Hablante e idioma**: Incrustaciones de hablante, verificación, identificación de idioma, diarización. - **SSL**: Preentrenamiento HuBERT y upstreams S3PRL. - **SpeechLM**: Modelado de secuencias unificado entre tareas de voz y texto. - **Codec**: Códecs de audio neuronales para tokens de voz discretos. ESPnet enfatiza la reproducibilidad mediante un único `run.sh` por corpus, estructura de recetas unificada y formato de configuración, además de escalabilidad vía DDP, entrenamiento multinodo, Slurm/MPI, DeepSpeed y entrenamiento fragmentado. También proporciona demostraciones en tiempo real, cuadernos Colab e integración con Hugging Face Spaces y Weights & Biases.