Sobre el proyecto
audio.cpp es un motor de inferencia integral en C++ puro para modelos de audio, impulsado por ggml. Elimina la necesidad de entornos Python complejos, proporcionando un runtime nativo compartido para diversas tareas de audio. Las características clave incluyen:
- **Amplio soporte de modelos**: Admite más de 80 familias de modelos y más de 120 variantes para síntesis de voz (TTS), reconocimiento automático del habla (ASR), detección de actividad de voz (VAD), clonación de voz, conversión de voz, generación de música, separación de fuentes y diarización de hablantes.
- **Alto rendimiento**: Optimizado para CUDA, Metal, ROCm, Vulkan y CPU. Logra aceleraciones significativas (hasta 8 veces más rápido que las rutas de Python) y menor latencia.
- **Formato GGUF**: Soporta completamente el formato de modelo GGUF, con paquetes cuantizados optimizados Q8 y otros para un uso eficiente de memoria y velocidad.
- **Portabilidad**: Se ejecuta en Windows, Linux y macOS, con soporte para GPUs NVIDIA, AMD y Apple Silicon.
- **Preparación para producción**: Incluye sesiones reutilizables, inferencia offline por lotes, soporte de streaming, utilidades de audio integradas (eliminación de ruido, remuestreo, STFT) y soporte de pipelines JSON para flujos de trabajo de múltiples pasos.
- **Interfaces de usuario**: Incluye una interfaz de línea de comandos (CLI), un servidor API y una WebUI nativa con una pestaña Arena para comparación de modelos lado a lado.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.