SenseVoiceSmall é um modelo de fundação de fala de código aberto para ASR, identificação de idioma, reconhecimento de emoção e detecção de eventos de áudio, abrangendo mandarim, cantonês, inglês, japonês e coreano com inferência não autorregressiva rápida.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONCall center open-source nativo de IA: a IA de voz atende primeiro via OpenAI Realtime ou Qwen e transfere para agentes humanos em filas FreeSWITCH com softphone no navegador. Um único binário Go com API REST, SSE, interface React embutida e PostgreSQL.
Voicebox é um estúdio de voz com IA de código aberto e execução local, oferecendo clonagem de voz, TTS, ditado global, pós-processamento de áudio, editor de histórias, API REST e integração com agentes via MCP.
Premove ITN é uma biblioteca de normalização inversa de texto (ITN) de código aberto e sensível ao contexto, projetada para transcrições de agentes de voz em inglês. Ela converte saídas de ASR em formas escritas canônicas usando um pipeline de geração, pontuação e decodificação com pontuação contextual DeBERTa.
RunAnywhere é um conjunto de SDKs multiplataforma para executar modelos de IA totalmente no dispositivo, abrangendo telefones, navegadores, desktops e servidores. Ele suporta LLMs, visão, fala, agentes de voz, RAG, embeddings e geração de imagens com uma única API semântica.