GPT-SoVITS é um sistema open-source de conversão de voz e TTS few-shot que suporta clonagem de voz zero-shot (5s) e few-shot (1min) em chinês, japonês, coreano, cantonês e inglês, com ferramentas WebUI integradas.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONFerramenta open-source para tradução de vídeos com reconhecimento de fala, tradução de legendas, dublagem por IA e clonagem de voz, com suporte a implantação local e APIs online.
O NVIDIA NeMo Speech é um framework PyTorch Apache-2.0 para criar, personalizar e implantar modelos de IA de fala, cobrindo reconhecimento automático de fala, texto-para-fala e LLMs de fala, com checkpoints pré-treinados e instalação via Docker/uv.
FunTTS é uma biblioteca de texto para fala com interface unificada, que suporta a alternância perfeita entre vários motores de TTS de código aberto, oferecendo geração de legendas, diálogos multi-personagens e processamento assíncrono.
vtmate é um kit de ferramentas de IA de voz baseado em terminal, com latência ultrabaixa, suporte a 41 idiomas e integração TTS/STT. Permite conversas ao vivo, debates, clonagem de voz, exportação de sessões e modo daemon com atalhos globais.
OpenCreator é um workspace de IA open-source que combina criação de conteúdo multimodal com um ambiente geral de Agent, utilizando Codex CLI como motor de execução com runtime local, workspace visual e host desktop.
Unsloth é um aplicativo de desktop e framework para executar e treinar grandes modelos de linguagem (LLMs) e modelos de difusão localmente no Windows, macOS e Linux.
Verba é um aplicativo de desktop offline-first para aprender um idioma conversando com um coach de IA. Ele roda localmente com Ollama ou sua própria chave de provedor e oferece correções em linha, leitura graduada, repetição espaçada de vocabulário, além de fala e ditado inclusos.
Uma extensão de navegador para Google Chrome e Mozilla Firefox que fornece tradução de legendas em tempo real e em dois idiomas para vídeos do YouTube.
LocalAI é um motor de IA open-source e auto-hospedado que executa LLMs, visão, voz, imagem e vídeo em qualquer hardware, incluindo apenas CPU. Oferece APIs compatíveis com OpenAI, Anthropic e ElevenLabs, backends modulares sob demanda, autenticação multiusuário e agentes integrados com RAG e MCP.
VoxCPM2 é um sistema de texto para fala sem tokenização com um modelo autoregressivo de difusão de 2B que suporta 30 idiomas, design de voz a partir de descrições de texto, clonagem de voz controlável e saída de áudio de 48 kHz.
Pixelle-Video é um motor de geração automática de vídeos curtos por IA de código aberto: basta o usuário inserir um tema para o sistema gerar automaticamente roteiro, imagens, narração, música de fundo e sintetizar o vídeo final, com suporte a combinação flexível de diversos modelos de IA e fluxos de trabalho.
Um curso de Python baseado em terminal: você escreve código real em um editor modal estilo Neovim enquanto uma voz TTS local o orienta, offline. Inclui exercícios, trilha de DevOps simulada e progresso salvo.
ChatTTS é um modelo de síntese de voz de código aberto voltado para cenários de diálogo, suportando inglês e chinês com saída de múltiplos falantes e controle fino de risos, pausas e prosódia.