vtmate 是一款终端语音AI工具包,支持超低延迟、41种语言及集成TTS/STT。它提供实时语音对话、辩论、语音克隆、会话导出和后台守护模式,配合全局快捷键实现无缝AI交互。
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONOpenCreator(原KrillinAI)是一款开源AI工作区,将多模态内容创作与通用Agent工作区相结合,基于Codex CLI执行引擎,支持视频翻译、下载、缩略图生成、图像生成、智能配音和视频生成等功能。
Unsloth 是一款适用于 Windows、macOS 和 Linux 的桌面应用程序和框架,旨在让用户能够在本地运行和训练大语言模型 (LLM) 及扩散模型。
Verba 是一款离线优先的桌面语言学习应用,通过与 AI 教练对话来学习语言。它在本地运行,支持 Ollama 或用户自带 API 密钥,提供即时纠错、分级阅读、词汇间隔重复以及内置语音和听写功能。
一款适用于 Google Chrome 和 Mozilla Firefox 的浏览器扩展,可为 YouTube 视频提供实时的双语字幕翻译。
LocalAI是一个开源自托管的AI推理引擎,支持在CPU等多种硬件上本地运行大语言模型、视觉、音频和图像生成模型。它提供OpenAI、Anthropic和ElevenLabs兼容的API接口,支持按需加载模块化后端,具备多用户认证和内置Agent功能(支持RAG和MCP)。
VoxCPM2 是 OpenBMB 推出的开源无分词文本转语音系统,基于 2B 扩散自回归架构,支持 30 种语言及中文方言,具备文本描述配音、可控语音克隆和 48kHz 高保真输出等能力。
Pixelle-Video 是一款 AI 全自动短视频引擎,用户输入主题即可自动生成文案、配图、语音、背景音乐并合成视频,支持多种 AI 模型与工作流灵活组合。
tutor 是一款基于终端的离线 Python 实践课程。用户在类 Neovim 的模态编辑器中编写代码,由本地 TTS 语音指导。课程涵盖基础练习、模拟云端/DevOps 路径(含 git, Docker, AWS, Terraform, Ansible, CI/CD)并支持进度保存。
ChatTTS是一款开源的对话场景文本转语音模型,支持中英文,具备多说话人输出及对笑声、停顿和韵律的精细控制。
GPT-SoVITS 是由 RVC-Boss 开发的多功能语音克隆与文字转语音(TTS)WebUI 工具,支持零样本(5秒音频)和少样本(约1分钟数据)语音克隆,兼容中文、日语、韩语、粤语和英语等多种语言。内置音频分离、自动分轨、多语言 ASR 等功能,提供 WebUI 界面和命令行工具,支持 Windows、Linux、macOS 及 Docker 平台部署。
pyVideoTrans是一款支持本地离线部署与各类在线API的开源工具,可用于视频翻译、音频转录、AI配音及字幕翻译。
NVIDIA NeMo Speech 是一个 Apache-2.0 许可的 PyTorch 框架,用于构建、定制和部署语音 AI 模型,涵盖自动语音识别、文本转语音和语音大语言模型,并提供预训练检查点及 Docker/uv 安装方式。
FunTTS 是一个统一接口的文本转语音库,支持多种开源TTS引擎无缝切换,提供字幕生成、多角色对话、异步处理等功能。