speechNVIDIA-NeMo
新收录NVIDIA NeMo Speech 是一个 Apache-2.0 许可的 PyTorch 框架,用于构建、定制和部署语音 AI 模型,涵盖自动语音识别、文本转语音和语音大语言模型,并提供预训练检查点及 Docker/uv 安装方式。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONNVIDIA NeMo Speech 是一个 Apache-2.0 许可的 PyTorch 框架,用于构建、定制和部署语音 AI 模型,涵盖自动语音识别、文本转语音和语音大语言模型,并提供预训练检查点及 Docker/uv 安装方式。
Eclipse Deeplearning4J(DL4J)是一个基于JVM的开源深度学习生态系统,支持Java、Scala、Kotlin等语言。它包含从Keras和TensorFlow导入模型、ND4J线性代数库、SameDiff自动微分框架、DataVec数据预处理等功能,可在CPU/GPU上跨Windows、Linux、macOS运行。
FaceSwap 是一款基于深度学习的开源人脸交换工具,支持图像和视频中的脸部识别与替换。它提供提取、训练和转换三个阶段,支持命令行和图形界面,并利用 CUDA GPU 加速处理。
AirSim是微软开源的无人机和汽车模拟器,作为虚幻引擎插件构建,并提供实验性的Unity版本。支持PX4和ArduPilot的软件/硬件在环仿真,提供跨语言API以获取图像和控制车辆,用于AI研究。
VoxCPM2 是 OpenBMB 推出的开源无分词文本转语音系统,基于 2B 扩散自回归架构,支持 30 种语言及中文方言,具备文本描述配音、可控语音克隆和 48kHz 高保真输出等能力。