这个项目能做什么
Hoho Avatar 是一个源优先的工具包,旨在构建音频响应式虚拟形象体验。它具有一个基于浏览器的 TypeScript 引擎,可分析流式单声道 PCM 音频以驱动角色动画,具体为管理通过 Canvas 2D 渲染的分层 PNG 角色的五种嘴型状态和自动眨眼。
核心能力包括:
- 音频集成:支持多种音频源,包括实时麦克风输入、本地音频文件以及流式 TTS(通过 KittenTTS)。
- 语音代理支持:包含一个网关,用于与 Azure OpenAI Realtime 语音代理集成,以实现全双工对话。
- 资产管理:使用特定的基于 JSON 的角色格式来定义身体、眼睛和嘴巴图层。它包含一个基于 Codex 的“Skill”用于生成和验证这些资产。
- 模块化架构:将媒体获取、动作分析(PCMAnalyzer 和 MouthClassifier)与渲染分离,为未来扩展到 Live2D 或 3D 渲染器提供了可能性。
该工具包提供了一组示例角色和一个演示应用程序,以展示实时语音反应和本地音频播放。
评论
0 评分人数达到10人后显示
登录后参与讨论。