这个项目能做什么
COMSTAR 是一个面向家庭的常开具身 AI 终端,围绕树莓派 4 构建,配备 USB 摄像头、麦克风、小型 HDMI 显示屏和扬声器。它持续运行:当有人进入画面时,它会识别对方、以名字问候并等待;问题会由 3D 虚拟形象大声回答。一切都设计为在本地硬件上运行,不依赖云,也不需要 API 密钥。
该项目明确处于预 alpha 阶段。它是独立智能体编排引擎(基于 CrewAI、模型无关,具备动态规划、按任务 MCP 集成、SQLite 知识库、会话记忆和学习循环)的客户端/界面,通过 ao_reach SDK 访问,该 SDK 提供按会话临时创建的智能体和用于暴露本地工具的 WebSocket 反向隧道。
架构划分:树莓派负责采集和播放(摄像头抓取、麦克风、唤醒词、VAD、Chromium kiosk、音频播放),通过 Dart 桥接和 Python 音频组件实现。AI 服务器运行 CodeProject.AI 进行 YOLO 人员检测和人脸识别,还运行编排守护进程以及可选的语音边车(faster-whisper STT、Piper TTS)。桥接通过 HTTP 与 CodeProject.AI 通信,通过 HTTP/WS 与编排器通信;kiosk 渲染 SVG 虚拟形象,并通过本地 WebSocket 与桥接通信。
一个显著的设计元素是注意力模型,即一组状态阶梯(Ambient、Noticed、Engaged、Listening、Responding),每个状态有不同的成本和误报容忍度。状态转换由 YOLO 人员类别、返回已知 userid 的人脸匹配、唤醒词“hey comstar”、响应后的跟进窗口以及可选的人脸注意力(位于功能标志之后)触发。身份会选择编排会话及其记忆,因此按人区分的上下文自然获得。
README 记录了硬件建议(包括强烈建议使用波束成形麦克风阵列而非网络摄像头麦克风)、软件栈表、仓库布局、先决条件、安装步骤、YAML 配置示例、摄像头/麦克风/扬声器/STT/TTS 的环境变量、通过 CodeProject.AI HTTP 调用进行人脸注册、使用合成音频通过 openWakeWord 进行唤醒词训练、MCP 拓扑、目标低于 15 秒(理想低于 6 秒)的延迟预算,以及详细的隐私模型,涵盖本地采集、瞬时摄像头帧、存储在用户自己服务器上的人脸描述符、会话范围内的转录、明确选择加入的文本通道例外,以及推荐的硬件终止开关。路线图涵盖从首次接触到分发和家庭自动化集成的四个阶段。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。