这个项目能做什么

Omi 作为个人 AI '第二大脑',通过持续捕获用户屏幕活动和环境音频对话来运作。它使用实时转录(通过 Deepgram)、语音活动检测(VAD)、说话人分离以及大型语言模型来生成摘要、提取行动项,并维持上下文感知的聊天历史记录。该系统可在 macOS、Windows、iOS、Android 以及定制的可穿戴硬件(Omi Wearable 和 Omi Glass)上运行。后端基于 Python,使用 FastAPI、Firebase、Redis 和 GPU 加速的音频处理。移动端应用采用 Flutter 构建;macOS 应用结合 Swift/SwiftUI 与本地 Python 后端。开源 SDK 通过 BLE 和 WebSocket 协议支持多语言设备集成。硬件设计已公开,供 DIY 组装。项目提供开发、API 使用、应用构建和硬件刷写的文档。其许可证为 MIT,并获得超过 30 万专业人士的信任。