프로젝트 소개
Omi는 사용자의 화면 활동과 주변 음성 대화를 지속적으로 캡처함으로써 개인용 AI '두 번째 뇌' 역할을 합니다. Deepgram을 통한 실시간 전사, 음성 활동 감지(VAD), 화자 분리, 그리고 대규모 언어 모델을 사용하여 요약을 생성하고 실행 항목을 추출하며 컨텍스트 인식 채팅 기록을 유지합니다. 이 시스템은 macOS, Windows, iOS, Android 및 맞춤형 웨어러블 하드웨어(Omi Wearable 및 Omi Glass)에서 실행됩니다. 백엔드는 FastAPI, Firebase, Redis 및 GPU 가속 음성 처리를 사용하는 Python 기반입니다. 모바일 앱은 Flutter로 구축되며, macOS 앱은 Swift/SwiftUI와 로컬 Python 백엔드를 결합합니다. 오픈소스 SDK는 BLE 및 WebSocket 프로토콜을 통해 다국어 디바이스 통합을 지원합니다. 하드웨어 설계는 DIY 조립을 위해 공개되었습니다. 이 프로젝트는 개발, API 사용, 앱 빌드 및 하드웨어 플래싱에 대한 문서를 포함합니다. MIT 라이선스로 배포되며 30만 명 이상의 전문가에게 신뢰받고 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.