इस प्रोजेक्ट के बारे में

Omi लगातार उपयोगकर्ता स्क्रीन गतिविधि और परिवेशी ऑडियो बातचीत को कैप्चर करके एक व्यक्तिगत AI 'दूसरा दिमाग' के रूप में कार्य करता है। यह रीयल-टाइम ट्रांसक्रिप्शन (Deepgram के माध्यम से), आवाज़ गतिविधि पहचान (VAD), स्पीकर डायरीज़ेशन और बड़े भाषा मॉडल का उपयोग करके सारांश उत्पन्न करता है, एक्शन आइटम निकालता है और संदर्भ-परिचित चैट इतिहास बनाए रखता है। सिस्टम macOS, Windows, iOS, Android और कस्टम वेयरबल हार्डवेयर (Omi Wearable और Omi Glass) पर चलता है। बैकएंड Python-आधारित है, FastAPI, Firebase, Redis और GPU-त्वरित ऑडियो प्रोसेसिंग के साथ। मोबाइल ऐप Flutter से बनाए गए हैं; macOS ऐप Swift/SwiftUI को एक स्थानीय Python बैकएंड के साथ जोड़ता है। ओपन-सोर्स SDK BLE और WebSocket प्रोटोकॉल के माध्यम से बहुभाषी डिवाइस इंटीग्रेशन का समर्थन करते हैं। हार्डवेयर डिज़ाइन DIY असेंबली के लिए प्रकाशित किए गए हैं। परियोजना विकास, API उपयोग, ऐप बनाना और हार्डवेयर फ्लैशिंग के लिए दस्तावेज़ शामिल करती है। यह MIT लाइसेंस के तहत लाइसेंस प्राप्त है और 300,000 से अधिक पेशेवरों द्वारा विश्वसनीय माना जाता है।