इस प्रोजेक्ट के बारे में

Magika Google का एक AI-संचालित फ़ाइल प्रकार पहचान उपकरण है जो फ़ाइल सामग्री प्रकारों की पहचान करने के लिए एक कॉम्पैक्ट डीप लर्निंग मॉडल (केवल कुछ MB) का उपयोग करता है। README के अनुसार, इसे लगभग 100 मिलियन नमूनों पर प्रशिक्षित और मूल्यांकित किया गया था, जिसमें 200 से अधिक सामग्री प्रकार शामिल हैं, जिनमें बाइनरी और टेक्स्टुअल दोनों प्रारूप शामिल हैं, और इसके परीक्षण सेट पर लगभग 99% औसत परिशुद्धता और रिकॉल की सूचना देता है। मॉडल लोड होने के बाद एकल CPU पर प्रति फ़ाइल अनुमान में लगभग 5ms लगते हैं, और फ़ाइल आकार की परवाह किए बिना समय लगभग स्थिर रहता है क्योंकि सामग्री का केवल एक सीमित हिस्सा उपयोग किया जाता है। यह प्रोजेक्ट Rust में लिखे गए कमांड लाइन टूल, Python API, और Rust, JavaScript/TypeScript (npm पैकेज के साथ जो ब्राउज़र-आधारित डेमो को चलाता है), और Go (कार्य प्रगति पर बताया गया) के लिए बाइंडिंग के रूप में वितरित किया जाता है। स्थापना विकल्पों में pipx, Homebrew, Unix और PowerShell के लिए एक इंस्टॉलर स्क्रिप्ट, cargo, pip, और npm शामिल हैं। CLI रिकर्सिव स्कैनिंग, मानक इनपुट से पढ़ने, JSON और JSONL आउटपुट, कस्टम आउटपुट प्रारूप, MIME प्रकार और लेबल आउटपुट, और स्कोर प्रिंटिंग का समर्थन करता है। यह उच्च-विश्वास, मध्यम-विश्वास, और सर्वोत्तम-अनुमान जैसे भविष्यवाणी मोड भी प्रदान करता है, साथ ही एक प्रति-सामग्री-प्रकार थ्रेशोल्ड प्रणाली जो मॉडल के आश्वस्त न होने पर "Generic text document" या "Unknown binary data" जैसे सामान्य लेबल लौटा सकती है। README में कहा गया है कि Magika का उपयोग Google के अंदर बड़े पैमाने पर Gmail, Drive, और Safe Browsing फ़ाइलों को उपयुक्त सुरक्षा और सामग्री नीति स्कैनर तक पहुंचाने के लिए किया जाता है, और इसे VirusTotal और abuse.ch के साथ एकीकृत किया गया है। एक वेब डेमो ब्राउज़र में स्थानीय रूप से चलता है। परियोजना Apache 2.0 के तहत लाइसेंस प्राप्त है और इसमें एक अस्वीकरण शामिल है कि यह आधिकारिक Google प्रोजेक्ट नहीं है।