इस प्रोजेक्ट के बारे में
TurboFieldfare एक मॉडल-विशिष्ट इन्फरेंस रनटाइम है जो Swift और Metal में लिखा गया है, जो Apple Silicon Macs पर इंस्ट्रक्शन-ट्यून्ड Gemma 4 26B-A4B मॉडल चलाने के लिए बनाया गया है, जिसमें 8 GB मशीनें भी शामिल हैं। पूरे ~14.3 GB चेकपॉइंट को लोड करने के बजाय, यह साझा कोर और FP16 KV कैश को रेसिडेंट रखता है (लगभग 2 GB वेट्स प्लस 4K KV कैश) और प्रति टोकन आवश्यक एक्सपर्ट्स को SSD से एक सीमित एक्सपर्ट कैश के माध्यम से स्ट्रीम करता है।
इसमें शामिल है:
- एक Swift लाइब्रेरी जिसमें क्वांटाइज़्ड GEMV, अटेंशन, MoE, नॉर्मलाइज़ेशन, RoPE, सैंपलिंग और फ्यूज़न के लिए कस्टम Metal कर्नेल हैं।
- एक नेटिव SwiftUI/AppKit Mac ऐप जिसके साथ एक सहायक लोकल डिकोड सेवा है।
- इंस्ट्रक्शन चैट और रॉ कम्पलीशन के लिए एक कमांड-लाइन इंटरफ़ेस।
- एक स्ट्रीमिंग इंस्टॉलर/रीपैकर जो पिन किए गए Hugging Face बाइट रेंज फ़ेच करता है और सीधे .gturbo लेआउट लिखता है, साथ ही इंस्टॉल वेरिफिकेशन और रिज़्यूम सपोर्ट।
- एक प्रयोगात्मक लूपबैक OpenAI-संगत Chat Completions सर्वर जो स्ट्रीमिंग, फ़ंक्शन-टूल घोषणाओं और सिंगल-प्रीफ़िक्स प्रॉम्प्ट रीयूज़ का समर्थन करता है; इसमें कोई रिमोट ऑथेंटिकेशन या TLS नहीं है।
- वैकल्पिक इमेज इनपुट एक अलग से इंस्टॉल किए गए विज़न कंपेनियन पैक (लगभग 1.1 GB) के माध्यम से, जिसके लिए M2 या नए हार्डवेयर की आवश्यकता है; टेक्स्ट-ओनली इन्फरेंस M1 पर काम करता है।
वेट्स MLX affine 4-bit (ग्रुप 64) हैं जिनमें 8-bit राउटर है। प्रॉम्प्ट प्रीफ़िल चंक्ड है (128 टोकन तक) ताकि फ़ेच किए गए एक्सपर्ट्स कई पंक्तियों की सेवा कर सकें, इसके बाद टोकन-दर-टोकन जनरेशन होता है। README में 8 GB M2 MacBook Air पर 5.1-6.3 tok/s और 24 GB M5 Pro पर 31-35 tok/s का मापा गया डिकोड रिपोर्ट किया गया है, यह देखते हुए कि ये प्रॉम्प्ट लंबाई, पेज-कैश स्थिति और हार्डवेयर पर निर्भर करते हैं। आवश्यकताएँ हैं macOS 26 with Metal 4, Xcode 26 और Swift 6.2 या नया, केवल arm64। ऑडियो और वीडियो इसके दायरे से बाहर हैं। सोर्स Apache 2.0 है; मॉडल वेट्स अलग से उनकी अपनी शर्तों के तहत डाउनलोड किए जाते हैं, और प्रोजेक्ट बताता है कि यह Google से स्वतंत्र है।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.