इस प्रोजेक्ट के बारे में

rizzo-pii एक लोकल, प्रतिवर्ती PII अनामीकरण टूल है जो इतालवी कानूनी और पेशेवर दस्तावेज़ों के लिए बनाया गया है। इसका मुख्य हिस्सा rizzo-pii:0.3B है, एक टोकन-वर्गीकरण मॉडल जिसका बैकबोन mmBERT/ModernBERT (लगभग 0.3B पैरामीटर) है, जो CPU पर करीब 0.5 GB RAM के साथ चलता है और इसे किसी API key या नेटवर्क एक्सेस की ज़रूरत नहीं होती। कार्यप्रवाह यह है: लोकल रूप से अनामीकरण करें, पाए गए प्रत्येक स्पैन को एक स्थिर, प्रकार-जागरूक प्लेसहोल्डर जैसे [FULLNAME_1] या [IBAN_1] से बदलें, प्लेसहोल्डर-से-मान मैपिंग को एक लोकल डिक्शनरी में रखें, केवल प्लेसहोल्डर पाठ किसी फ्रंटियर LLM को भेजें, और फिर उत्तर से असली मान लोकल रूप से बहाल करें। समान मान एक ही प्लेसहोल्डर साझा करते हैं ताकि दूरस्थ मॉडल के लिए पाठ सुसंगत रहे। मॉडल BIO प्रारूप में 22 एंटिटी प्रकारों का अनुमान लगाता है, जिनमें नाम, तिथियाँ, पते, संपर्क विवरण, IBAN, क्रेडिट कार्ड, राशियाँ, प्लेटें, संगठन, दस्तावेज़ पहचानकर्ता और कैडस्ट्रल डेटा शामिल हैं। पाँच इतालवी-कानूनी टैग (CF, PIVA, CATASTO, DOCID, PROVINCE) को ऐसे पहचानकर्ताओं के रूप में रेखांकित किया गया है जो अन्य ओपन मॉडलों में शामिल नहीं हैं; इन्हें वैध चेकसम के साथ संश्लेषण द्वारा बनाया गया है। ऐप एक URL टैग जोड़ता है जिसे केवल regex द्वारा संभाला जाता है। डिटेक्शन न्यूरल मॉडल को संरचित पहचानकर्ताओं (email, phone, IBAN, CF, PIVA, credit card, amount, plate) के लिए एक नियतात्मक regex और चेकसम परत के साथ जोड़ता है, जहाँ वैध चेकसम मॉडल को ओवरराइड करते हैं। ऐप स्थिर प्लेसहोल्डर, एक डाउनलोड करने योग्य लोकल डिक्शनरी, फ़ॉर्मैटिंग बदलावों के प्रति सहिष्णु एक रिस्टोर टैब, लंबे PDF के लिए ओवरलैप के साथ चंकिंग, और एक रंगीन प्रति-टैग इंटरफ़ेस प्रदान करता है। प्रशिक्षण में लगभग 745k लेबल किए गए पंक्तियों का बहुभाषी पूल इस्तेमाल हुआ, जिसमें इतालवी को लगभग 45% तक मजबूत किया गया, जिसे वास्तविक और संश्लेषित स्रोतों से जोड़ा गया और लोड के समय 22 टैग पर रीमैप किया गया। संश्लेषित डेटा "LLM author, code labeler" दृष्टिकोण का पालन करता है: एक LLM प्लेसहोल्डर के साथ इतालवी कानूनी गद्य लिखता है और कोड वैध मान इंजेक्ट करता है, इसलिए लेबल सटीक होते हैं और कोई वास्तविक व्यक्तिगत डेटा उत्पन्न नहीं होता। प्रशिक्षण एक 16 GB उपभोक्ता GPU पर एक epoch तक चला। 7,000 पंक्तियों के होल्ड-आउट वास्तविक इतालवी बेंचमार्क पर रिपोर्ट किए गए परिणामों में micro precision 0.987, micro recall 0.990, micro F1 0.989 और token accuracy 0.998 शामिल हैं, साथ ही 22 टैगों में macro-F1 0.987 है। README बताता है कि पाँचों इतालवी-कानूनी पहचानकर्ताओं ने 1.000 स्कोर किया, जबकि नरम श्रेणियों में ZIPCODE, CREDITCARDNUMBER, STREET, CITY और ORG शामिल हैं। तैनाती विकल्पों में एक Tauri डेस्कटॉप शामिल है जो Python/Flask CPU साइडकार को बंडल करता है, एक स्व-निहित CPU-only Docker इमेज, सोर्स से वेब ऐप चलाना, एकल दस्तावेज़ों के लिए एक CLI, और एक HTTP API जिसमें /health, /analyze, /pdf और /preview जैसे एंडपॉइंट हैं। पहले से बने Windows, macOS (Apple Silicon) और Linux AppImage रिलीज़ दिए गए हैं। परियोजना अपने डिज़ाइन को GDPR डेटा न्यूनीकरण और EU AI Act संरेखण के इर्द-गिर्द रखती है, और इसमें एक तकनीकी रिपोर्ट PDF, डेटासेट और टैक्सोनॉमी दस्तावेज़ीकरण, और बिल्ड निर्देश शामिल हैं।