منصوبے کے بارے میں

rizzo-pii ایک مقامی، reversible PII گمنام کاری کا آلہ ہے جو اطالیوی قانونی اور پیشہ ورانہ دستاویزات کے لیے بنایا گیا ہے۔ اس کا مرکز rizzo-pii:0.3B ہے، ایک token-classification ماڈل جس کا backbone mmBERT/ModernBERT ہے (تقریباً 0.3B parameters) جو CPU پر تقریباً 0.5 GB RAM کے ساتھ چلتا ہے اور اسے کسی API key یا network access کی ضرورت نہیں۔ کام کا طریقہ یہ ہے: مقامی طور پر گمنام کریں، ہر detected span کو ایک مستحکم type-aware placeholder سے بدلیں جیسے [FULLNAME_1] یا [IBAN_1]، placeholder-to-value mapping کو مقامی dictionary میں رکھیں، صرف placeholder متن frontier LLM کو بھیجیں، پھر جواب سے اصل اقدار کو مقامی طور پر بحال کریں۔ یکساں اقدار ایک ہی placeholder شیئر کرتی ہیں تاکہ متن remote model کے لیے مربوط رہے۔ ماڈل BIO format میں 22 entity types پیش گوئی کرتا ہے، جن میں نام، تاریخیں، پتے، رابطے کی تفصیلات، IBAN، کریڈٹ کارڈز، رقوم، پلیٹیں، تنظیمیں، دستاویزی شناخت کنندگان اور cadastral ڈیٹا شامل ہیں۔ پانچ اطالیوی-قانونی tags (CF، PIVA، CATASTO، DOCID، PROVINCE) کو ایسے شناخت کنندگان کے طور پر نمایاں کیا گیا ہے جو دیگر open models میں شامل نہیں؛ یہ valid checksums کے ساتھ synthesis کے ذریعے بنائے گئے ہیں۔ ایپ ایک URL tag بھی شامل کرتی ہے جو صرف regex سے handled ہے۔ Detection neural model کو deterministic regex اور checksum layer کے ساتھ جوڑتا ہے برائے structured identifiers (email، phone، IBAN، CF، PIVA، credit card، amount، plate)، جہاں valid checksums ماڈل کو override کرتے ہیں۔ ایپ مستحکم placeholders، downloadable local dictionary، formatting drift کے لیے tolerant restore tab، طویل PDFs کے لیے overlap کے ساتھ chunking، اور colored per-tag interface فراہم کرتی ہے۔ Training میں تقریباً 745k labeled rows کا multilingual pool استعمال ہوا، جس میں اطالیوی کو تقریباً 45% تک مضبوط کیا گیا، جو real اور synthetic sources سے جمع کیا گیا اور load time پر 22 tags میں remapped کیا گیا۔ Synthetic data "LLM author, code labeler" کے طریقے کی پیروی کرتا ہے: ایک LLM placeholders کے ساتھ اطالیوی قانونی نثر لکھتا ہے اور code valid values inject کرتا ہے، اس لیے labels exact ہوتے ہیں اور کوئی حقیقی ذاتی ڈیٹا پیدا نہیں ہوتا۔ Training ایک epoch کے لیے ایک 16 GB consumer GPU پر چلی۔ 7,000-row held-out real Italian benchmark پر reported نتائج میں micro precision 0.987، micro recall 0.990، micro F1 0.989 اور token accuracy 0.998 شامل ہیں، 22 tags میں macro-F1 0.987 کے ساتھ۔ README بتاتا ہے کہ تمام پانچ اطالیوی-قانونی identifiers نے 1.000 اسکور کیا، جبکہ softer classes میں ZIPCODE، CREDITCARDNUMBER، STREET، CITY اور ORG شامل ہیں۔ Deployment کے اختیارات میں ایک Tauri desktop app شامل ہے جو Python/Flask CPU sidecar کو bundle کرتی ہے، ایک self-contained CPU-only Docker image، source سے web app چلانا، single documents کے لیے CLI، اور HTTP API جس میں /health، /analyze، /pdf اور /preview جیسے endpoints ہیں۔ Prebuilt Windows، macOS (Apple Silicon) اور Linux AppImage releases پیش کیے جاتے ہیں۔ پروجیکٹ اپنے ڈیزائن کو GDPR data minimization اور EU AI Act alignment کے گرد ترتیب دیتا ہے، اور ایک technical report PDF، dataset اور taxonomy documentation، اور build instructions شامل کرتا ہے۔