عن المشروع

rizzo-pii أداة محلية وقابلة للعكس لإخفاء هوية البيانات الشخصية، موجهة إلى المستندات القانونية والمهنية الإيطالية. جوهرها هو rizzo-pii:0.3B، وهو نموذج لتصنيف الرموز (token classification) بعمود فقري mmBERT/ModernBERT (نحو 0.3B معامل) يعمل على CPU بذاكرة تقارب 0.5 GB ولا يحتاج إلى مفتاح API أو اتصال بالشبكة. سير العمل هو: إخفاء الهوية محلياً، واستبدال كل نطاق مكتشف بعنصر نائب ثابت واعٍ بالنوع مثل [FULLNAME_1] أو [IBAN_1]، والاحتفاظ بخريطة العنصر النائب إلى القيمة في قاموس محلي، وإرسال النص الذي يحتوي على العناصر النائبة فقط إلى نموذج LLM متقدم، ثم استعادة القيم الحقيقية محلياً من الإجابة. القيم المتطابقة تتشارك العنصر النائب نفسه، فيبقى النص متماسكاً بالنسبة للنموذج البعيد. يتنبأ النموذج بـ 22 نوع كيان بصيغة BIO، تشمل الأسماء والتواريخ والعناوين وبيانات الاتصال وIBAN وبطاقات الائتمان والمبالغ ولوحات المركبات والمؤسسات ومعرّفات المستندات والبيانات العقارية (cadastral). خمس وسوم إيطالية قانونية (CF وPIVA وCATASTO وDOCID وPROVINCE) مُبرزة كمعرّفات لا تغطيها نماذج مفتوحة أخرى؛ وقد أُنشئت عبر التوليف مع مجاميع تحقق صحيحة. ويضيف التطبيق وسم URL يُعالج بتعبير نمطي (regex) فقط. يجمع الكشف بين النموذج العصبي وطبقة حتمية من التعبيرات النمطية ومجاميع التحقق للمعرّفات المهيكلة (البريد الإلكتروني والهاتف وIBAN وCF وPIVA وبطاقة الائتمان والمبلغ ولوحة المركبة)، حيث تتجاوز مجاميع التحقق الصحيحة النموذج. ويوفر التطبيق عناصر نائبة ثابتة، وقاموساً محلياً قابلاً للتنزيل، وتبويب استعادة يتحمل التباين في التنسيق، وتقسيم النصوص الطويلة مع تداخل لملفات PDF الطويلة، وواجهة ملوّنة لكل وسم. استُخدم في التدريب تجمّع متعدد اللغات بنحو 745 ألف صف مُوسَّم، مع تعزيز الإيطالية إلى نحو 45%، جُمع من مصادر حقيقية واصطناعية وأُعيد تعيينه إلى الوسوم الـ22 عند التحميل. تتبع البيانات الاصطناعية نهج "مؤلّف من LLM، وموسِّم بالكود": يكتب LLM نثراً قانونياً إيطالياً مع عناصر نائبة، ويحقن الكود قيماً صحيحة، فتكون الوسوم دقيقة ولا تُنتَج أي بيانات شخصية حقيقية. جرى التدريب لحقبة واحدة على GPU استهلاكية واحدة بسعة 16 GB. تشمل النتائج المُبلَّغ عنها على معيار إيطالي حقيقي محجوز من 7000 صف: دقة micro 0.987، واستدعاء micro 0.990، وF1 micro 0.989، ودقة الرموز 0.998، مع macro-F1 0.987 عبر الوسوم الـ22. يذكر README أن جميع المعرّفات الإيطالية القانونية الخمسة سجّلت 1.000، بينما تشمل الفئات الأكثر صعوبة ZIPCODE وCREDITCARDNUMBER وSTREET وCITY وORG. تشمل خيارات النشر تطبيق سطح مكتب Tauri يضم sidecar بلغة Python/Flask يعمل على CPU، وصورة Docker مكتفية ذاتياً تعمل على CPU فقط، وتشغيل تطبيق الويب من المصدر، وواجهة سطر أوامر (CLI) لمستند واحد، وواجهة HTTP بنقاط نهاية مثل /health و/analyze و/pdf و/preview. وتُتاح إصدارات جاهزة لنظام Windows وmacOS (Apple Silicon) وLinux AppImage. ويؤطّر المشروع تصميمه حول تقليل البيانات وفق GDPR والتوافق مع قانون الذكاء الاصطناعي الأوروبي، ويتضمن ملف PDF لتقرير تقني، ووثائق لمجموعة البيانات والتصنيف، وتعليمات البناء.