عن المشروع

cuesift هو محرك تriage يختار فقط العناصر التي يجب على الإنسان مراجعتها حقًا من نتائج ترجمة الترجمات، بدلاً من فحص كامل الترجمات، حيث يتم تعيين درجة خطر ويتم وضع العناصر التي تتجاوز نسبة معينة أو عتبة معينة فقط في قائمة المراجعة لتقليل التكلفة والازدحام. **الميزات الرئيسية** - أوامر CLI: `cuesift check` (فحص مواصفات الترجمة – طول السطر، CPS، overlap الزمني وغيرها من 7 أنواع انتهاكات)، `cuesift translate` (ترجمة متعددة اللغات باستخدام LLM، تطبيق ملف تعريف المواصفات تلقائيًا لكل لغة هدف)، `cuesift transcribe` (STT) - التriage: بعد إتمام الترجمة مباشرةً، تُحسب درجة الخطر باستخدام 9 إشارات من المستوى 0 (نسبة الطول، معدل الترجمة، التكرار، الهيكل الفارغ وما إلى ذلك). يمكن تعيين حصة المراجعة عبر `--review-budget`، `--review-threshold`، `--review-top-k` وما شابه. - المستوى 1: يتم اكتشاف الأخطاء الدلالية من خلال الاتساق الذاتي (إعادة ترجمة نفس القطعة وقياس التذبذب) والترجمة العكسية (تشابه التضمين). يُستخدم `--tier1` совместно مع `--embed-model`. - تنسيقات الإدخال والإخراج: يدعم SRT، WebVTT، ASS، SAMI. يتبع اسم ملف الإخراج القاعدة `{stem}.{اللغة الهدف}.{الامتداد}` لتجنب duplicate علامات اللغة. - التخزين المؤقت: يتم حفظ نتائج استدعاءات الترجمة في `.cuesift/cache/` لتقليل تكلفة الشبكة عند إعادة التشغيل. - تقرير المراجعة: يُقدَّم بصيغة JSON أو HTML. **المقارنة المعيارية** في تجربة حقن أخطاء اصطناعية باستخدام مجموعة TED2020، أظهر الميزانية بنسبة 10% نسبة استدعاء (Recall) للكشف عن الأخطاء تبلغ 7.32 ضعفًا للزوج en-ko و7.56 ضعفًا للزوج ja-ko مقارنة بالاختيار العشوائي. ومع ذلك، فإن هذا يعتمد على أخطاء اصطناعية ولا يزال التوافق مع أخطاء الترجمة الفعلية غير مثبت. أخطاء negation (معكوس المعنى) لا تُكتَشف تقريبًا بالإشارات الحتمية فقط، مما يؤكد ضرورة المستوى 1. **الحالة الحالية** ما زال في مرحلة pre-alpha؛ تم تنفيذ وقياس محرك إشارة المستوى 0 وأوامر CLI بالكامل. إشارة المستوى 1 للترجمة العكسية تعمل لكن منطق اختيار المرشحين غير مكتمل. لا يُوصى باستخدامه في الإنتاج حتى الاستقرار الرسمي.