منصوبے کے بارے میں

cuesift ایک ٹریاج انجین ہے جو سابٹائلٹ ترجمہ کے نتائج میں سے صرف وہ آئٹمز منتخب کرتا ہے جو شخص کے لیے ضروری ہیں۔ مکمل سابٹائلٹ کی جائزہ लेने کی بجائے، خطرے کی punteج (خطرے کی امتیاز) دی جاتی ہے اور صرف اعلیٰ定率 یا حد سے اوپر کے آئٹمز کو سیکرن کیو میں ڈال کر لاگت اور بٹनेक کم کیا جاتا ہے۔ **مهم خصوصیات** - CLI 명령어: `cuesift check` (سابٹائلٹ معیار جائزہ – لائن لمبائی، CPS، وقت کی overlap وغیرہ 7 قسم کی خلاف ورزی)، `cuesift translate` (LLM استعمال کر کے متعدد زبانوں کا ترجمہ، هدف زبان کے مخصوص معیار پروفائل خودکار طور پر لاگو)، `cuesift transcribe` (STT) - ٹریاج: ترجمہ مکمل ہونے کے بعد فوراً Tier 0 کے 9 سگنال (لمبائی کا 비율، ترجمہ 비율، doppelt، ساخت خالی وغیرہ) سے خطرے کا حساب لگایا جاتا ہے۔ `--review-budget`، `--review-threshold`، `--review-top-k` وغیرہ کے ذریعے 검수 쿼터 (مراجعت کی مقدار) سیٹ کی جاتی ہے۔ - Tier 1: خود‑یکسانی (ایک ہی سگمنٹ کی دوبارہ ترجمہ کے بعد ہلاؤ ناپنا) اور معکوس ترجمہ (امبیڈنگ Similarity) کے ذریعے معنی کی غلطیوں کا پکڑا جاتا ہے۔ `--tier1` اور `--embed-model` کو ساتھ استعمال کیا جاتا ہے۔ - Input‑Outputフォーマٹ: SRT, WebVTT, ASS, SAMI سپورٹ کیا جاتا ہے۔ Output file name `{stem}.{대상언어}.{확장자}` کے नियम کی پالندی کی جاتی ہے،duplicate language tags ko rokne ke liye. - کیش: ترجمہ کال کے نتائج `.cuesift/cache/` میں محفوظ کیے جاتے ہیں تاکہ دوبارہ چلانے پر نیٹ ورک لاگت کم ہو۔ - 검수 리포트: JSON یا HTML شکل میں فراہم کی جاتی ہے۔ **بینچمارک** TED2020 کارپورس کا استعمال کرتے ہوئے مصنوعی خرابی انجیکشن تجربے میں، 10% بجٹ پر en-ko 7.32 گنا، ja-ko 7.56 گنا بے‑ترتیب کے مقابلے میں خرابی پکڑنے کی شرح (Recall) دکھائی گئی۔ باوجودِ، یہ صرف مصنوعی خرابی کے معیار پر مبنی ہے؛ واقعی ترجمہ خرابی کے ساتھ مطابقت کی todavía تصدیق نہیں ہوئی۔ معنی کا الٹنا (negation) خرابی صرف فیصلہ کن سگنالوں پر مبنی ہے تاکہ تقریباً نہیں پکڑی جاتی، جس سے Tier 1 کی ضرورت کی تصدیق ہوئی۔ **موجودہ حالت** pre-alpha مرحلہ میں، Tier 0 سگنال انجن اور CLI 명령어 مکمل طور پر تیار اور ٹیسٹ کیے گئے ہیں۔ Tier 1 معکوس ترجمہ سگنال کام کر رہا ہے لیکن امیدوار انتخاب لوجک مکمل نہیں ہے۔ رسمی استقرار تک، تولیدی استعمال کی تجویز نہیں کی جاتی۔