À propos du projet
cuesift est un moteur de triage qui sélectionne, parmi les résultats de traduction de sous-titres, uniquement les éléments qu'un humain doit réellement examiner. Au lieu de vérifier l'intégralité des sous-titres, il attribue un score de risque et place en file d'attente de vérification uniquement les éléments dépassant un certain pourcentage ou seuil supérieur, afin de réduire les coûts et les goulets d'étranglement.
**Fonctionnalités principales**
- Commandes CLI : `cuesift check` (vérification de la conformité des sous-titres – longueur des lignes, CPS, chevauchement temporel, etc., 7 types de violations), `cuesift translate` (traduction multilingue via LLM, application automatique du profil de conformité propre à chaque langue cible), `cuesift transcribe` (STT)
- Triagage : immédiatement après la traduction, le score de risque est calculé à partir des neuf signaux de niveau Tier 0 (ratio de longueur, taux de traduction, duplication, structure vide, etc.). Le quota de vérification peut être défini grâce aux options `--review-budget`, `--review-threshold`, `--review-top-k`.
- Niveau Tier 1 : grâce à l'auto-consistance (mesure de la variation après re-traduction du même segment) et à la rétro-traduction (similarité d'embedding), les erreurs de sens sont détectées. Cette fonction s'active en utilisant conjointement les options `--tier1` et `--embed-model`.
- Formats d'entrée/sortie : prise en charge de SRT, WebVTT, ASS, SAMI. Le nom du fichier de sortie suit la règle `{stem}.{langue_cible}.{extension}` afin d'éviter les doublons de balises linguistiques.
- Mise en cache : les résultats des appels de traduction sont enregistrés dans le répertoire `.cuesift/cache/` afin de réduire les coûts réseau lors des réexécutions.
- Rapport de vérification : fourni aux formats JSON ou HTML.
**Benchmark**
Lors d'une expérience d'injection d'erreurs synthétiques sur le corpus TED2020, avec un budget de 10 %, nous avons obtenu un taux de rappel d'erreurs 7,32 fois supérieur pour l'anglais→coréen et 7,56 fois supérieur pour le japonais→coréen par rapport à une sélection aléatoire. Toutefois, ces résultats sont basés sur des erreurs synthétiques ; leur corrélation avec les erreurs de traduction réelles n'a pas encore été validée. Les erreurs de négation ne sont presque pas détectées par les seuls signaux déterministes, ce qui confirme la nécessité du niveau Tier 1.
**État actuel**
En phase pré‑alpha, le moteur de signaux de niveau Tier 0 et les commandes CLI sont entièrement implémentés et mesurés. Le signal de rétro‑traduction du niveau Tier 1 fonctionne, mais la logique de sélection des candidats reste incomplète. L'utilisation en production n'est pas recommandée avant la stabilisation officielle.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.