Sobre o projeto

cuesift é um motor de triagem que seleciona apenas os itens que realmente precisam ser vistos por humanos nos resultados de tradução de legendas. Em vez de revisar todas as legendas, atribui pontuações de risco e coloca apenas aquelas acima de uma certa porcentagem ou limiar na fila de revisão, reduzindo custos e gargalos. **Principais funcionalidades** - Comandos CLI: `cuesift check` (verificação de padrão de legenda – comprimento da linha, CPS, sobreposição de tempo, etc., 7 tipos de violação), `cuesift translate` (tradução multilíngue usando LLM, aplicação automática de perfil de padrão por idioma de destino), `cuesift transcribe` (STT) - Triagem: imediatamente após a conclusão da tradução, os 9 sinais de Tier 0 (razão de comprimento, taxa de tradução, duplicidade, estrutura vazia, etc.) são usados para calcular o risco. Os parâmetros `--review-budget`, `--review-threshold`, `--review-top-k` permitem configurar a cota de revisão. - Tier 1: auto-consistência (medindo oscilação após re-tradução do mesmo segmento) e retrotradução (similaridade de embedding) para capturar erros de significado. Use `--tier1` junto com `--embed-model`. - Formatos de entrada e saída: suporte a SRT, WebVTT, ASS, SAMI. O nome do arquivo de saída segue a regra `{stem}.{idioma de destino}.{extensão}`, evitando tags de idioma duplicadas. - Cache: os resultados das chamadas de tradução são armazenados em `.cuesift/cache/` para reduzir custos de rede em execuções subsequentes. - Relatório de revisão: fornecido em formato JSON ou HTML. **Benchmark** Em um experimento de injeção de erros sintéticos usando o corpus TED2020, com um orçamento de 10%, o cuesift mostrou uma taxa de recall de captura de erros 7,32 vezes maior para en-ko e 7,56 vezes maior para ja-ko em comparação com seleção aleatória. No entanto, isso se baseia em erros sintéticos; a correspondência com erros reais de tradução ainda não foi validada. Erros de negação (negação) são raramente capturados apenas por sinais determinísticos, confirmando a necessidade do Tier 1. **Estado atual** Está na fase pré-alpha: o motor de sinais de Tier 0 e os comandos CLI foram implementados e medidos. O sinal de retrotradução do Tier 1 funciona, mas a lógica de seleção de candidatos está incompleta. O uso em produção não é recomendado até a estabilização oficial.