Sobre o projeto

VideoCaptioner é uma ferramenta de processamento de legendas de vídeo baseada em grandes modelos de linguagem (LLM), cobrindo todo o fluxo de trabalho de reconhecimento de voz, otimização de legendas, tradução e composição de vídeo. A instalação é feita com pip install videocaptioner, e a ferramenta oferece duas formas de uso: linha de comando (CLI) e versão desktop com interface gráfica (GUI). Os principais recursos incluem: - Transcrição de voz: suporte a diversos mecanismos, como faster-whisper, whisper-api, bijian (gratuito), jianying (gratuito) e whisper-cpp, utilizando timestamps de nível de palavra e detecção de atividade de voz (VAD) para melhorar a precisão do reconhecimento. - Otimização e tradução de legendas: utiliza LLM para segmentação semântica das legendas, tornando a leitura mais natural e fluida; a tradução suporta serviços como LLM, bing (gratuito) e google (gratuito), com tradução sensível ao contexto e mecanismo de reflexão e otimização. - Composição de vídeo: suporte à inserção de legendas em formato softsub ou hardsub no vídeo. - Geração de dublagem: possibilidade de gerar faixas de áudio ou vídeos dublados com base nas legendas. - Download de vídeos online: suporte a plataformas como YouTube e Bilibili. - Processamento completo do fluxo: um único comando realiza transcrição → otimização → tradução → composição. As funcionalidades gratuitas (reconhecimento de voz do Bijian, tradução do Bing/Google) podem ser usadas sem nenhuma configuração. As funcionalidades baseadas em LLM (otimização de legendas e tradução por modelo grande) exigem a configuração de uma API Key, com suporte a todas as interfaces compatíveis com OpenAI, incluindo VideoCaptioner Relay, SiliconCloud, DeepSeek e outras. A ordem de prioridade das configurações é: parâmetros de linha de comando > variáveis de ambiente > arquivo de configuração > valores padrão. Além disso, o projeto oferece o Claude Code Skill, permitindo que assistentes de programação com IA invoquem diretamente o VideoCaptioner para processar vídeos. No desenvolvimento, são utilizados o uv para gerenciamento de dependências, com suporte a verificação de tipos via pyright e testes via pytest. O projeto é licenciado sob GPL-3.0.