Sobre o projeto

OpenClip é uma ferramenta automatizada de processamento de vídeo baseada em Python, FFmpeg e uv, usada principalmente para identificar e exportar clipes de destaque de vídeos longos, como narrações, replays de lives, entrevistas e podcasts. Após o usuário informar uma URL de vídeo ou um arquivo local, o fluxo inclui download ou validação do vídeo, obtenção de legendas da plataforma ou transcrição local de voz, divisão do vídeo longo, análise por IA e consolidação de clipes candidatos, geração da edição, criação de arquivos de legenda, geração de imagem de capa e, opcionalmente, adição de título e gravação de legendas no vídeo. Os principais recursos são: - Suporte a links de vídeo do Bilibili e YouTube e a arquivos locais; no Streamlit, também é possível enviar arquivos pelo navegador. - Na transcrição, as legendas da plataforma têm prioridade; o ASR local pode ser roteado por idioma, usando Whisper para inglês e Paraformer como opção para chinês, com retorno para Whisper quando indisponível. - A IA seleciona os destaques com base em dimensões como conteúdo, interatividade e valor de entretenimento, e o parâmetro --user-intent permite especificar o tópico de interesse em linguagem natural; também é possível adicionar contexto sobre o apresentador e usar modelos personalizados de prompt. - Suporte a parâmetros como quantidade de clipes, predefinições de duração, estilo de título, tamanho de fonte e posição e cor do texto da capa. - Gera automaticamente clipes independentes, legendas SRT, resumos em Markdown e imagens de capa. - Modo opcional de otimização profunda, que adiciona revisão por IA, correção de limites e nova revisão após a consolidação dos clipes candidatos, melhorando a independência de cada trecho. - Gravação opcional de legendas diretamente no vídeo, exigindo FFmpeg com libass; também é possível traduzir e gravar legendas bilíngues usando o LLM selecionado. - A versão preliminar de identificação de faladores pode rotular nomes com base em áudios de referência, sendo adequada a conversas com várias pessoas; exige a instalação adicional das dependências speakers e configuração de um HuggingFace Token. - O Clip Editor de pós-processamento permite ajustar limites individuais, legendas e títulos de capa, além de rerenderizar com velocidade alterada. A ferramenta oferece três interfaces: a interface web do Streamlit suporta tarefas em segundo plano, múltiplas tarefas concorrentes, persistência de tarefas, acompanhamento de progresso, configuração do modo Cookie e acesso pela rede local; a CLI é adequada para processamento em scripts; as Agent Skills podem ser chamadas por agentes compatíveis, como Claude Code, TRAE e Cursor, permitindo iniciar tarefas de processamento de vídeo em linguagem natural. As interfaces de IA suportam Qwen, OpenRouter, Zhipu GLM, MiniMax e endpoints personalizados compatíveis com a API da OpenAI, podendo conectar serviços como LM Studio, vLLM, One API e New API. O download remoto suporta três modos: sem cookies, cookies do navegador e cookies.txt no formato Netscape; em alguns cenários do YouTube, é recomendado instalar Deno ou Node. Os resultados são salvos por padrão em processed_videos e organizados em diretórios como downloads, splits, clips e clips_post_processed. O projeto usa licença MIT.