Sobre o projeto

A YouTube Transcript API é uma biblioteca Python para buscar transcrições e legendas de vídeos do YouTube. Ao contrário de soluções baseadas em Selenium, ela não requer um navegador headless, sendo leve e fácil de implantar. Funciona tanto com legendas criadas manualmente quanto com legendas geradas automaticamente. A instalação é simples via pip: `pip install youtube-transcript-api`. A API principal fornece uma classe `YouTubeTranscriptApi` com um método `fetch()` que aceita um ID de vídeo do YouTube (não a URL completa). Ele retorna um objeto `FetchedTranscript` contendo um array de trechos, cada um com texto, horário de início e duração. O resultado é iterável, indexável e tem comprimento. Principais funcionalidades: - Buscar transcrições em idiomas específicos passando um parâmetro `languages` como uma lista de códigos de idioma (ex: `['de', 'en']`). - Preservar formatação HTML como itálico e negrito com `preserve_formatting=True`. - Listar todas as transcrições disponíveis para um vídeo via `list()`, depois filtrar por idioma ou tipo de transcrição (criada manualmente vs. gerada automaticamente). - Traduzir transcrições existentes para outros idiomas usando o método `translate()` em um objeto `Transcript`. - Formatar a saída para JSON, SRT, WebVTT, CSV ou texto simples por meio de formatadores integrados no submódulo `formatters`. - Uma ferramenta CLI (`youtube_transcript_api`) para uso via linha de comando, com opções para idiomas, formato de saída, tradução e exclusão de legendas geradas ou criadas manualmente. - Suporte a proxy para contornar bloqueios de IP de provedores de nuvem ou alto volume de solicitações, com proxies residenciais rotativos Webshare integrados ou configuração genérica de proxy HTTP/SOCKS. O projeto usa uma parte não documentada da API web do YouTube e traz um aviso de que pode parar de funcionar se o YouTube alterar sua implementação interna. Ele tem licença MIT e está disponível no PyPI.