프로젝트 소개

YouTube Transcript API는 YouTube 영상에서 자막과 자막(또는 음성 인식 결과)을 가져오는 Python 라이브러리입니다. Selenium 기반 솔루션과 달리 헤드리스 브라우저를 사용하지 않아 가볍고 배포가 쉽습니다. 수동で作成된 자막과 자동 생성 자막 모두 작동합니다. 설치는 pip로 간단히 가능합니다: `pip install youtube-transcript-api` 핵심 API는 `YouTubeTranscriptApi` 클래스를 제공하며, `fetch()` 메서드는 YouTube 영상 ID(전체 URL 아님)를 받아 텍스트, 시작 시간, 길이를 포함한Snippet 배열을 반환하는 `FetchedTranscript` 객체를 반환합니다. 이 결과는 반복, 인덱싱, 길이 측정이 모두 가능합니다. 주요 기능은 다음과 같습니다: - `languages` 매개변수에 언어 코드 리스트(예: `['de', 'en']`)를 전달해 특정 언어로 자막 가져오기 - `preserve_formatting=True` 옵션으로 이탤릭체나 굵은 글씨 같은 HTML 형식 보존 - `list()`를 통해 영상의 모든 사용 가능한 자막 목록 확인, 언어 또는 자막 유형(수동作成 vs 자동생성) 필터링 - `Transcript` 객체에서 `translate()` 메서드를 사용해 기존 자막을 다른 언어로 번역 - `formatters` 서브모듈 내장 포매터를 이용해 JSON, SRT, WebVTT, CSV, 일반 텍스트 형식으로 출력 - 언어, 출력 형식, 번역, 자동생성자막 제외 등 설정 가능한 CLI 도구(`youtube_transcript_api`) 제공 - 클라우드 제공업체 IP 차단이나 다중 요청에 대응하기 위한 프록시 지원(Webshare 회전 거주형 프록시 내장 또는 일반 HTTP/SOCKS 프록시 구성) 이 프로젝트는 YouTube 웹 클라이언트 API의 비공식적 요소를 사용하므로, YouTube 내부 구현 변경 시 작동하지 않을 수 있음에 주의해야 합니다. MIT 라이선스 하에 PyPI에서 이용 가능합니다.