프로젝트 소개

VideoLingo는 Netflix 품질의 자막을 제작하기 위한 종합적인 비디오 번역 및 더빙 도구입니다. 기계 번역의 일반적인 문제를 해결하기 위해 한 줄짜리 자막만 제공하고, 경직된 번역을 제거하며, 고품질의 더빙을 추가합니다. 주요 기능은 다음과 같습니다. - yt-dlp를 통한 YouTube 비디오 다운로드 - WhisperX(large-v3)를 통한 단어 수준 자막 인식, 로컬 또는 API로 실행 가능 - NLP 및 AI 기반 자막 분할 - 일관된 번역을 위한 사용자 정의 및 AI 생성 용어 - 영화급 번역 품질을 위한 3단계 Translate-Reflect-Adaptation 프로세스 - Netflix 표준의 한 줄 자막 출력 - GPT-SoVITS, Azure, OpenAI, Fish-TTS, Edge-TTS 및 사용자 정의 TTS 옵션을 통한 더빙 지원 - Streamlit 웹 UI를 통한 원클릭 시작 및 처리, 다국어 지원 - 사용자가 모든 단계에서 처리를 일시 중지, 재개 또는 중지할 수 있는 작업 제어 - 진행 상황 재개가 가능한 상세 로깅 - API 자동 가져오기 기능이 있는 모델 검색 상자로 제공업체의 전체 목록에서 모델 필터링 지원되는 입력 언어는 영어, 러시아어, 프랑스어, 일어, 이탈리아어, 스페인어, 일본어, 중국어입니다. 번역은 모든 언어를 지원하며, 더빙 언어는 선택한 TTS 방식에 따라 라집니다. 설치 옵션에는 자동 Python 환경 설정을 위한 uv(권장), Conda 또는 Docker 사용이 포함됩니다. 이 프로젝트는 LLM 통합을 위한 OpenAI 호환 API 형식과 다양한 TTS 인터페이스를 지원합니다. Ollama와 Edge-TTS를 사용하면 유료 API 없이 완전히 로컬에서 실행할 수 있습니다. 현재 한계에는 배경 소음으로 인한 WhisperX 전사 문제, 엄격한 JSON 형식 요구 사항으로 인한 약한 LLM의 오류, 말하기 속도 차이로 인한 불완전한 더빙, 다국어 비디오에서 주요 언어만 유지, 여러 화자를 개별적으로 더빙할 수 없음 등이 포함됩니다.