프로젝트 소개

VideoCaptioner는 대형 언어 모델(LLM) 기반의 비디오 자막 처리 도구로, 음성 인식, 자막 최적화, 번역, 비디오 합성 전 과정을覆盖합니다. 설치는 pip install videocaptioner로 가능하며, CLI 명령과 GUI 데스크톱 버전 두 가지 사용 방식을 제공합니다. 핵심 기능은 다음과 같습니다: - 음성 전사: faster-whisper, whisper-api, bijian(료), jianying(무료), whisper-cpp 등 다양한 엔진을 지원하며, 단어 단위 타임스탬프와 VAD 음성 활동 감지를 활용해 인식 정확도를 높입니다. - 자막 최적화 및 번역: LLM을 활용한 의미 이해 기반 문장 분할로 자연스러운 자막 읽기 경을 제공합니다. 번역은 LLM, bing(무료), google(무료) 등을 지원하며, 문맥 인식 번역과 자기 점검 최적화 메커니즘을 갖추고 있습니다. - 비디오 합성: 자막을 소프트 자막 또는 하드 자막 형태로 비디오에 굽기(burn-in)할 수 있습니다. - 더빙 생성: 자막을 바탕으로 더빙 오디오 트랙이나 더빙 비디오를 생성할 수 있습니다. - 온라인 비디오 다운로드: YouTube, Bilibili 등 플랫폼을 지원합니다. - 전 과정 처리: 하나의 명령어로 전사→최적화→번역→합성을 완료할 수 있습니다. 무료 기능(必剪 음성 인식, Bing/Google 번역)은 별도 설정 없이 바로 사용할 수 있습니다. LLM 기능(자막 최적화, 대형 모델 번역)은 API Key 설정이 필요하며, VideoCaptioner 중계 서버, SiliconCloud, DeepSeek 등 OpenAI 호환 인터페이스를 모두 지원합니다. 설정 우선위는 명령줄 인수 > 환경 변수 > 설정 파일 > 기본값입니다. 또한 프로젝트는 Claude Code Skill을 제공하여 AI 프로그래밍 어시스턴트가 VideoCaptioner를 직접 호출해 비디오를 처리할 수 있게 니다. 개발 측면에서는 uv로 의존성을 관리하며, pyright 타입 검사와 pytest 테스트를 지원합니다. 프로젝트는 GPL-3.0 라이선스를 채택하고 있습니다.