프로젝트 소개
Video-subtitle-extractor(VSE)는 비디오에 내장된 하드 자막을 외부 자막 파일(SRT 또는 TXT)로 추출하는 오픈소스 도구입니다. Apache 2.0 라이선스로 배포되며 Python 3.12+ 기반으로 개발되었고 Windows, macOS, Linux 세 가지 플랫폼을 지원합니다.
핵심 처리流程는 비디오에서 키 프레임 추출, 프레임 내 텍스트 위치 감지, 텍스트 내용 인식, 비자막 영역 필터링, 중복 자막 행 제거, 최종적으로 시간축에 맞춘 SRT 자막 파일 출력으로 구성됩니다. 프로젝트에는 워터마크, 방송국 로고, 원본 비디오의 하드 자막을 제거하는 데 사용할 수 있는 video-subtitle-remover(VSR)도 함께 제공됩니다.
주요 기능:
- 완전 로컬 OCR로 Baidu, Alibaba 등 타사 온라인 OCR API를 신청하거나 호출할 필요가 없어 프라이버시와 비용을 더 효과적으로 관리할 수 있습니다.
- GPU 가속(CUDA, DirectML, ONNX) 및 순수 CPU 실행을 지원하며 NVIDIA, AMD, Intel, Apple Silicon 등 다양한 하드웨어를 포괄합니다.
- 세 가지 인식 모드를 제공합니다: 빠름(경량 모델, 속도는 빠르지만 일부 글자 누락 또는 오타 가능), 자동(하드웨어에 따라 모델 자동 선택, 권장), 정밀(프레임별 감지, 거의 글자 누락이 없지만 속도가 매우 느림).
- 간체 중국어, 번체 중국어, 영어, 일본어, 한국어, 베트남어, 아랍어, 프랑스어, 독일어, 러시아어, 스페인어, 포르투갈어, 이탈리아어 등 87개 언어의 자막 추출을 지원합니다.
- 배치 추출을 지원하며, 같은 배치의 비디오는 해상도와 자막 영역이 동일해야 합니다.
- typoMap.json 설정을 제공하여 인식 결과에 대해 텍스트 치환 또는 전체 구간 삭제를 수행할 수 있습니다. 예를 들어 '威筋'을 '威胁'로 바꾸거나 '性感荷官在线发牌' 같은 광고 텍스트를 비울 수 있습니다.
- GUI 그래픽 인터페이스(python gui.py)와 CLI 명령줄(python ./backend/main.py) 두 가지 사용 방식을 제공하며, GUI에서는 자막 영역을 직접 선택한 후 원클릭으로 실행할 수 있습니다.
배포 측면에서 프로젝트는 Release 압축 패키지를 제공하여 바로 압축 해제 후 실행할 수 있습니다. 소스 설치 시 먼저 Python 가상 환경을 만든 후 하드웨어에 따라 CUDA 11.8 + cuDNN 8.6.0, DirectML, ONNX 또는 CPU 중 하나의 실행 환경을 선택하고 해당 버전의 PaddlePaddle 3.3.1 및 의존성을 설치해야 합니다. 비디오와 프로그램 경로에 중국어나 공백이 포함되지 않도록 주의해야 하며, 그렇지 않으면 알 수 없는 오류가 발생할 수 있습니다. NVIDIA 50 시리즈 그래픽 카드는 Paddle 3.3.1이 아직 CUDA 12.8을 지원하지 않으므로 DirectML 범용 버전을 사용하는 것이 좋습니다.
프로젝트는 또한 여러 QQ 커뮤니케이션 그룹을 운영하여 질의응답을 지원하고, Issues와 Discussions에서 개선 의견을 제시하도록 권장합니다. 전반적으로 개인 사용자와 자막 애호가를 위한 로컬 하드 자막 추출 도구로, 자막이 없거나 자막이 내장된 비디오에 편집 가능한 외부 자막을 다시 추가하는 데 적합합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.