프로젝트 소개

FunClip은 자동 비디오 전사, 자막 생성 및 클리핑 애플리케이션입니다. Gradio 웹 인터페이스를 통해 로컬에서 실행되며 명령줄에서도 작동할 수 있습니다. 워크플로는 비디오를 업로드하고, 음성 인식을 실행하며, 전사 결과와 화자 레이블을 검토하고, 하나 이상의 텍스트 구간을 선택한 후 선택적 자막과 함께 해당 비디오 클립을 내보내는 것입니다. 핵심 기능 - FunASR 기반 Paraformer 모델을 사용한 비디오 음성 인식으로, 텍스트 기반 클리핑을 위한 타임스탬프 예측을 포함합니다. - SeACo-Paraformer를 통한 핫워드 지원으로 지정된 이름, 엔터티 또는 기타 용어의 인식 정확도를 향상시킵니다. - CAM++를 사용한 화자 인식으로, 자동 할당된 화자 ID로 클립을 선택할 수 있습니다. - 인식된 전사 결과에서 여러 구간 클리핑. - 전체 비디오 SRT 자막 및 선택된 대상 구간의 자막 생성. - Pillow와 번들 폰트를 사용한 내장 자막 렌더링; ImageMagick은 레거시 MoviePy TextClip 워크플로에만 필요합니다. 사용 가능한 모델 경로 - 중국어 비디오 클리핑을 위한 기본 Paraformer 설정. - 영어 옵션을 사용한 영어 Paraformer 인식. - 더 높은 정확도의 체크포인트 옵션인 Fun-ASR-Nano. - 감정 및 오디오 이벤트 태그가 포함된 다국어 ASR을 위한 SenseVoice. - 장문 전사, 구간 수준 타임스탬프 및 익명 화자 레이블을 위한 로컬 vLLM 서비스를 통한 선택적 MOSS-Transcribe-Diarize. MOSS는 종단 간 분할 및 화자 분리를 수행합니다; 문서에는 정확한 임의 텍스트 클리핑을 위해 여전히 Paraformer 토큰 타임스탬프가 필요하다고 명시되어 있습니다. AI 지원 및 콘텐츠 인식 선택 FunClip은 LLM을 사용하여 전사 결과를 분석하고 클립 구간을 제안할 수 있으며, 이는 기존 AI 클립 워크플로로 전달됩니다. OrcaRouter는 API 키와 환경 변수를 사용하여 선택적 OpenAI 호환 게이트웨이로 구성할 수 있습니다. 전사 텍스트만이 아닌 시각 및 오디오 기반 선택을 위해 TwelveLabs Pegasus를 선택적으로 활성화할 수 있으며, twelvelabs 패키지와 API 키가 필요합니다. 사용 옵션 로컬 Gradio 서비스는 Python으로 실행되며 일반적으로 localhost:7860에서 접속할 수 있습니다. 포트 및 공개 접속 실행 옵션을 지원합니다. 사용자는 ModelScope 또는 Hugging Face Spaces를 통해 프로젝트를 시험해 볼 수도 있습니다. 명령줄 사용을 위해 FunClip은 두 단계 프로세스를 제공합니다: 먼저 비디오를 인식하고 전사 결과/SRT 출력을 작성한 다음, 대상 텍스트, 오프셋 및 출력 파일로 클리핑 단계를 실행합니다. 설치 및 라이선스 문서화된 설정은 Python 3.12 가상 환경, 플랫폼 호환 PyTorch/torchaudio 설치 및 프로젝트 요구 사항을 사용합니다. FunClip은 현재 모델 및 자막 호환성 경로를 위해 funasr>=1.4.9가 필요합니다. 모델 가중치는 첫 사용 시 별도로 다운로드되며 각 모델 라이선스의 적용을 받습니다. FunClip 소스 코드는 MIT 라이선스로 배포됩니다.