프로젝트 소개
video-use는 Claude Code, Codex, Hermes 같은 코딩 에이전트를 통해 영상 편집을 할 수 있게 해주는 오픈소스 프로젝트입니다. 사용자가 원본 영상을 폴더에 넣고 에이전트와 채팅하면 완성된 `final.mp4`를 받을 수 있습니다. 프리셋이나 메뉴 없이 talking heads, 몽타주, 튜토리얼, 여행 영상, 인터뷰 등 다양한 콘텐츠 유형에서 작동합니다.
주요 기능은 다음과 같습니다:
- 필러 단어(umm, uh, 시작 전 실수)와 촬영 분간의 공백 부분 자르기
- 따뜻한 영화 같은 색감, 중립적인 선명한 색감, 커스텀 ffmpeg 체인으로 자동 색 보정
- 오디오 팝 방지를 위해 모든 컷에 30ms 오디오 페이드 적용
- 커스터마이징 가능한 스타일로 자막 삽입 (기본값은 2단어 대문자 청크)
- HyperFrames, Remotion, Manim, PIL을 통해 애니메이션 오버레이 생성, 병렬 서브에이전트로 실행
- 결과를 보여주기 전 every 컷 경계에서 렌더링된 출력물을 자체 평가
- 세션 간 연속성을 위해 `project.md`에 세션 메모리 저장
이 시스템은 LLM이 영상을 직접 보는 대신 두 가지 레이어를 통해 읽는 방식으로 작동합니다. 레이어 1은 ElevenLabs Scribe의 오디오 트랜스크립트로, 단어별 타임스탬프, 화자 분리, 오디오 이벤트 정보가 담겨 있으며 약 12KB 크기의 텍스트 파일로 압축되어 있습니다. 레이어 2는 의사 결정 지점에서만 생성되는 온디맨드 비주얼 컴포지트(필름스트립 + 파형 + 단어 레이블 PNG)입니다. 이 방식을 통해 수백만 개의 원본 프레임 토큰을 처리하는 부담을 줄일 수 있습니다.
파이프라인은 Transcribe -> Pack -> LLM Reasons -> EDL -> Render -> Self-Eval 순으로 흐르며, 자체 평가 루프가 컷 경계의 렌더링 출력물을 확인하고 미리보기를 보여주기 전 최대 3번까지 문제를 수정할 수 있습니다.
설정은 자동 설치용 붙여넣기 프롬프트로 하거나, 클론, 의존성 설치(uv/pip, ffmpeg, yt-dlp), ElevenLabs API 키 추가를 통해 수동으로 진행할 수 있습니다. 디자인 원칙은 텍스트와 온디맨드 비주얼 우선, 오디오를 주요 요소로 시각 자료는 보조로 사용, 실행 전 전략 승인, 콘텐츠에 대한 사전 가정 금지, 12개의 엄격한 제작 규칙과 그 외 영역에서의 예술적 자유 보장을 강조합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.