프로젝트 소개

Claude Video(/watch)는 AI 코딩 어시스턴트에게 동영상 콘텐츠를 분석할 수 있는 능력을 부여하는 오픈소스 스킬입니다. 기본적으로 이러한 에이전트는 웹페이지를 읽고 스크립트를 실행할 수 있지만, 동영상을 처리할 수는 없습니다. 이 도구는 다운로드, 프레임 추출, 전사를 조율한 뒤 결과를 AI의 멀티모달 컨텍스트에 전달함으로 그 격차를 메웁니다. **지원 호스트:** Claude Code, Codex, Cursor, Copilot, Gemini CLI, claude.ai 웹, 그리고 50개 이상의 기타 Agent Skills 호스트. **작동 방식:** 1. URL(YouTube, TikTok, Loom, Vimeo 등) 또는 로컬 파일 경로(.mp4, .mov, .mkv, .webm)를 받습니다. 2. 먼저 yt-dlp를 사용해 네이티브 자막을 가져옵니다(무료, 다운로드 불필요). 사용할 수 없는 경우에만 필요한 오디오/비디오를 다운로드합니다. 3. ffmpeg를 사용해 선택한 상세 모드에 따라 프레임을 추출합니다: efficient(빠른 키프레임), balanced(장면 전환 감지), token-burner(제한 없는 장면 후보). 4. 오디오는 Groq의 whisper-large-v3(선호) 또는 OpenAI의 whisper-1(폴백)을 통해 전사합니다. 5. AI는 각 프레임을 이미지로 읽고, 타임스탬프가 있는 전사본과 함께 실제 시각적 및 오디오 콘츠에 근거한 질문에 답변합니다. **주요 기능:** - 프레임 중복 제거: 순수 stdlib Python 평균 절대 차이 알고리즘을 사용해 거의 동일한 프레임(예: 정적인 슬라이드)을 제거하여 토큰 예산을 절약합니다. - 상세 모드: 속도/토큰 비용과 시각적 충실도 간의 트레이드오프를 제공하며, 긴 동영상에서 컨텍스트 예산 고갈을 방지하기 위한 상한선이 있습니다. - 집중 분석: --start/--end 플래그를 지원해 특정 동영상 구간에 대해 초당 높은 프레임 예산으로 분석합니다. - Zero-config 설정: macOS에서 brew를 통해 ffmpeg와 yt-dlp를 자동 설치하며, Linux/Windows의 경우 정확한 명령어를 출력합니다. **일반적인 사용 사례:** 바이럴 콘텐츠 구조 분석, 화면 녹화에서 버그 진단, 동영상 요약, 출시 업데이트에서 핵심 내용 추출, 재생목록을 검색 가능한 노트로 변환.