프로젝트 소개
Video Analyzer는 시각 및 오디오 정보를 통해 비디오 콘텐츠에 대한 설명을 생성하는 명령줄 도구입니다. 파이프라인은 키 프레임 추출 및 오디오 처리, 프레임별 비전 분석, 최종 비디오 재구성의 세 가지 주요 단계로 구성됩니다.
분석기는 OpenCV를 사용하여 키 프레임을 선택하고 OpenAI Whisper를 사용하여 사용 가능한 오디오를 전사하며, 저품질 오디오에 대한 검사도 포함합니다. 추출된 각 프레임은 비전 지원 언어 모델로 전송되며, 이전 프레임의 컨텍스트를 사용하여 시간적 진행을 유지합니다. 그런 다음 프레임 분석과 전사 내용을 결합하여 포괄적인 설명을 생성합니다. 기본적으로 로컬 추론은 Llama 3.2 Vision 모델과 함께 Ollama를 사용합니다. 사용자는 CLI 옵션이나 JSON 구성 파일을 통해 OpenAI 또는 OpenRouter와 같은 모든 OpenAI 호환 엔드포인트를 대체로 구성할 수 있습니다.
보고된 기능으로는 클라우드 서비스나 API 키 없이 완전히 로컬에서 작동, 선택적 클라우드 API, 구성 가능한 Whisper 및 비전 모델, 사용자 정의 프롬프트, 메타데이터, 전사, 프레임 분석 및 최종 설명을 포함한 상세한 JSON 출력, 그리고 명령줄 인수가 사용자 구성 및 기본값을 재정의하는 계단식 구성 시스템이 포함됩니다.
요구 사항으로는 Python 3.11 이상과 FFmpeg가 있습니다. README는 로컬 LLM 실행을 위해 상당한 RAM과 GPU/Apple Silicon 하드웨어를 권장하며, API 기반 사용은 이러한 로컬 모델 요구 사항을 피합니다. 설치는 리포지토리를 클론하고 pip로 설치하여 수행됩니다. 선택적 video-analyzer-tune 패키지는 DSPy MIPROv2를 사용하여 대표적인 편집된 출력에서 프롬프트 템플릿을 최적화하고, 조정된 프롬프트를 별도의 파일에 기록할 수 있습니다. 이 프로젝트는 Apache 라이선스로 배포되며 사용, 설계 및 기여 문서를 포함합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.