这个项目能做什么

Video Analyzer 是一个命令行工具,用于从视觉和音频信息生成视频内容的描述。其处理流程包含三个主要阶段:关键帧提取与音频处理、逐帧视觉分析,以及最终的视频重建。 该分析器使用 OpenCV 选择关键帧,并使用 OpenAI Whisper 转录可用音频,包括检查低质量音频。每个提取的帧被发送到具备视觉能力的语言模型,并利用先前帧的上下文来保持时间顺序的连贯性。随后,帧分析和转录内容被合并为一份全面的描述。默认情况下,本地推理使用 Ollama 和 Llama 3.2 Vision 模型;用户也可以通过命令行选项或 JSON 配置文件,配置任何兼容 OpenAI 的端点,例如 OpenAI 或 OpenRouter。 报告的功能包括:完全本地运行,无需云服务或 API 密钥;可选的云 API;可配置的 Whisper 和视觉模型;自定义提示词;包含元数据、转录、帧分析和最终描述的详细 JSON 输出;以及级联配置系统,其中命令行参数覆盖用户配置和默认值。 要求包括 Python 3.11 或更高版本以及 FFmpeg。README 建议为本地 LLM 执行配备充足的内存和 GPU/Apple Silicon 硬件,而基于 API 的使用则避免了这些本地模型要求。安装通过克隆仓库并使用 pip 安装完成。可选的 video-analyzer-tune 包可以使用 DSPy MIPROv2 从代表性的编辑输出中优化提示模板,并将调整后的提示写入单独文件。该项目根据 Apache 许可证发布,并包含使用、设计和贡献文档。