这个项目能做什么

video-use是一个开源项目,支持通过Claude Code、Codex或Hermes等编码智能体完成视频剪辑。用户只需将原始素材放入指定文件夹,与智能体对话即可获得成品final.mp4。该工具适用于包括人物访谈、混剪、教程、旅行记录、采访在内的各类内容,无需预设或菜单操作。 核心能力包括: - 自动删除语气词(umm、uh)、口误内容以及不同镜头间的无效空白 - 支持暖调电影感、中性增强或自定义ffmpeg链路的自动调色 - 每次剪辑点设置30毫秒音频淡入淡出,避免音频爆音 - 支持烧录自定义样式的字幕,默认按2词大写分块显示 - 可通过HyperFrames、Remotion、Manim或PIL生成动画叠加层,由并行子智能体处理 - 每次剪辑点渲染完成后自动评估输出效果,再向用户展示结果 - 在project.md中持久化会话记忆,保障跨会话的连续性 该系统的工作逻辑是让大模型通过两层信息读取视频内容,而非直接观看视频。第一层是ElevenLabs Scribe生成的音频转录文本,包含词级时间戳、说话人分离和音频事件信息,打包为约12KB的文本文件。第二层是按需生成的视觉合成图(胶片条+波形+词标签PNG),仅在决策节点生成。这种方式避免了处理海量原始帧的token消耗。 整体流程为:转录 -> 打包 -> 大模型推理 -> 生成EDL(编辑决策列表)-> 渲染 -> 自我评估,其中包含自我评估循环,会检查剪辑点处的渲染效果,最多可自动修复3次问题再向用户展示预览。 安装可通过粘贴自动化提示词完成自动安装,也可手动克隆仓库、安装依赖(uv/pip、ffmpeg、yt-dlp)、添加ElevenLabs API密钥完成配置。 设计原则强调以文本和按需视觉信息为核心,音频优先、视觉内容跟随音频,执行前需确认策略,不做内容假设,同时设置12条硬性制作规则,其余部分保留创作自由。