这个项目能做什么
video-use是一个开源项目,支持通过Claude Code、Codex或Hermes等编码智能体完成视频剪辑。用户只需将原始素材放入指定文件夹,与智能体对话即可获得成品final.mp4。该工具适用于包括人物访谈、混剪、教程、旅行记录、采访在内的各类内容,无需预设或菜单操作。
核心能力包括:
- 自动删除语气词(umm、uh)、口误内容以及不同镜头间的无效空白
- 支持暖调电影感、中性增强或自定义ffmpeg链路的自动调色
- 每次剪辑点设置30毫秒音频淡入淡出,避免音频爆音
- 支持烧录自定义样式的字幕,默认按2词大写分块显示
- 可通过HyperFrames、Remotion、Manim或PIL生成动画叠加层,由并行子智能体处理
- 每次剪辑点渲染完成后自动评估输出效果,再向用户展示结果
- 在project.md中持久化会话记忆,保障跨会话的连续性
该系统的工作逻辑是让大模型通过两层信息读取视频内容,而非直接观看视频。第一层是ElevenLabs Scribe生成的音频转录文本,包含词级时间戳、说话人分离和音频事件信息,打包为约12KB的文本文件。第二层是按需生成的视觉合成图(胶片条+波形+词标签PNG),仅在决策节点生成。这种方式避免了处理海量原始帧的token消耗。
整体流程为:转录 -> 打包 -> 大模型推理 -> 生成EDL(编辑决策列表)-> 渲染 -> 自我评估,其中包含自我评估循环,会检查剪辑点处的渲染效果,最多可自动修复3次问题再向用户展示预览。
安装可通过粘贴自动化提示词完成自动安装,也可手动克隆仓库、安装依赖(uv/pip、ffmpeg、yt-dlp)、添加ElevenLabs API密钥完成配置。
设计原则强调以文本和按需视觉信息为核心,音频优先、视觉内容跟随音频,执行前需确认策略,不做内容假设,同时设置12条硬性制作规则,其余部分保留创作自由。
评论
0 评分人数达到10人后显示
登录后参与讨论。