这个项目能做什么

Code2Video 是新加坡国立大学 Show Lab 的研究项目,已被 ICML 2026 接收,用于从知识点生成教学视频。它不依赖基于像素的文本到视频模型,而是将可执行代码作为视频时间序列和空间布局的媒介,并使用 Manim Community v0.19.0 渲染最终结果。 该框架围绕三个协作智能体构建。Planner 将知识点扩展为分镜脚本,Coder 合成可调试的 Manim 代码,Critic 使用锚点优化布局和美学。仓库指出,使用 Claude-4-Opus 可获得最佳的 Manim 代码质量,而布局和美学优化使用 Gemini API 密钥,据报告 gemini-2.5-pro-preview-05-06 是表现最佳的配置。可选的 IconFinder API 密钥可为视频添加图标。 开始使用需要从 src/requirements.txt 安装依赖,并在 api_config.json 中填写 API 凭据。两个 shell 脚本涵盖主要工作流:run_agent_single.sh 根据命令行传入的单个知识点生成视频,而 run_agent.sh 运行 long_video_topics_list.json 中定义的全部或部分主题,并提供输出文件夹前缀、最大概念数量和并行组数量等参数。生成的案例按文件夹前缀组织在 CASES 目录下。 该项目还发布了 MMMC 基准,被描述为首个面向代码驱动视频生成的基准,涵盖受 3Blue1Brown 启发的 117 个精选学习主题。评估从三个维度组织:通过 eval_TQ.py 评估知识传递,通过 eval_AES.py 评估美学和结构质量,以及 token 使用量和执行时间等效率指标。其他数据和评估脚本托管在 Hugging Face 上。 README 将 3Blue1Brown 课程列为视频数据来源以及清晰度和美学的参考,并致谢 Manim Community、IconFinder 和 Icons8。README 提供了中文翻译。该仓库是研究代码库而非打包应用,因此用户需要自行配置外部 LLM、VLM 和素材 API。