这个项目能做什么
FunClip是一款自动化视频转录、字幕生成和剪辑应用程序。它通过Gradio网页界面在本地运行,也可通过命令行操作。工作流程为:上传视频、运行语音识别、检查转录文本和说话人标签、选择一个或多个文本片段,并导出对应的视频剪辑(可选字幕)。
核心功能
- 基于FunASR的Paraformer模型进行视频语音识别,包含时间戳预测,支持基于文本的剪辑。
- 通过SeACo-Paraformer支持热词功能,提升对指定名称、实体或其他术语的识别准确率。
- 使用CAM++进行说话人识别,允许根据自动分配的说话人ID选择剪辑片段。
- 支持从识别出的转录文本中多片段剪辑。
- 生成完整视频的SRT字幕以及选定目标片段的字幕。
- 内置基于Pillow和捆绑字体的字幕渲染;仅在使用旧版MoviePy TextClip工作流时需要ImageMagick。
可用模型路径
- 中文视频剪辑的默认Paraformer配置。
- 使用英语语言选项的英文Paraformer识别。
- Fun-ASR-Nano作为更高精度的检查点选项。
- SenseVoice用于多语言ASR,带有情感和音频事件标签。
- 可选MOSS-Transcribe-Diarize,通过本地vLLM服务实现长文本转录、片段级时间戳和匿名说话人标签。MOSS端到端执行分段和说话人分离;文档指出,精确的任意文本剪辑仍需Paraformer令牌时间戳。
AI辅助与内容感知选择
FunClip可使用LLM分析转录文本并提出剪辑片段建议,然后将其传递给现有的AI剪辑工作流。OrcaRouter可配置为可选的OpenAI兼容网关,需使用API密钥和环境变量。对于基于视觉和音频而非仅转录文本的选择,可启用TwelveLabs Pegasus(可选),需安装twelvelabs包并提供API密钥。
使用选项
本地Gradio服务通过Python启动,通常可通过localhost:7860访问。它支持端口和公网访问启动选项。用户也可通过ModelScope或Hugging Face Spaces尝试该项目。对于命令行使用,FunClip提供两阶段流程:首先识别视频并生成转录文本/SRT输出,然后使用目标文本、偏移量和输出文件运行剪辑阶段。
安装与许可
文档中的设置使用Python 3.12虚拟环境、与平台兼容的PyTorch/torchaudio安装以及项目依赖项。FunClip当前需要funasr>=1.4.9以兼容其模型和字幕路径。模型权重在首次使用时单独下载,并受各自模型许可约束。FunClip源代码以MIT许可证发布。
评论
0 评分人数达到10人后显示
登录后参与讨论。