X 上一条帖子称:只要把素材放进文件夹,再对 Claude Code 说“做成发布视频”,开源项目 video-use 就能自动去掉口头禅、剪掉空白、调色、生成逐词字幕、检查导出结果,甚至不需要打开 Premiere Pro。
这类演示会让人误以为“AI 已经把视频编辑完全自动化”。更准确的说法是:video-use 把适合规则化的后期操作变成了一个可被编程代理调用的工作流。 它并不是独立桌面剪辑软件,也不是 Claude Code 或 Codex 的官方内置视频编辑器。
它尤其适合口播、教程、访谈、播客和课程切片;对于纯音乐、旅行蒙太奇、舞蹈、复杂剧情和高审美商业片,仍需要人做叙事、节奏和视觉判断。
video-use 是什么?
video-use 是 Browser Use 发布的 MIT 开源 Skill 与脚本工作流。它让支持本地 Shell 和 Skills 的编程代理读取素材、分析转录、提出剪辑方案、调用 FFmpeg 渲染,并把项目上下文保存下来以便后续继续修改。
项目 README 以 Claude Code 为主要示例,但同一份安装文档也列出 Codex、Hermes、OpenClaw 等代理环境。因此合适的描述是:
video-use 可以在 Claude Code、Codex 等支持本地命令和 Skill 的编程代理中使用。
不合适的描述是:
Claude Code 或 Codex 官方推出了一个一键视频编辑器。
它的核心原理:主要读“带时间戳的文字”,不是完整看完视频
video-use 的典型流程如下:
原始视频(保持不改)
↓ ffprobe 盘点
FFmpeg 抽取 16kHz 单声道音频
↓
ElevenLabs Scribe:逐词时间戳、说话人区分、音频事件
↓
takes_packed.md:按停顿和说话人组织的轻量文本
↓
Agent 提出剪辑策略 → 用户确认
↓
EDL 剪辑决策 → FFmpeg 分段渲染、拼接、字幕和叠加
↓
关键切点的胶片图 / 波形 / 字幕检查
↓
preview.mp4 / final.mp4
这个设计避免把整条视频逐帧交给大模型,节省视觉 Token 和处理时间。缺点也很明显:它对人声清晰、逻辑明确的素材更有优势;没有被声音完整描述的镜头内容,Agent 不一定知道是否值得保留。
video-use 能自动做什么?
根据项目源码和文档,主要能力包括:
- 用逐词时间戳定位并删除“呃”“啊”“那个”等口头禅;
- 处理错误开头、空白和停顿;
- 在剪切点加入约 30ms 的音频淡入淡出,降低爆音;
- 生成并烧录字幕;
- 使用受限的 FFmpeg 滤镜做基础亮度、对比度和饱和度调整;
- 按需结合 HyperFrames、Remotion、Manim、PIL 做图形和动画;
- 渲染后检查切点、波形、字幕遮挡和叠加错误;
- 在最多三次修复重渲染中处理可检测的问题;
- 用
project.md保留剪辑上下文,便于后续修改。
需要注意:“自动电影级调色”“AI 看懂所有镜头”“任何视频都自动完成专业剪辑”等并不是项目的外部基准结论。默认调色只是有限范围的色彩校正,复杂调色、声音设计和叙事节奏仍是人工工作。
需要哪些环境和费用?
代码开源不等于整条流程免费。通常需要:
- Python 3.10+;
ffmpeg与ffprobe;- Python 依赖,如
requests、librosa、matplotlib、Pillow与numpy; - ElevenLabs API Key,用于 Scribe 逐词转录;
- 可选:Node.js / npm(HyperFrames 或 Remotion)、Manim、
yt-dlp; - 一个能执行本地命令、阅读项目文件的编程代理;
- 足够的本地磁盘、计算资源和人工审片时间。
Scribe 转录意味着视频音频会被上传到第三方服务。客户访谈、内部培训、含个人信息或受保密协议约束的素材,在使用前应确认数据处理与跨境传输是否获准。
Claude Code 与 Codex 怎么正确理解?
Claude Code 是 Anthropic 的编程代理;Codex 是 OpenAI 的编程代理。video-use 是第三方项目,代理负责理解指令、调用脚本和读写项目文件。
无论使用哪一种代理,都应保留这些安全边界:
- 在单独项目目录运行;
- 先让 Agent 只生成剪辑计划和选段表;
- 审核将要执行的下载、删除、覆盖和网络命令;
- 不把密钥写入视频项目或提交到 Git;
- 记录每次渲染使用的脚本、输入和输出;
- 先生成
preview.mp4,确认后再导出正式版。
本地 Shell 很强大,也意味着执行环境需要明确的权限和审查。OpenAI 的 Shell 文档同样建议对任意命令做隔离、允许/拒绝规则与日志记录。
从长视频到短视频的正确工作流
第一步:先确认素材权利
不要把“在 X、抖音或 YouTube 看得到”理解为“可以下载、翻译和重新发布”。优先使用:
- 自己拍摄或拥有版权的视频;
- 客户书面授权的素材;
- 明确允许商业改编的 Creative Commons 素材;
- 公共领域内容;
- 平台明确授权的 Remix 功能和素材。
YouTube 官方说明指出,用户可以下载自己上传的视频,但不能通过其下载功能获取其他用户的视频。技术上取得文件,也不等于获得复制、改编、翻译或商业发布权。
第二步:固定项目结构
video-project/
source/
transcript/
selects/
assets/
edit/
review/
output/
rights/
rights/ 保存授权书、音乐许可证、素材来源和客户批准记录。自动化流程越快,越需要把权利信息放在最开始。
第三步:转录、事实摘要和选段表分开保存
不要让 Agent 一次性把英文长视频“改写成 90 秒中文成片”。更可靠的顺序是:
- 生成带时间戳的原文转录;
- 输出只包含原片事实的结构化摘要;
- 生成候选片段表;
- 人工确认片段和事实;
- 再写中文脚本;
- 最后进入渲染。
这样能避免把原作者的一句带条件结论,剪成毫无前提的夸张断言。
第四步:把剪辑决策变成可审查表格
片段:00:45–01:02
用途:提出核心问题
保留理由:原作者直接解释痛点
中文旁白:待审核
画面处理:保留原画 / 仅用引用截图 / 替换为自有 B-roll
来源权限:已确认
这比只让 AI 输出一个成片更适合客户项目和长期复用。
第五步:生成预览再批准
先输出低码率 preview.mp4。检查字幕安全区、关键术语、BGM 音量、Logo、人物裁切和上下文后,再输出最终版本。
不打开 Premiere Pro,是否等于完全替代剪辑软件?
对规则清晰的素材,video-use 确实可以减少机械操作:粗剪、口头禅、基础字幕、简单色彩和批量输出都适合自动化。
但传统剪辑工具仍然擅长:
- 多机位和复杂媒体管理;
- 精细调色、降噪、混音和声音设计;
- 手感驱动的节奏取舍;
- 实时可视化拖拽;
- 成熟的协作审片、模板和插件生态;
- 高审美广告、纪录片和剧情内容的最终控制。
最实用的策略不是宣布“删除 Premiere”,而是让 Agent 处理重复性 60–80% 工作,人保留故事、审美、事实和交付责任。
版权、翻译和二创的边界
剪短、换字幕、重写中文旁白、重新编排画面和转发到新平台,通常会涉及复制、改编、翻译和信息网络传播等权利。拿到一个视频文件,并不自动取得这些权利。
如果确有评论、研究或批评目的:
- 只用实现说明目的所必需的短片段;
- 加入实质性分析和新的表达;
- 明确标注原作者和来源;
- 不把“合理使用”写成自动豁免;
- 不复制原视频的完整音乐、旁白和核心表达;
- 对商业发布,优先拿到书面许可。
音乐、字体、B-roll、人物、商标和配音还需要分别确认许可。开源代码的 MIT 许可证只覆盖代码,不覆盖任何输入素材。
哪些场景最值得尝试?
自有口播切片
把一场直播、访谈或课程拆成多条短视频,保留原说话人的身份和事实。
客户教育内容多语言化
在客户授权下,将教程、产品演示或培训材料转成多个语言与画幅版本,并保持术语表和审校记录。
SaaS 产品更新视频
从录屏、官网文档和变更日志生成短视频,配合信息卡、字幕和产品截图。
内容团队模板化生产
将字体、颜色、标题、字幕和片尾沉淀成模板,让每期只替换选段和文案。
可收费的不是“用了 AI”,而是更快、准确、可审查地交付客户真正拥有权利的内容。
常见问题
video-use 是免费的吗?
项目代码是 MIT 开源,但转录需要 ElevenLabs API Key,还可能产生代理、动画、算力、素材和人工审片成本。
video-use 可以配合 Codex 使用吗?
可以。安装文档列出 Codex 的 Skill 注册方式;但它是第三方项目,不是 OpenAI Codex 内置的视频编辑功能。
它能完全替代 Premiere Pro 吗?
对口播和结构化素材,可以显著减少粗剪、字幕和基础渲染工作;复杂后期和最终审片仍应保留人工工具与流程。
能直接下载热门视频二创吗?
不能。下载能力不等于你拥有复制、改编、配乐和再发布权限。只处理自有、明确授权或许可证覆盖的素材。
为什么需要 ElevenLabs?
视频渲染主要通过本地 FFmpeg 进行,但项目会上传音频到 ElevenLabs Scribe 以取得逐词时间戳。敏感素材需先评估隐私与客户合同。
中文视频能用吗?
可以尝试,但中文断句、字幕字体、专有名词和时间轴仍需人工审校。实际兼容性应在目标系统和一小段自有素材上先验证。
总结
video-use 的真正价值,是把视频编辑从“人工拖时间线”变成“转录、计划、EDL、渲染和验收组成的工程”。
对于有大量口播、教程、访谈和产品内容的个人与团队,它能显著缩短重复性后期;但它无法自动解决素材授权、事实准确、审美取舍和最终发布责任。先用完全自有的一条短素材跑通,再扩展到客户项目,才是最稳的上手方式。