首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Timeline Studio 重大升级:让 AI 替你剪完一条视频:一键生成成片,随时打开工程继续调整

Timeline Studio 重大升级:让 AI 替你剪完一条视频:一键生成成片,随时打开工程继续调整

原创
作者头像
用户5557817
发布2026-08-05 19:16:45
发布2026-08-05 19:16:45
2120
举报

安装一个 Skill,一杯咖啡的时间完成视频剪辑:成片与可编辑工程一次交付

只需要安装 edit-timeline-studio Skill,把视频、图片、产品素材或者网站地址交给 Agent,再说明语言、风格、比例和大致时长。喝一杯咖啡的时间,它就能自动完成内容分析、脚本规划、镜头剪辑、配音、字幕和视觉引导,最终同时交付成品视频与可继续修改的 .timeline 工程。

项目名称:Timeline Studio

GitHub 仓库:https://github.com/MartinDelophy/ai-video-editor

在线体验:https://video-editor.ai-creator.top

Skill 安装页:https://skills.sh/MartinDelophy/ai-video-editor

从一句需求,到一条可以继续修改的成片

过去,完成一条产品介绍、网站宣传或知识讲解视频,往往需要经历很多步骤:

  • 整理图片和视频素材;
  • 浏览产品或网站;
  • 提炼卖点并编写脚本;
  • 选择配音语言和声音;
  • 生成字幕并校准时间;
  • 设计镜头节奏;
  • 添加放大、框选、下划线和转场;
  • 调整背景音乐;
  • 导出视频;
  • 根据反馈重新修改。
AI生成轨道
AI生成轨道

真正消耗时间的,往往不是某一个操作,而是这些步骤之间反复确认、修改和重新导出的过程。

我们希望把它简化成一件事:安装一个 Skill,然后告诉 Agent 你想做什么。

例如:

代码语言:plaintext
复制
请把这些素材剪成一条英文产品介绍视频。

使用自然女声,专业可信但有活力,16:9,时长约 60 秒。

突出产品最有价值的功能,画面保持稳定,
使用关键帧放大、下划线和准确框选引导注意。

最终交付成品视频和可以继续修改的工程文件。

接下来,你可以去喝一杯咖啡。

Timeline Studio 的 edit-timeline-studio Skill 会分析素材、理解内容、规划镜头、生成配音与字幕,并根据场景完成自动剪辑。

任务完成后,它交付的不只是一条 MP4 视频,还包括一个完整的 .timeline 工程。

以后想替换一句配音、修改字幕、调整镜头时长、改变画面比例或者重新导出,都可以直接打开工程继续编辑,不需要从头生成。

为什么我们不仅交付 MP4

很多 AI 视频工具的最终结果只有一条视频。

一旦发现配音太快、字幕不准、镜头顺序不合适,或者产品经理临时修改了一句文案,通常只能重新生成。

这会带来几个问题:

  • 修改成本高;
  • 很难精准调整某一个片段;
  • 重新生成的画面可能发生变化;
  • 配音、字幕和镜头关系可能被打乱;
  • 人与 AI 之间无法自然接力。

Timeline Studio 把可编辑工程作为整个流程的核心。

每次完整的视频任务都会产生两个结果:

代码语言:plaintext
复制
project-name.timeline   # 可继续修改的工程
project-name.mp4        # 最终成片

.timeline 是一个可移植的工程归档,包含项目状态和使用到的媒体文件。

重新导入后,可以恢复:

  • 主画面轨道;
  • 画中画和叠加素材;
  • 字幕;
  • 分段配音;
  • 背景音乐;
  • 视频原声;
  • 片段时间;
  • 轨道显隐与锁定状态;
  • 画面变换和其他编辑参数。

因此,AI 可以先完成大部分工作,人再进行最后的精细调整。

这不是用 AI 替代创作者,而是让 AI 完成耗时的初剪、整理和同步工作,把最终判断留给创作者。

一杯咖啡的时间里,Agent 做了什么

表面上看,这是“一键自动剪辑”。

但在真正执行时,Agent 并不是简单调用固定模板,而是完成一套专业工作流。

第一步:理解用户到底想做什么

Agent 会先识别任务属于哪一种视频:

  • 人物口播;
  • 教程演示;
  • 访谈对话;
  • Vlog 或活动记录;
  • 产品与品牌宣传;
  • 叙事和纪录内容;
  • 网站介绍与操作演示。

不同类型的视频不会使用完全相同的剪辑逻辑。

例如:

  • 口播需要保护语义、表情和自然停顿;
  • 教程必须保留“讲解—操作—结果”的完整对应;
  • 访谈不能通过重排制造原本不存在的观点;
  • 电商视频必须保护产品外观、Logo、包装文字和品牌色;
  • 网站宣传需要真实体验页面,不能只根据首页文案推测功能。

只有确定内容类别、目标观众、视频比例、语言和表达风格后,Agent 才会开始规划。

第二步:分析图片、视频、声音与运动

对于图片,Agent 会分析:

  • 主体和人物;
  • 产品与品牌标识;
  • 可读文字;
  • 清晰度和分辨率;
  • 构图与裁切空间;
  • 景深和分层条件;
  • 是否适合直接使用、2.5D、图生视频或图生图修复。

对于视频,Agent 会组合分析:

  • 镜头边界;
  • 代表帧;
  • OCR 文字;
  • 语音和字幕;
  • 人物、产品与界面区域;
  • 全局光流;
  • 主体区域光流;
  • 模糊、遮挡、失焦和动作变化。

光流主要用于理解运动,而不是单独判断内容。

系统会先确认画面中的对象是什么,再通过光流判断它如何移动,从而区分:

  • 相机抖动;
  • 主动运镜;
  • 人物运动;
  • 产品运动;
  • 页面或视频中的局部运动。

这让系统能够优先选择清晰、稳定、信息完整的片段,并在需要时先稳定画面,再进行跟踪和增强。

第三步:生成可解释的剪辑决策

Agent 不会分析完就直接修改工程。

它会先形成一份剪辑决策记录:

  • 哪些内容应该保留;
  • 哪些内容可以删除;
  • 哪些等待过程可以缩短;
  • 哪些片段应该重新排序;
  • 哪个时间点适合突出产品;
  • 哪些字幕和音频不能被切断;
  • 每项决定的理由和置信度是什么。

这样既方便自动执行,也方便后续审查。

对于存在歧义的内容,Agent 会向用户询问真正影响结果的问题,而不是询问素材中已经能够观察到的信息。

配音决定节奏,而不是时长强迫配音

很多自动生成的视频会先把画面固定为 60 秒,再把配音强行压进 60 秒。

这很容易产生几个问题:

  • 语速太快;
  • 停顿不自然;
  • 品牌名和专业词发音错误;
  • 字幕来不及阅读;
  • 画面重点与声音不同步。

Timeline Studio 采用相反的方式:先确定自然的声音表现,再根据配音安排画面。

在开始生成前,Agent 会确认:

  • 使用什么语言;
  • 使用女性、男性还是指定声音;
  • 专业、可信、活力、温暖或沉稳等表达风格;
  • 期望的节奏;
  • 品牌名、网址、数字和专业词的读法;
  • 字幕是否与配音使用相同语言。

生成配音后,系统根据真实句子时长和自然停顿规划镜头。

如果目标时间太短,优先缩短文案,而不是粗暴加速语音。

光标到达、下划线出现、框选锁定、画面放大和结果展示,也会围绕对应的语句进行同步。

一条字幕,对应一个独立配音文件

为了让后续修改真正方便,最新的 .timeline v3 不再把整段旁白保存成一个音频文件。

句子级配音会被物理拆分:

代码语言:plaintext
复制
caption-01 → voice-01.wav
caption-02 → voice-02.wav
caption-03 → voice-03.wav

每条字幕通过 audioClipId 与对应的配音片段关联。

这样重新打开工程后,可以:

  • 单独替换某一句配音;
  • 单独移动某一句;
  • 修改一句话的音量或淡入淡出;
  • 调整字幕和配音的同步关系;
  • 删除某一句,而不影响其他音频;
  • 保留其他已经确认的剪辑结果。

这是一键自动剪辑能够进入真实生产流程的重要基础。

网站介绍,不再是模糊截图轮播

网站宣传是这套 Skill 重点支持的场景。

用户只需要提供网站地址,并说明目标观众、语言、声音和大致时长。

Agent 会先体验网站,而不是直接把首页截下来做视频。

它会建立页面和流程覆盖清单,包括:

  • 主页;
  • 功能页;
  • 产品列表;
  • 详情页;
  • 搜索和筛选;
  • 关键操作路径;
  • 登录后的产品界面;
  • 外部跳转;
  • 可能产生真实影响的操作。

如果关键功能需要登录,Agent 会请用户自行在浏览器中登录,不会索要密码、验证码、Cookie 或其他凭据。

无法访问的功能会明确标记为“未验证”,不会根据宣传文案编造产品体验。

在得到授权的页面范围内,Agent 可以通过脚本驱动浏览器完成可逆操作:

  • 平滑滚动;
  • 鼠标移动;
  • hover 状态;
  • 标签切换;
  • 搜索和筛选;
  • 加载结果展示;
  • 页面视频播放;
  • 临时光标提示层。

它不会自动提交订单、发布内容、发送消息、修改账户资料或执行其他有外部影响的操作。

不是到处画框,而是用专业方式引导注意力

网页宣传视频中最常见的问题之一,是在每个页面上都画一个矩形框。

框选过多不仅不能突出重点,还会让视频显得机械、廉价。

Timeline Studio 会根据目标选择不同的视觉引导方式:

  • 小而密集的界面:使用关键帧放大;
  • 精确文字或数据:使用下划线或括线;
  • 按钮、卡片和结果区域:使用准确框选;
  • 需要保留上下文的目标:使用聚光遮罩;
  • 需要解释关系的内容:使用引导线;
  • 页面内的动态对象:使用光流辅助跟踪;
  • 静态图片:使用适度的景深或 2.5D 分层。

一段专业的解释镜头通常遵循这样的节奏:

代码语言:plaintext
复制
建立上下文 → 引导注意 → 锁定目标 → 静止阅读 → 自然释放

画面移动到目标后必须停下来,给观众足够的阅读时间。

我们明确拒绝:

  • 无意义的持续缩放;
  • 手持模拟和微抖动;
  • 弹性过冲;
  • 框选漂移;
  • 频繁重复放大、缩小;
  • 滚动和变焦相互冲突;
  • 为了“看起来有动效”而堆叠效果。

每个镜头最多保留一次有明确目的的相机移动,以及一个主要强调效果。

为什么播放不会再卡在一个片段中循环

多媒体时间线中,一个关键问题是:谁负责控制播放时间?

如果直接使用当前视频元素的 currentTime 作为总时间线时钟,当视频在片尾解码发生停顿,播放头可能会被固定在当前片段末尾。

用户看到的结果,就是画面仿佛一直在某一个片段中循环。

Timeline Studio 使用单调递增的时间线主时钟:

代码语言:plaintext
复制
Timeline Clock
   ├── 同步画面
   ├── 同步配音
   ├── 同步背景音乐
   ├── 同步字幕
   └── 同步视觉效果

视频和音频只跟随时间线,不再反过来控制播放头。

片段时间区间采用 [start, end) 的半开语义,也可以避免在两个相邻片段的公共边界上同时激活两段媒体。

这种底层稳定性不如生成模型显眼,却决定了编辑器能否真正处理长时间、多片段、多音轨的工程。

本地优先,不代表牺牲 AI 能力

Timeline Studio 将多种 AI 能力放在浏览器本地运行,包括:

  • 多语言 AI 配音;
  • Whisper 自动字幕;
  • Stable Audio AI 音乐;
  • 人物与物体检测;
  • 智能画面与人像处理;
  • AI 修复;
  • 高清增强;
  • 人声分离;
  • 数字人相关能力。

模型采用按需下载和版本固定策略,并通过 Hugging Face 与 ModelScope 双线路镜像交付。

国内环境优先使用 ModelScope,Hugging Face 作为回退。两条线路使用统一缓存身份,切换来源时不需要重复下载相同模型。

本地优先带来的价值包括:

  • 素材不需要为了基础编辑上传到远程服务器;
  • 模型下载后可以重复使用;
  • Agent 和人工编辑共享同一个项目;
  • 导出结果更容易复现;
  • 模型来源、版本与许可证更加明确。

涉及人脸替换、数字人或其他深度合成能力时,使用者必须拥有相关素材的合法授权,不得生成或传播违法、侵权、虚假或误导性内容,也不得将生成结果冒充为真实影像。

如何安装这个 Skill

通过 skills.sh 安装:

代码语言:bash
复制
npx skills add MartinDelophy/ai-video-editor \
  --skill edit-timeline-studio

安装到 Codex:

代码语言:bash
复制
gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent codex \
  --scope user \
  --pin v0.9.1

安装到 Claude Code:

代码语言:bash
复制
gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent claude-code \
  --scope user \
  --pin v0.9.1

GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的工具,也可以从同一个仓库发现和使用这套 Skill。

安装之后怎么使用

安装后,不需要学习复杂的剪辑命令。

可以直接向 Agent 描述结果:

代码语言:plaintext
复制
请把这个网站制作成一条英文介绍视频。

使用自然女声,专业可信但有活力,16:9,时长约 60 秒。

请先体验网站的公开页面。如果关键功能需要登录,
请让我在浏览器中自行登录。

画面保持稳定,使用真实交互、关键帧放大、
下划线和准确框选突出重要功能。

最终交付成品视频和可以继续修改的 .timeline 工程。

也可以直接提供图片和视频:

代码语言:plaintext
复制
请自动分析这个目录中的产品图片和演示视频,
剪辑成一条 45 秒的中文产品宣传片。

保留品牌 Logo、包装文字和产品颜色,
使用自然女声,背景音乐不要盖住配音。

最终输出 MP4 和可编辑工程。

Agent 会根据任务选择两条执行路径。

对于命令层已经支持的操作,会使用版本化命令检查工程、生成编辑计划并执行 dry run:

代码语言:bash
复制
npm run agent -- project.inspect /absolute/path/project.timeline
npm run agent -- project.diff /absolute/path/edit-plan.json
npm run agent -- project.run /absolute/path/edit-plan.json
npm run agent -- project.inspect /absolute/path/project-v2.timeline

对于 AI 生成、复杂效果、浏览器操作、实时预览等能力,则通过 Timeline Studio 编辑器完成。

Skill 会明确区分两条路径,不会把 UI 自动化描述成完全确定性的无头执行。

一键生成之后,还可以快速调整

“一键自动剪辑”并不意味着用户失去控制。

因为最终保留了 .timeline 工程,所以后续可以继续修改:

  • 替换某一个镜头;
  • 调整镜头顺序;
  • 缩短或延长某个片段;
  • 单独重新生成一句配音;
  • 修改字幕内容;
  • 调整字幕位置和样式;
  • 改变视频比例;
  • 修改背景音乐音量;
  • 调整放大、框选和转场;
  • 切换产品重点;
  • 重新导出不同版本。

第一次生成可以完成大部分工作,后续调整只需要修改相关片段。

不需要重新分析全部素材,也不需要把整条视频推倒重来。

完成标准不只是“导出成功”

Timeline Studio 会同时检查技术正确性和编辑质量。

结构验收包括:

  • .timeline 能否重新打开;
  • 所有媒体文件是否完整;
  • 字幕和配音是否一一对应;
  • 主画面轨道是否可见;
  • 轨道时间、显隐和锁定状态是否恢复;
  • 视频是否包含真实可听的音频;
  • 导出尺寸、时长和帧数是否正确;
  • 播放是否可以连续跨越所有片段边界。

编辑质量验收包括:

  • 是否存在可见抖动;
  • 跟踪框是否漂移;
  • 产品、人物和品牌身份是否被生成模型改变;
  • 强调效果是否与配音同步;
  • 字幕是否有足够阅读时间;
  • 画面是否遮挡关键内容;
  • 需要阅读时画面是否停稳;
  • 是否存在不必要的效果堆叠。

技术上成功导出,不代表它已经是一条专业成片。

结语:一杯咖啡的时间,完成第一次剪辑

我们认为,AI 视频编辑下一阶段的竞争点,不只是生成模型能做出多漂亮的画面。

真正重要的是:

  • 能不能理解素材;
  • 能不能发现真正值得保留的内容;
  • 能不能组织清晰的叙事;
  • 能不能生成自然的声音;
  • 能不能稳定、准确地引导注意力;
  • 能不能交付一个可继续修改的工程。

Timeline Studio 想完成的事情,可以概括成一句话:

安装一个 Skill,一杯咖啡的时间得到一条成品视频;保留一个可编辑工程,承接之后的每一次调整。

项目仍在持续迭代。我们欢迎关注浏览器媒体、WebCodecs、WebGPU、ONNX、自动剪辑、语音、字幕、视觉跟踪和 Agent 工作流的开发者参与。

GitHub 仓库:

https://github.com/MartinDelophy/ai-video-editor

其他地址:

如果这个项目对你有帮助,欢迎 Star、提交 Issue,或者分享你最希望自动化的视频制作场景。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 安装一个 Skill,一杯咖啡的时间完成视频剪辑:成片与可编辑工程一次交付
    • 从一句需求,到一条可以继续修改的成片
    • 为什么我们不仅交付 MP4
    • 一杯咖啡的时间里,Agent 做了什么
      • 第一步:理解用户到底想做什么
      • 第二步:分析图片、视频、声音与运动
      • 第三步:生成可解释的剪辑决策
    • 配音决定节奏,而不是时长强迫配音
    • 一条字幕,对应一个独立配音文件
    • 网站介绍,不再是模糊截图轮播
    • 不是到处画框,而是用专业方式引导注意力
    • 为什么播放不会再卡在一个片段中循环
    • 本地优先,不代表牺牲 AI 能力
    • 如何安装这个 Skill
    • 安装之后怎么使用
    • 一键生成之后,还可以快速调整
    • 完成标准不只是“导出成功”
    • 结语:一杯咖啡的时间,完成第一次剪辑
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档