
录完一段软件演示,最磨人的活往往还没结束。视频里已经把操作讲了一遍,准备图文稿时却还得从头听、暂停、抄按钮名,再把截图塞回对应步骤。
团队里的培训录屏也有同样的问题。新人培训、后台操作、客服排错全躺在视频里,真正要查某一步时,只能拖着进度条找。业务人员想把它们整理成知识库,又很难抽时间从空白文档写起。

这两种重复劳动可以交给同一套桌面 Agent 工作流:放入自己录制或获授权的软件操作视频,取回图文教程、操作步骤文档(SOP)、关键截图和待确认项。个人录完演示可以继续发图文,团队积压的培训视频也能逐条变成内部文档。
这次输入的是一段 38.96 秒的 SkillHub 录屏:搜索腾讯云文字识别 Skill,进入认证详情页,再找到安装提示词。下面就是它实际生成的 tutorial-article.md,不是流程示意图。

生成稿的标题是《如何在 SkillHub 找到腾讯云文字识别 Skill,并把安装提示词交给 AI》。正文已经写成四个动作:打开全部技能并搜索、核对目标 Skill、找到安装提示词、安装后配置密钥。
它还保留了视频没有证明的部分。录屏只出现“复制 prompt”入口,没有终端安装画面,所以成品写的是“找到安装提示词”,而不是“已经安装成功”。同一目录里还生成了六步 SOP、4×4 全程联系图和待确认项清单。
难点不只是语音转文字。旁白通常是一整段话,没有按钮位置、页面变化和成功状态。本文把 VITA、语音识别和文字识别封装成一个名为 tencentcloud-media-review 的组合 Skill:分别看视频、听旁白、读界面,再由 WorkBuddy 把同一时间点的内容合成教程步骤。
比如旁白说“选择认证条目”,语音识别不知道页面上哪个结果带认证标识;文字识别能读到作者名称,却不知道它对应视频里的哪一步。单项能力都不够。
三项能力放进同一个桌面 Agent 后,各自只负责自己擅长的部分:
环节 | 谁来做 | 给文章提供什么 |
|---|---|---|
理解视频结构 | VITA | 操作顺序、可能对应的时间点、画面变化 |
听懂讲解 | 语音识别 | 目标、理由、提醒和口头补充 |
读取界面 | 文字识别 | 按钮名、产品名、状态和提示文字 |
整理成文 | WorkBuddy | 步骤编排、图片位置、成功标志和注意事项 |
同一时间点的动作、旁白、截图和界面文字对齐后,才组成一个可检查的教程步骤。
下面这张 2×2 是真实执行结果。旁白、界面文字、运行记录和六步 SOP 都来自同一段视频。

Agent 先读取视频时长、分辨率和音轨,再从头到尾均匀抽取 16 帧。这样可以先确认操作是否完整,避免模型只看到开头几秒就开始写步骤。

4×4 联系图只证明整段视频被覆盖。随后,三项能力分别找动作、听讲解、读界面,WorkBuddy 按时间对齐后先生成 SOP,再改写成教程文章。
不到 60 秒的短视频直接识别整段旁白。更长的录屏会进入长音频识别或自动切片,不会因为超过一分钟就停下。关键步骤每四张合成一张 2×2,正文只挑能支撑操作的图片。
把 tencentcloud-media-review 装进桌面 Agent 后,拖入自己录制或获授权的视频,再发出下面这段要求:
把这段带旁白的软件操作视频整理成图文教程。
请用 tencentcloud-media-review 检查完整视频,用 VITA 拆步骤、语音识别转写旁白、文字识别读取关键帧。
每一步保留视频秒数、真实截图和成功标志。
最后交付 tutorial-article.md、SOP、来源表和待确认项,不要自动发布。Windows 上也可以直接运行通用入口,视频路径和输出目录都能替换:
.\scripts\run_video_to_tutorial.ps1 `
-VideoFile "D:\videos\你的教程.mp4" `
-VideoUrl "https://你已确认可上传的视频地址.mp4" `
-OutputDir "D:\tutorial-output" `
-ConfirmVitaCostVITA 需要公网视频 URL,所以桌面 Agent 会先展示 URL、完整提示词和费用风险,等用户确认后再调用。SecretId、SecretKey 和 VITA API Key 使用隐藏输入,只进入当前 PowerShell 进程。

本次视频能看到“复制 prompt”入口,但没有展示安装终端。因此生成稿只把它写成“找到安装提示词”,没有写成“安装已经完成”。
第一次视频理解给出的时间点集中在前段,平台名称也和旁白、界面文字对不上。Agent 随后按完整时长重新抽帧,用文字识别补齐后半段,没有把一次识别结果直接写进教程。
旁白、画面和界面文字会互相校对。三份证据对不上时,相关步骤进入待确认清单,不会直接混进正文。
个人创作者录完视频后,先拿生成稿补齐标题、步骤和配图,再核对待确认项,不必从空白文档重写。
团队可以把同一产品的培训录屏放进固定目录,逐条生成 SOP。业务负责人只核对按钮、成功状态和内容时效,确认后再放进知识库。
第三方教程也能作为输入,但只有获得再利用和改写许可后,才适合公开成文。能下载视频不等于拥有转载权;没有许可时,生成结果只用于个人学习笔记。

交付物是可复核初稿,不会自动发布。视频没有展示的结果也不会被补写成“已经成功”:例如画面只出现“复制提示词”按钮,就只能确认入口存在,不能据此声称安装已经完成。
录屏结束后,下一步不再是重新写一遍,而是把视频变成带证据的教程初稿,再由人完成最后确认。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。