00:00
大家好,今天想分享一个我用work芭比和腾讯云AI skills做的实践,让AI同时听懂一场分享的录音,又看懂现场的板书,最后自动生成一份完整的会议纪要和语音简报。我们平时整理会议或者分享内容,通常会留下两类资料,录音和板书,PPT或者白板照片,但这两类信息其实各自只记录了一半。录音能够保留完整的讲述过程,但asr转写之后往往是一整段文字章节边界不明显,而且专业名词容易出现识别错误。板书则刚好相反,它会留下标题、数字、重点、结论和结构,但不会告诉你这个结论是怎么推导出来的。所以这次我拿了一段真实的分享录音和4张白板照片,整个流程我拆成了5步,第一步,用腾讯云OCR识别4张白板,这里使用的是腾讯云通用文字识别高精度板64张图片可以并行处理,实际测试中单张API调用耗时。
01:00
大约在1.62~2.55秒。OCR不只是识别文字,它还帮我们提取了板书里的标题百分笔、公司名称和红色标注的关键结论。当然它也不是百分之百准确,比如专业人民会出现识别错误。而且如果白板是左右分栏的OC2虽然能够把字识别出来,但阅读顺序还需要进一步整理。第二步,用腾讯云asr处理完整录音,这段录音大约295秒,最终识别得到108个分句,1607个字符,Afr处理耗时大约5.32秒,主体内容基本完整。但问题也很典型,比如应用类支付系统可能被识别成应用类支付系统,巨身智能可能被识别成巨身智能。所以到这里我们已经有了两份内容,但还不能直接交付,真正关键的是第三步双元融合。我没有简单的把OCR文本和as SR文本均在一起,而是给两种信息分别定义了职责板书、负责章节。
02:00
结构、关键数字和专业名词,录音负责补充事件背景、案例来源和因果关系。比如AR把上一部分的结尾和下一部分的出海标题粘在了一起,这时候就可以根据板书上的编号和标题把章节边界重新恢复出来。再比如asr把距身智能识别错了,板书中的文字就可以作为校正依据。同时两边重复的信息则直接标记为代核对,而不是让模型自己开。这也是work body在这个流程里比较重要的地方,而是作为agent负责拆解任务,调用不同skill读取结果,再把多路信息重新组织成最终成果。所以用户不需要自己一个个调用接口,只需要告诉work,克芭比,请识别这4张板书和这段录音。板书负责恢复章节和关键结论,录音负责补充讲述细节,最后生成完整会议纪要和1分钟语音简报,Work巴就可以把整个流程串起来,最后一步使用腾讯云TT。
03:00
S生成语音简报。这里我也遇到了一个比较实际的问题,最终提炼出来的摘要只有259个字,但一次性调用TTS依然返回了text to long, 所以不能简单按照文档里的建议只判断接口一定可以接受,而是把文本按照完整句子切成四段,再统一拼接,最后得到了一段大约54秒的语音简报。所以整个技术链路其实可以概括成一句话,OCR负责看,Asr负责听,Work巴蒂负责理解和编排,PTS再负责说出来。进一步的,我还把这套流程封装成了一个独立的会议纪要skill,把依赖检查、OCR ass、2路由、双元融合、PTS分段和结果校验这些步骤固化下来。这样下一次面对新的录音和图片,就不需要重新描述一遍流程,只需要提供素材就可以复用整个工作流。当OCR a2GTS这些单点能力被A镇真正编排起来之后,AI才开始完成一项完整的工作。
04:00
最终得到的也就不止是一份说过什么的记录,而是一份真正回答了这场分享到底讲清楚了什么,这就是这次实践最核心的价值。
我来说两句