我很看好一种思路:把语音作为现有可视化应用的界面层,让说话和屏幕内容实时联动。这远远不止是呼叫中心自动化那种纯语音场景。
过去一直有个很难权衡的技术矛盾:低延迟的语音模型不够稳,而走「语音识别大模型语音合成」这套智能流程的 Agent 系统虽然聪明,但对话起来太慢。Vocal Bridge(AI Fund 投的一家 portfolio 公司)的 Ashwyn Sharma 和团队用双 Agent 架构解决了这个问题:一个前台 Agent 负责实时对话,一个后台 Agent 负责推理、约束和工具调用。
我之前给女儿做了个数学测验小应用,用 Vocal Bridge 加上语音功能,借助 Claude Code 不到一小时就搞定了。她直接说出答案,应用会用语音回复,同时更新题目和屏幕上的动画。