配备屏幕的语音设备(如某智能终端)日益普及,这类设备需要解决多模态交互中的核心挑战:如何通过自然语言理解准确识别屏幕上被指代的对象。该任务被称为多模态指代消解,用户可能通过视觉属性("红色外套")、绝对位置("右侧第二个")、相对位置("黑色外套旁边")或对话历史("刚才提到的")来描述目标对象。
基于视觉语言预训练模型VL-BERT,研究团队进行了三项关键改进:
模型输入包含四类数据流:
在DSTC10挑战赛中,该模型以F1分数领先。其创新性体现在:
该技术将提升带屏设备的交互效率,使用户能更自然地表达意图。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。