1. 截图捕获与视觉编码
- 每轮交互中,感知模块首先捕获当前屏幕的高分辨率截图
- 使用视觉编码器(如 UI-TARS、Qwen-VL 系列)将像素信息转换为语义特征向量
- 模型能够识别按钮、输入框、菜单、图标、列表等各类 UI 控件
2. 多模态融合理解
- 视觉信息:从截图中提取元素位置、颜色、尺寸、层级关系
- 文本信息:通过 OCR 识别界面文本,理解按钮标签、提示文字、状态信息
- 结构化信息:结合 DOM 树或可访问性树(Accessibility Tree)获取语义化描述
3. 元素语义理解
- 不仅识别"哪里有按钮",还能理解"这个按钮的作用是什么"
- 通过多模态大模型的常识推理能力,理解图标含义、非标准 UI 模式
- 支持对模糊、遮挡、部分可见元素的鲁棒识别