1. 感知模块(Perception Module)
- 视觉编码器:使用 ViT(Vision Transformer)或专门的 UI 解析器(如 OmniParser、UI-TARS)从屏幕截图中提取 UI 元素、边界框和文本标签
- OCR 识别:结合光学字符识别技术识别界面文本内容,支持中英文等多种语言
- 元素定位:精确定位可操作元素的屏幕坐标,支持像素级和归一化坐标两种表示方式
2. 规划模块(Planning Module)
- LLM/MLLM 推理核心:以大语言模型或多模态大模型为认知核心,将用户指令分解为可执行的操作步骤
- 思维链推理(Chain of Thought):支持逐步推理过程,记录思考轨迹,提升复杂任务的规划能力
- 动作生成:输出结构化的原子操作指令,如 {"action_type": "click", "element_id": 15}
3. 记忆模块(Memory Module)
- 显式情景记忆:以图结构或链式结构存储页面节点、元素交互和操作序列,支持长周期任务的上下文保持
- 页面图构建:构建页面间的拓扑关系,支持结构化检索和快捷路径学习
- 经验复用:通过进化式快捷发现机制,学习高频操作的最优路径
4. 执行模块(Action Interface)
- 底层动作接口:通过 ADB(Android)、pyautogui(桌面)、Windows UI Automation 等接口执行原子操作
- 动作类型:支持点击、输入、滑动、长按、拖拽、滚动等基础 GUI 操作
- 平台适配层:根据目标平台自动选择合适的执行后端