GUI Agent 与人工操作相比,准确率能达到什么水平?
1. 基准测试表现
- 在 OSWorld 基准测试中,顶级模型已达 80% 以上(如 Holo3.1-35B-A3B 达 80.0%,Claude Opus 4.7 达 83.6%)
- 人类基线约为 72.4%,领先模型已显著超过人类水平
- OSWorld 2.0(2026 年发布)扩展至 108 个长周期任务,进一步测试复杂工作流能力
2. 实际应用准确率
- 结构化任务(表单填写、数据复制):准确率可达 95% 以上
- 复杂推理任务(跨应用编排、异常处理):准确率 70% 至 85%,仍需人工兜底
- 长周期任务:随着步数增加,累积错误率上升
3. 提升方向
- 结合世界模型进行操作前的模拟预测,提升决策准确性
- 引入在线强化学习,通过实际执行反馈持续优化
- 与人工形成"AI 执行 + 人工复核"的协作模式