首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >GUI Agent >GUI Agent 与人工操作相比,准确率能达到什么水平?

GUI Agent 与人工操作相比,准确率能达到什么水平?

词条归属:GUI Agent

1. 基准测试表现

  • 在 OSWorld 基准测试中,顶级模型已达 80% 以上(如 Holo3.1-35B-A3B 达 80.0%,Claude Opus 4.7 达 83.6%)
  • 人类基线约为 72.4%,领先模型已显著超过人类水平
  • OSWorld 2.0(2026 年发布)扩展至 108 个长周期任务,进一步测试复杂工作流能力

2. 实际应用准确率

  • 结构化任务(表单填写、数据复制):准确率可达 95% 以上
  • 复杂推理任务(跨应用编排、异常处理):准确率 70% 至 85%,仍需人工兜底
  • 长周期任务:随着步数增加,累积错误率上升

3. 提升方向

  • 结合世界模型进行操作前的模拟预测,提升决策准确性
  • 引入在线强化学习,通过实际执行反馈持续优化
  • 与人工形成"AI 执行 + 人工复核"的协作模式
相关文章
为什么 AI 能一句话操作手机和电脑?(GUI Agent 最新综述)
来自《Large Language Model-Brained GUI Agents: A Survey》综述总结
陈宇明
2025-02-26
1.2K0
员工吐槽“给 AI 擦屁股”更辛苦?揭秘企业 AI 提效的“悖论”与真拐点
在数字化浪潮席卷全球的今天,AI 正以前所未有的深度和广度融入企业发展的脉络之中,成为驱动创新与增长的核心引擎。那么,如何通过 AI 技术发现新的商业与增长机会?又如何利用 AI 实现更高效的用户拉新、留存与转化呢?
深度学习与Python
2025-12-18
4200
2025国产Agent推荐:从选型到实战,实在Agent为何适配90%用户?
“每天花3小时手动录入数据、跨5个系统生成报表,明明是技术时代却还在做‘人工机器人’”——这是某制造业文员在行业论坛上的吐槽,却意外引发数千条共鸣。随着《2024年中国AI Agent行业研究报告》指出该领域已进入“实用化爆发期”,越来越多人开始搜索“推荐一款国产AI Agent”,但面对百度文心智能体、字节扣子等数十款产品,却陷入“选功能还是选适配”的困境。
极客老王说Agent
2025-11-04
2K0
微软GUI智能体OmniParser二代开源!推理延迟降低60%,大模型玩手机更溜了
然而,使用通用大型语言模型(LLM)作为GUI智能体仍然存在难点:1)如何可靠地识别用户界面中的可交互图标,以及 2)理解截图中各种元素的语义,并准确地将预期的操作与屏幕上的相应区域关联起来。
新智元
2025-03-07
1.3K0
让GUI智能体不再「过度执行」,上海交大、Meta联合发布OS-Kairos系统
本文第一作者是上海交通大学计算机学院三年级博士生程彭洲,研究方向为多模态大模型推理、AI Agent、Agent 安全等。通讯作者为张倬胜助理教授和刘功申教授。
机器之心
2025-07-03
6530
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券