前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >“阿尔法狗”进化到第四代,无需告知规则 MuZero算法自学成“棋”才

“阿尔法狗”进化到第四代,无需告知规则 MuZero算法自学成“棋”才

作者头像
matinal
发布2021-12-06 17:09:17
3700
发布2021-12-06 17:09:17
举报
文章被收录于专栏:SAP TechnicalSAP Technical

MuZero成为DeepMind最先进的AI算法。(图片来源:DeepMind公司网站)

科技日报记者 冯卫东

据最新一期《自然》杂志报道,DeepMind公司开发的一种人工智能(AI)算法MuZero,可以在不告知其游戏规则的情况下掌握围棋、国际象棋、日本将棋和视频游戏,这是谷歌人工智能部门获得的又一重大突破。

DeepMind公司表示,研究人员多年来一直在寻找一种方法,既可以学习建立用于解释当前环境的模型,也能够利用这个模型来进行最好的决策。到目前为止,大多数方法都难以在Atari这种游戏中进行有效规划。

MuZero最初在2019年推出,通过只关注环境中最重要的一个方面,来学习建立模型并解决问题。通过将这种方法与“阿尔法狗”强大的搜索树技术相结合,MuZero的能力实现了重大飞跃。此外,MuZero还利用了前瞻搜索、基于模型的规划来解决问题。

MuZero不会使用规则来找到最佳情况(因为事先不被告知),而是学习考虑游戏环境的各个方面,自己观察它是否重要。在数百万场比赛中,它不仅学习规则,而且学习位置的通用价值、成功的通用策略以及事后评估自己行为的方式。后一种功能可帮助其从自身的错误中学习、回忆和重做游戏,以尝试各种不同方法来进一步优化位置和策略价值。

MuZero不仅在国际象棋、围棋和日本将棋上达到了与提供完善规则的“阿尔法狗”一样的超人水平,在Atari游戏这样的杂乱感知输入环境中,也创造了新纪录。研究人员将MuZero描述为“在追求通用算法方面迈出的重要一步”。

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2021-01-15 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档