机器学习｜Q-Learning（强化学习）

数据山谷

发布于 2020-07-21 15:35:33

1.6K0

发布于 2020-07-21 15:35:33

文章被收录于专栏：数据山谷数据山谷

强化学习是什么？最简单的Q-Learning算法是的原理是什么？

什么是强化学习？

我们在之前接触过了监督学习和无监督学习，强化学习可以看作是不同于二者的另一类算法，强化学习让计算机从什么都不懂的时刻开始，通过不断地尝试，从错误中学习，找到一种规律，能够掌握达到目的的方法。

强化学习的思想就类似于我们去训练一只狗，一开始它听不懂任何我们下达的指示，但是我们可以在每次说出指令并且它做出正确动作的时候，都给它一定的奖励，否则没有奖励，让它知道对错，最终每次都能够直接作出可以得到奖励的动作（正确的反应）。

与训练动物不同的是，我们所要训练的是计算机并不是一个活体，但是我们要知道电脑也是“脑”我们总会有方法来找到训练计算机的方式。

强化学习的核心

根据我们上面的介绍，很容易可以知道强化学习的核心就在于通过“行为”得到“奖励”，所以我们需要一个裁判，对计算机的行为进行打分。

这里与之前我们了解到的监督学习不同之处在于，监督学习中，我们事先知道“行为”以及对应的“奖励”是什么，但是强化学习中，要通过一次次在环境中的尝试, 获取这些“行为”和“奖励”，然后再学习通过哪些“行为”能够对应哪些“奖励”, 通过学习到的这些规律，尽可能地选择带来高分的“行为”。

Q-Learning

Q-Learning的决策

Q-Learning是一种通过表格来学习的强化学习算法

先举一个小例子：

假设小明处于写作业的状态，并且曾经没有过没写完作业就打游戏的情况。现在小明有两个选择（1、继续写作业，2、打游戏），由于之前没有尝试过没写完作业就打游戏的后果，所以小明选择打游戏、继续打游戏、接着打游戏。最终当父母回来发现小明没有写完作业就在打游戏，小明获得了一次接受男女混合双打的奖励。这给小明留下了深刻的印象，也明白了这不是一个好的做法。对于这个小的例子，我们的Q-Learning会怎么做呢？

首先我们定义两个内容：当前的状态S，可以进行的行为a，则有如下的表示形式：