Reinforcement Learning with Long Short-Term Memory


郑重声明:原文参见标题,如有侵权,请联系作者,将会撤销发布!

ADVANCES IN NEURAL INFORMATION PROCESSING SYSTEMS 14, VOLS 1 AND 2, (2002): 1475.0-1482.0

Abstract

  本文介绍了使用长短期记忆循环神经网络的强化学习:RL-LSTM。使用Advantage(λ)学习和定向探索的无模型RL-LSTM可以解决相关事件之间存在长期依赖关系的非马尔可夫任务。这在T形迷宫任务以及杆平衡任务的困难变化中得到了证明。

1 Introduction

  强化学习(RL)是一种基于延迟奖励信号学习如何行为的方法[12]。强化学习面临的更重要挑战之一是环境状态的一部分对智能体隐藏的任务。此类任务称为非马尔可夫任务或部分可观察马尔可夫决策过程。许多现实世界的任务都有这个隐藏状态的问题。例如,在导航任务中,环境中的不同位置可能看起来相同,但一个相同的动作可能会导致不同的下一个状态或奖励。因此,隐藏状态使RL更加真实。然而,这也让它变得更加困难,因为现在智能体不仅需要学习从环境状态到动作的映射,为了获得最佳性能,它通常还需要确定它处于哪种环境状态。

Long-term dependencies. 如果相关事件之间存在长期依赖关系,则大多数解决非马尔可夫RL任务的方法都会出现问题。长期依赖问题的一个示例是迷宫导航任务,其中区分两个看起来相同的T形路口的唯一方法是在任一T形路口之前很长时间记住观察或动作。这种情况为固定大小的历史窗口方法[6]带来了明显的问题,该方法试图通过使选择的动作不仅取决于当前观察,还取决于固定数量的最近观察和动作来解决隐藏状态。如果要记住的相关信息落在历史窗口之外,智能体就不能使用它。McCallum的变量历史窗口[8]原则上具有表示长期依赖关系的能力。但是,系统从零历史开始,逐步增加历史窗口的深度。这使得学习长期依赖变得困难,特别是当没有短期依赖可以构建时。

  非马尔可夫任务的其他方法基于学习有限状态自动机[2]、循环神经网络(RNN)[10, 11, 6],或学习设置记忆位[9]。与历史窗口方法不同,它们不必表示(可能很长)整个历史,但原则上可以在任意时间内提取和表示相关信息。然而,事实证明,学习这样做很困难。考虑到它们之间分散注意力的观察和行动,困难在于发现一条信息与该信息在以后变得相关的时刻之间的相关性。这种困难可以看作是学习时间序列数据中长期依赖关系的一般问题的一个例子。本文针对这个问题使用了一种特殊的解决方案,该解决方案在有监督的时间序列学习任务中运行良好:长短期记忆(LSTM)[5, 3]。在本文中,LSTM循环神经网络与无模型RL结合使用,其精神与[10, 6]的无模型RNN方法相同。下一节将介绍 LSTM。第3节介绍了LSTM在称为RL-LSTM的系统中与强化学习的结合。第4节包含对具有长期依赖性的非马尔可夫RL任务的模拟结果。最后,第5节给出了一般性结论。

2 LSTM

  LSTM是最近提出的循环神经网络架构,最初是为监督时间序列学习而设计的[5, 3]。它基于对传统循环神经网络学习算法的问题的分析,例如时序反向传播(BPTT)和实时循环学习(RTRL)在学习具有长期依赖关系的时间序列时具有。这些问题归结为一个问题,即及时传播的误差往往会消失或爆炸(参见[5])。

Memory cells. LSTM对这个问题的解决方案是在许多专门的单元中强制执行恒定的误差流,称为恒定误差转盘(CEC)。这实际上对应于这些具有不随时间衰减的线性激活函数的CEC。为了防止CEC填充来自时间序列的无用信息,使用其他专门的乘法单元(称为输入门)来调节对它们的访问。像CEC一样,输入门接收来自时间序列和网络中其他单元的输入,它们学会在适当的时刻打开和关闭对CEC的访问。从CEC的激活到网络的输出单元(可能还有其他单元)的访问是使用乘法输出门来调节的。与输入门类似,输出门学习何时将存储在CEC中的信息发送到网络的输出端。最近添加的是忘记门[3],当存储在CEC中的信息不再有用时,它会学习重置CEC的激活。CEC与其相关的输入、输出和遗忘门的组合称为记忆单元。有关存储单元的示意图,请参见图1b。也可以将多个CEC与一个输入、输出和遗忘门组合在一个所谓的内存块中。

Activation updates. 更正式地说,网络在每个时间步骤 t 的激活计算如下。标准隐藏单元的激活yh、输出单元激活yk、输入门激活yin、输出门激活yout和遗忘门激活yφ以下列标准方式计算:

其中Wim是从单元 m 到单元 i 的连接的权重。在本文中,fi是除输出单元外的所有单元的标准逻辑sigmoid函数,它是恒等函数。CEC激活,或存储块 j 中存储单元 v 的"状态",被计算如下:

其中 g 是一个逻辑sigmoid函数,缩放到范围[-2, 2]和。存储单元的输出由下式计算:

其中 h 是一个逻辑sigmoid函数,缩放到范围[-1, 1]。

Learning. 在时间序列的某些或所有时间步骤上,网络的输出单元可能会出现预测误差。误差通过除CEC之外的所有单元(包括门)在时间上倒退一步传播。然而,使用RTRL的高效变体[5, 3],误差会通过CEC无限期地反向传播。每个时间步骤都会进行权重更新,这与在线RL的理念非常吻合。学习算法略微适用于RL,如下一节所述。

3 RL-LSTM

  RNN,例如LSTM,可以以多种方式应用于RL任务。一种方法是让RNN学习环境模型,该模型学习预测观察和奖励,并以此方式学习推断每个点的环境状态[6, 11]。LSTM的架构将允许预测依赖于很久以前的信息。然后,基于模型的系统可以学习从(推断的)环境状态到动作的映射,就像在马尔可夫案例中一样,使用标准技术,如Q学习[6, 2],或通过冻结模型反向传播到控制器[11]。另一种无模型方法,也就是这里使用的方法,是使用RNN直接近似强化学习算法的价值函数[10, 6]。环境的状态由当前观察值(网络的输入)和网络中的循环激活(代表智能体的历史)来近似。与基于模型的方法相比,这种无模型方法的一个可能优势是,系统可以学习仅在对获得更高奖励有用的情况下解决隐藏状态,而不是浪费时间和资源来尝试预测与获得奖励无关的环境特征[6, 8]。

Advantage learning. 在本文中,RL-LSTM网络近似于优势学习[4]的价值函数,它被设计为对连续时间RL的Q-Iearning的改进。在连续时间RL中,相邻状态的价值以及给定状态下不同动作的最佳Q值通常只有很小的差异,这很容易在噪声中丢失。优势学习通过人为地降低每个状态中次优动作的价值来解决这个问题。在此,优势学习用于连续时间和离散时间RL。请注意,相邻状态价值之间的微小差异的相同问题适用于任何具有长奖励路径的RL问题。为了展示RL-LSTM弥合长时间滞后的潜力,我们需要考虑此类RL问题。一般来说,优势学习可能比Q-Iearning更适合非马尔可夫任务,因为它似乎对准确地获得价值估计不太敏感。

  LSTM网络的输出单元直接编码不同动作的优势价值。图1a显示了本文中使用的一般网络架构。与使用函数近似器的Q-learning一样,时序差异误差ETD(t)源自优势学习[4]的贝尔曼方程的等价,被视为函数近似器在时间步骤 t 处的预测误差:

其中A(s, a)是状态 s 中动作 a 的优势价值,r 是即时奖励,V(s) = maxa A(s, a)是状态 s 的价值。γ 是[0,1]范围内的折扣因子,κ是最佳和次优动作价值之间差异的常数缩放。与执行的动作以外的其他动作相关的输出单元不接收误差信号。

Eligibility traces. 在这项工作中,优势学习通过资格跟踪进行了扩展,这通常被发现可以改善RL中的学习,尤其是在非马尔可夫领域[7]。这产生了Advantage(λ)学习,并且必要的计算结果与Q(λ)学习[1]中的结果几乎相同。它要求每个权重Wim存储一个资格迹eim。权重更新对应于:

K 表示与执行的动作相关的输出单元,a 是学习率参数,A 是确定资格迹衰减速度的参数。eim(0) = 0,如果采取探索性行动,则eim(t - 1)设置为0。

Exploration. 非马尔可夫强化学习需要特别注意探索问题[2, 8]。无向探索尝试在每种环境状态下以相同的方式尝试动作。 然而,在非马尔可夫任务中,智能体最初并不知道它处于哪种环境状态。部分探索必须旨在发现环境状态结构。此外,在许多情况下,非马尔可夫环境将提供明确的观察结果,指示某些部分的状态,而在其他部分提供模糊的观察结果(隐藏状态)。一般来说,我们希望在模棱两可的部分进行更多的探索。

  本文采用基于这些想法的定向探索技术。一个单独的多层前馈神经网络,具有与LSTM网络相同的输入(代表当前观察)和一个输出单元yv,与LSTM网络同时训练。它使用标准反向传播进行训练,以预测由公式4定义的当前时序差分误差ETD(t)的绝对值,加上它自己在下一个时间步骤的折扣预测:

其中是输出yv(t)的期望值,并且 β 是[0, 1]范围内的折扣参数。从某种意义上说,这相当于尝试识别哪些观察结果是"有问题的",它们与当前价值估计中的大误差(第一项)相关联,或者先于具有大此类误差的情况(第二项)。yv(t)被线性缩放并用作玻尔兹曼动作选择规则的温度[12]。对于当前观察,估计的优势价值之间的差异很小(玻尔兹曼探索的标准效果),或者当前优势价值或不久之后的优势价值存在很多"不确定性"(这种定向探索方案的效果)时,最终结果是进行了很多探索。这种探索技术与统计上更严格的区间估计技术(参见[12])以及某些基于模型的方法有明显的相似之处,当存在模型预测中的更多不确定性时探索会更大[11]。

4 Test problems

Long-term dependency T-maze.

T-maze with noise.

Multi-mode pole balancing.

5 Conclusions

  本文提出的结果表明,使用 Long Short-Term ~v1emory (RL-LSTI\,f) 的强化学习是解决具有长期依赖关系的 non-:r-v1arkovi&t~ RL 任务的一种很有前途的方法。 这在具有最多 70 个时间步长的最小时滞依赖性的 T 迷宫任务中得到了证明,并且在极点平衡的非马尔可夫版本中得到了证明,其中最佳性能需要无限期地记住信息。  RL-LSTM 的主要力量来源于 LSTM 的恒定误差流特性,但是为了在 RL 任务中获得良好的性能,与 Advantage(A) 学习和定向探索的结合是至关重要的。