【论文阅读】an_optics_controlling_environm


强化学习相关的光学环境控制

Introduction部分的观点

  1. 传统上,光学和光子学的许多控制问题都是通过随机平行梯度下降(SPGD)算法与PID控制器。
  2. SPGD存在问题在于,SPGD是典型的凸优化求解器,但是光学中很多控制问题都是非凸的
  3. 之前对于光学环境控制都是使用Deep-Q learning算法。

本文的主要内容

  1. 介绍了光脉冲堆叠环境(OPS),使用OPS来评估RL算法,包括双延迟深度确定性策略梯度(TD3),soft actor-critic(SAC),近端策略优化(PPO)
  2. image-20220321192940540

如图所示,是光脉冲叠加原理的说明,OPS系统在时域范围内递归地叠加光脉冲,输入是周期脉冲序列,其周期为T,\(E_1=E(t)\),\(E_2=E(t+T)\),\(E_3=E(t+2T)\)...以此类推。

OPS递归地对两个连续脉冲对的早期脉冲施加时间延迟,例如\(E_{1,2}=E(t+\tau_1)+E(t+T)\),\(E_{3,4}=E(t+2T+\tau_1)+E(t+3t)\)...

对于N阶系统,能量提升2N倍,叠加2N个脉冲,需要N个时间延迟\(\tau\)

  1. OPS系统控制的目标是通过调整时间延迟来实现最终输出脉冲\(E_{out}\)的最大化,对应OPS系统的目标函数:

\[\arg \max _{\tau} P_{N}(\tau)=\arg \max _{\tau_{1}, \tau_{2}, \ldots, \tau_{N}} P_{N}\left(\tau_{1}, \tau_{2}, \ldots, \tau_{N}\right) \]

image-20220321203659345

两图分别是一节系统和二阶系统对应的曲线,可以看奥OPS系统的控制函数的非线性并且非凸的,并且系统是噪声敏感的,噪声不能忽略。

  1. 我们主要考虑两种噪声,一种是设备振动的快速噪声,服从均值为0的高斯分布,另外一种是缓变噪声\(\mu_t\),来自于缓慢的温度漂移,可以看成慢时间变化的分段线性函数。

    在迭代过程中,\(\mu_t\)可以看成是常数,但是在不同迭代过程中不同。

强化学习过程

image-20220321205112254

在每个步骤中,接收到OPS当前状态\(s_t\),选择动作\(a_t\)移动新的状态\(s_{t+1}\),反馈奖励\(r_t\),RL通过{}\(s_t,a_t,s_{t+1},r_t\)}进行训练,学习策略\(\pi(a,s)\)

其中:

\(s_t\)=\(E_{out}(t)\),即最终叠加脉冲强度,直接反映了控制性能,现实中通过光检测器进行贪色,并转化为数字时间序列信号。

\(a_t\)=\(\boldsymbol{\tau}(t)=\left(\tau_{1}(t), \tau_{2}(t), \ldots, \tau_{N}(t)\right)\),代表N阶系统的时间延迟,由于考虑噪声,因此实际的状态转移函数为

\(\tau_{\text {real }}(t)=\tau(t)+e_{t}=a_{t}+e_{t}, e_{t} \sim \mathcal{N}\left(\mu_{t}, \sigma\right)\)

\(\boldsymbol{r}(t)=-\frac{\left(P_{N}(\tau)-P_{\max }\right)^{2}}{\left(P_{\min }-P_{\max }\right)^{2}}\),归一化的最终脉冲能量作为奖励值,随着的模型的发展,奖励趋于0而不是一直增长。

状态跃迁由状态、动作、噪声共同控制,并且遵循相干脉冲干涉原理。

文中的思考和讨论

  • 复杂OPS系统的训练时间很长,期间需要信号的探测和模数转换,并且引入噪声

  • 提出转移训练的策略,在不同的模拟环境之间转移训练后的策略,难环境的策略可以很好的应用于简单环境,反之不行,说明难环境的训练更有意义