【论文阅读】an_optics_controlling_environm
强化学习相关的光学环境控制
Introduction部分的观点
- 传统上,光学和光子学的许多控制问题都是通过随机平行梯度下降(SPGD)算法与PID控制器。
- SPGD存在问题在于,SPGD是典型的凸优化求解器,但是光学中很多控制问题都是非凸的。
- 之前对于光学环境控制都是使用Deep-Q learning算法。
本文的主要内容
- 介绍了光脉冲堆叠环境(OPS),使用OPS来评估RL算法,包括双延迟深度确定性策略梯度(TD3),soft actor-critic(SAC),近端策略优化(PPO)

如图所示,是光脉冲叠加原理的说明,OPS系统在时域范围内递归地叠加光脉冲,输入是周期脉冲序列,其周期为T,\(E_1=E(t)\),\(E_2=E(t+T)\),\(E_3=E(t+2T)\)...以此类推。
OPS递归地对两个连续脉冲对的早期脉冲施加时间延迟,例如\(E_{1,2}=E(t+\tau_1)+E(t+T)\),\(E_{3,4}=E(t+2T+\tau_1)+E(t+3t)\)...
对于N阶系统,能量提升2N倍,叠加2N个脉冲,需要N个时间延迟\(\tau\)
- OPS系统控制的目标是通过调整时间延迟来实现最终输出脉冲\(E_{out}\)的最大化,对应OPS系统的目标函数:

两图分别是一节系统和二阶系统对应的曲线,可以看奥OPS系统的控制函数的非线性并且非凸的,并且系统是噪声敏感的,噪声不能忽略。
-
我们主要考虑两种噪声,一种是设备振动的快速噪声,服从均值为0的高斯分布,另外一种是缓变噪声\(\mu_t\),来自于缓慢的温度漂移,可以看成慢时间变化的分段线性函数。
在迭代过程中,\(\mu_t\)可以看成是常数,但是在不同迭代过程中不同。
强化学习过程

在每个步骤中,接收到OPS当前状态\(s_t\),选择动作\(a_t\)移动新的状态\(s_{t+1}\),反馈奖励\(r_t\),RL通过{}\(s_t,a_t,s_{t+1},r_t\)}进行训练,学习策略\(\pi(a,s)\)。
其中:
\(s_t\)=\(E_{out}(t)\),即最终叠加脉冲强度,直接反映了控制性能,现实中通过光检测器进行贪色,并转化为数字时间序列信号。
\(a_t\)=\(\boldsymbol{\tau}(t)=\left(\tau_{1}(t), \tau_{2}(t), \ldots, \tau_{N}(t)\right)\),代表N阶系统的时间延迟,由于考虑噪声,因此实际的状态转移函数为
\(\tau_{\text {real }}(t)=\tau(t)+e_{t}=a_{t}+e_{t}, e_{t} \sim \mathcal{N}\left(\mu_{t}, \sigma\right)\)
\(\boldsymbol{r}(t)=-\frac{\left(P_{N}(\tau)-P_{\max }\right)^{2}}{\left(P_{\min }-P_{\max }\right)^{2}}\),归一化的最终脉冲能量作为奖励值,随着的模型的发展,奖励趋于0而不是一直增长。
状态跃迁由状态、动作、噪声共同控制,并且遵循相干脉冲干涉原理。
文中的思考和讨论
-
复杂OPS系统的训练时间很长,期间需要信号的探测和模数转换,并且引入噪声
-
提出转移训练的策略,在不同的模拟环境之间转移训练后的策略,难环境的策略可以很好的应用于简单环境,反之不行,说明难环境的训练更有意义