用深度神经网络实现强化学习的方法。
它像新人跑业务:这单成了就记套路,碰壁了就换话术,客户见多了自然会谈。
常用于游戏、机器人等决策任务,靠试错学会选动作。
Reinforcement-learning它是在强化学习框架里引入深度神经网络。
Deep-learning深度学习让它能处理图像等复杂高维输入。
DqnDQN 是深度强化学习的经典早期代表方法。
PpoPPO 是训练这类系统时常见的优化方法。