不显式学习环境模型,直接从交互中学策略或价值。
这路子像新手跑业务不背话术,先一单单碰壁,慢慢知道哪句会冷场、哪种客户更容易签。
常用于游戏对战和机器人控制,靠反复试错学会决策。
Model-Based Reinforcement Learning
它不先学环境模型,而是直接靠交互试错学习。
Q-Learning
Q-Learning 是无模型强化学习的经典价值学习方法。
Policy Gradient
策略梯度是无模型强化学习的另一条直接学策略路线。
Deep RL
深度强化学习常用神经网络实现无模型方法。