AI Rookies

Model-free-reinforcement-learning — Model-Free Reinforcement Learning/无模型强化学习

事实

不显式学习环境模型,直接从交互中学策略或价值。

人话

这路子像新手跑业务不背话术,先一单单碰壁,慢慢知道哪句会冷场、哪种客户更容易签。

常用于游戏对战和机器人控制,靠反复试错学会决策。

相关概念

Model-Based Reinforcement Learning
它不先学环境模型,而是直接靠交互试错学习。

Q-Learning
Q-Learning 是无模型强化学习的经典价值学习方法。

Policy Gradient
策略梯度是无模型强化学习的另一条直接学策略路线。

Deep RL
深度强化学习常用神经网络实现无模型方法。