AI Rookies

Off-policy-learning — Off-Policy Learning/离策略学习

事实

用非当前策略生成的数据来学习策略的方法。

人话

离策略像刷网购攻略,不用自己把每家坑都踩完,看别人的买家秀和避雷贴,也能少交学费。

常用于复用旧数据训练,在推荐、游戏和机器人里更省样本。

相关概念

Q-Learning
Q-Learning 是离策略学习里最经典的代表方法。

Reinforcement Learning
它属于强化学习,用历史经验而非只靠当前尝试。

Deep Q-Network
DQN 依赖经验回放,让模型用旧数据反复学习。

TD Learning
它常配合时序差分更新价值估计。