用非当前策略生成的数据来学习策略的方法。
离策略像刷网购攻略,不用自己把每家坑都踩完,看别人的买家秀和避雷贴,也能少交学费。
常用于复用旧数据训练,在推荐、游戏和机器人里更省样本。
Q-LearningQ-Learning 是离策略学习里最经典的代表方法。
Reinforcement Learning它属于强化学习,用历史经验而非只靠当前尝试。
Deep Q-NetworkDQN 依赖经验回放,让模型用旧数据反复学习。
TD Learning它常配合时序差分更新价值估计。