先学习环境模型,再用它辅助决策的强化学习方法。
武侠里真高手不会回回拿命试招,先在脑子里把对手路数过几遍,再决定这一剑出不出。
常用于机器人和自动驾驶,能减少真实试错;但内部模型不准时会带偏决策。
Reinforcement-learning
它是强化学习的重要分支,区别在于先学环境再决策。
World-model
世界模型常充当内部模拟器,帮助它预测后果。
Markov-decision-process
它通常建立在状态、动作与转移的决策框架上。
Monte-carlo-tree-search
它可结合搜索,在模拟环境里先试走几步。