AI Rookies

MBRL — 基于模型的强化学习(Model-Based Reinforcement Learning)

事实

先学习环境模型,再用它辅助决策的强化学习方法。

人话

武侠里真高手不会回回拿命试招,先在脑子里把对手路数过几遍,再决定这一剑出不出。

常用于机器人和自动驾驶,能减少真实试错;但内部模型不准时会带偏决策。

相关概念

Reinforcement-learning
它是强化学习的重要分支,区别在于先学环境再决策。

World-model
世界模型常充当内部模拟器,帮助它预测后果。

Markov-decision-process
它通常建立在状态、动作与转移的决策框架上。

Monte-carlo-tree-search
它可结合搜索,在模拟环境里先试走几步。