在信息不完整时做序列决策的数学框架。
POMDP像相亲时隔着滤镜聊天:你看不清对方全貌,只能凭几句线索,边猜边决定要不要继续。
它常用于机器人、自动驾驶和对话代理,适合边观察边行动。
Markov Decision Process
它是在 MDP 基础上,加上“看不全环境”的设定。
Belief State
看不清真实状态时,常靠信念状态来做决策。
Reinforcement Learning
很多现实强化学习任务,本质上都可建模成它。
Hidden Markov Model
它借了 HMM 的隐藏状态思路,但还要负责选动作。