AI Rookies

POMDP — 部分可观测马尔可夫决策过程

事实

在信息不完整时做序列决策的数学框架。

人话

POMDP像相亲时隔着滤镜聊天:你看不清对方全貌,只能凭几句线索,边猜边决定要不要继续。

它常用于机器人、自动驾驶和对话代理,适合边观察边行动。

相关概念

Markov Decision Process
它是在 MDP 基础上,加上“看不全环境”的设定。

Belief State
看不清真实状态时,常靠信念状态来做决策。

Reinforcement Learning
很多现实强化学习任务,本质上都可建模成它。

Hidden Markov Model
它借了 HMM 的隐藏状态思路,但还要负责选动作。