AI Rookies

Exploration-Exploitation Tradeoff — 探索-利用权衡

事实

在尝试新选择与利用已知好选择间做平衡。

人话

像租房时老盯着那套最顺眼的最省心,可你不多看几家,就不知道下一套会不会更值。

常见于强化学习、推荐和投放,影响系统敢不敢试新路。

相关概念

Reinforcement-learning
它是强化学习里最经典的决策权衡之一。

Q-Learning
Q-Learning 需要在高分动作和试新动作间平衡。

Temperature
温度可影响采样随机性,从而改变探索程度。

Policy Gradient
策略优化时,也要兼顾稳定收益和试错空间。