在尝试新选择与利用已知好选择间做平衡。
像租房时老盯着那套最顺眼的最省心,可你不多看几家,就不知道下一套会不会更值。
常见于强化学习、推荐和投放,影响系统敢不敢试新路。
Reinforcement-learning它是强化学习里最经典的决策权衡之一。
Q-LearningQ-Learning 需要在高分动作和试新动作间平衡。
Temperature温度可影响采样随机性,从而改变探索程度。
Policy Gradient策略优化时,也要兼顾稳定收益和试错空间。