在不确定性下平衡试错与收益的选臂策略。
UCB 像租房挑房:靠谱房接着看,消息少但卖相好的,也得抽空跑一趟,免得漏掉真宝藏。
常用于多臂老虎机和推荐分发,让系统边试新项边控制损失。
Exploration-Exploitation Tradeoff它是平衡探索与利用的经典做法。
Thompson Sampling它和汤普森采样都在解决试错与收益的取舍。
Reinforcement Learning它可作为强化学习里选择动作的策略。