AI Rookies

UCB — Upper Confidence Bound/置信上界算法

事实

在不确定性下平衡试错与收益的选臂策略。

人话

UCB 像租房挑房:靠谱房接着看,消息少但卖相好的,也得抽空跑一趟,免得漏掉真宝藏。

常用于多臂老虎机和推荐分发,让系统边试新项边控制损失。

相关概念

Exploration-Exploitation Tradeoff
它是平衡探索与利用的经典做法。

Thompson Sampling
它和汤普森采样都在解决试错与收益的取舍。

Reinforcement Learning
它可作为强化学习里选择动作的策略。