AI Rookies

Bandit — 多臂老虎机问题

事实

研究如何在探索新选项与利用已知收益间做决策的问题。

人话

追剧时,老剧最稳,新剧可能封神;今晚只够看一集,你得边试边押宝。

它用于推荐、广告和实验分流,动态把流量给更优选项。

相关概念

Exploration-Exploitation Tradeoff
它就是“试新路”和“走熟路”的经典练习题。

Thompson Sampling
Thompson Sampling 是求解它的代表性方法之一。

Upper-Confidence-Bound
UCB 用乐观上界来决定该多试哪一臂。

Reinforcement-learning
它常被视为强化学习里最基础的入门场景。