研究如何在探索新选项与利用已知收益间做决策的问题。
追剧时,老剧最稳,新剧可能封神;今晚只够看一集,你得边试边押宝。
它用于推荐、广告和实验分流,动态把流量给更优选项。
Exploration-Exploitation Tradeoff
它就是“试新路”和“走熟路”的经典练习题。
Thompson Sampling
Thompson Sampling 是求解它的代表性方法之一。
Upper-Confidence-Bound
UCB 用乐观上界来决定该多试哪一臂。
Reinforcement-learning
它常被视为强化学习里最基础的入门场景。