一个用深度学习下围棋的强化学习模型。
它像刷题刷到封神的竞赛生:先把历年真题啃透,再自己疯狂模考,最后连老师都得倒吸一口气。
它让强化学习真正出圈,也带火了 AI 在博弈、规划和决策里的影响力。
Reinforcement-learning
AlphaGo 通过反复对弈和反馈更新策略。
Monte-carlo-tree-search
它用树搜索评估局面,并选择更优落子。
Deep-reinforcement-learning
AlphaGo 是深度强化学习出圈的标志性案例。
Alphazero
AlphaZero 延续其思路,并推广到更多棋类。