一种靠自我对弈学习棋类策略的强化学习模型。
像健身房里对着镜子加练的人,没人手把手带,它自己跟自己较劲,最后把动作卷成标准答案。
主要用于围棋、国际象棋和将棋,证明 AI 靠自我对弈也能学出顶级策略。
Alphago
它可看作 AlphaGo 的通用化升级,不再只为围棋设计。
Reinforcement-learning
它靠自我对弈和胜负反馈,持续改进下棋策略。
Monte-carlo-tree-search
它在对局时配合 MCTS 搜索,更高效挑选落子。
Deep-reinforcement-learning
它是深度强化学习的代表成果之一。