跳到主内容
快讯直播
AI智模界
AI 词典

AlphaZero:不看棋谱,从零自己练成宗师

一句话定义:AlphaZero 是 DeepMind 提出的一套棋类算法——只告诉它规则,不给它任何人类棋谱,它靠自我对弈(self-play)、AI 词典:蒙特卡洛树搜索">蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)和神经网络的反复迭代,从零练出超越人类顶尖棋手的水平。

三个零件,一个循环

它其实只有三样东西:

一个神经网络,两个头。 策略头(policy)回答"这一步该往哪走",给出每个着法的概率;价值头(value)回答"照现在这个局面走,我大概会赢还是输"。你可以把它想成一个棋手的直觉。

蒙特卡洛树搜索。 面对当前局面,它不急着落子,而是往下"试走"很多条分支,根据试走的结果决定选哪一步。分支太多算不完,所以用神经网络的直觉来指路:直觉觉得有戏的分支就多看几层,没戏的就早早砍掉。

自我对弈。 自己跟自己下棋,下完知道输赢。然后做两件事:把搜索过程中算出来的着法概率当作"标准答案"去训练策略头,把最终胜负当作标签去训练价值头。

打个比方:一个棋手闭关,不读任何棋谱。每步棋他都先在脑子里推演很多变化(搜索),推演时靠直觉判断哪条线值得深挖(网络);一盘下完,赢了输了都很清楚,他就回头修正自己的直觉。下一盘推演得更准,直觉又更强——搜索让网络变强,网络又让搜索更准,转起来就停不下来。这就是它从"完全不会"到"宗师"的全部秘密,属于强化学习(reinforcement learning)里"策略迭代"的路子。

和邻居们的区别

用人类棋谱吗有搜索吗会自己学习吗
传统棋类程序常用有(人工调参评估)基本不学
纯 MCTS不用有不学,只靠随机模拟
AlphaGo 初版用(先监督学习预训练)有学
AlphaGo Zero不用有学,但只下围棋
AlphaZero不用有学,且推广到国际象棋、将棋

关键差别就在第一列和最后一列:它把"人类经验"这一项整个删掉了。 早期 AlphaGo 要先模仿人类棋谱,AlphaZero 连这一步都省了,且同一套算法换个规则就能下另一种棋。

对从业者的意义

它证明了一件事:在规则清楚、能低成本自己模拟的领域,"造数据—评分—改进"的闭环可以完全自给自足,人类先验知识不但不是必需品,有时还是天花板。这套"生成器 + 评估器"的思路,如今在推理阶段的搜索、代码与数学题的自我验证上都能看到影子。

它的局限同样明显:得有一个完美的模拟器,还得有一个干净的胜负信号。现实里大多数问题既模拟不准,也说不清什么叫"赢"。具体实现细节以官方论文和代码页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。