跳到主内容
快讯直播
AI智模界
AI 词典

蒙特卡洛树搜索:让 AI 在脑内多推演几步

一句话定义:蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS)是一种"靠随机模拟来估价值、靠统计来选方向"的搜索算法。它不追求把每一步都算到穷尽,而是把计算力优先花在看起来最有希望的分支上。

核心原理,拆成四步

想象你在陌生的城市找餐厅,手上有 100 元预算和 1 小时时间,但地图只标了大概方向。MCTS 的做法是:

1. 选择(Selection):从当前路口出发,沿着"目前评分最高"的路往下走,直到遇到没探索过的岔路。

2. 扩展(Expansion):在岔路口新开一条支路,试着走进去。

3. 模拟(Simulation):从这条新支路开始,随便乱走到终点——比如闭着眼睛随机选餐厅,最后看看吃得满不满意。这一次随机结果就是一次"蒙特卡洛采样"。

4. 回溯(AI 词典:Backpropagation">Backpropagation):把这次结果沿路往回传,更新沿途每个路口的平均分和访问次数。

然后重复成千上万次。访问次数多的路会被更信任,但算法也会故意给访问少的路一点机会,这就是著名的 UCB(Upper Confidence Bound,上置信界)公式:平均得分高 + 探索奖励大。得分高保证"不浪费",探索奖励保证"不遗漏"。

一个关键区别:它和普通搜索、和强化学习不是一回事

对比项普通 minimax 搜索MCTS强化学习策略网络
靠什么评估局面手工设计的评估函数随机模拟统计出的胜率神经网络直接预测
算力分配均匀铺开、深度固定动态倾斜到有希望的分支由网络参数决定
是否依赖随机是,随机模拟是核心训练时有,推理时可无

需要注意,MCTS 常和神经网络结合,这就是 AlphaGo 系列广为人知的思路:用策略网络缩小候选走法,用价值网络替代大量随机模拟,再由 MCTS 做最终决策。这里没有固定公式,具体实现以官方论文和页面为准。

对从业者的实际意义

AlphaGo 之后,MCTS 的思路被搬到了推理模型上:面对一道数学题或编程题,模型不再"一口气写完",而是生成多条候选思路,用某种打分机制评估,再挑选、剪枝、继续展开——这本质上就是在推理时(inference time)做搜索,用更多算力换更高的正确率。

对普通职场人也有一层启发:MCTS 教的是"把有限时间和算力,优先投入到当前最有希望、又还没被验证过的方向上",既不迷信已有经验(平均分高),也不放弃试错(探索奖励)。这个平衡点在项目管理、方案选型里同样成立。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。