A distilled value head breaks search, but search remains an effective teacher, not a move selector: a case study in 19x19 Go
本研究表明,虽然从强大的围棋 AI 中蒸馏出的价值头可能会产生一个虽经校准但缺乏判别力的评估器,从而破坏 MCTS 搜索性能,但搜索过程本身仍然是一个极其有效的教师,因为通过训练策略去模仿 MCTS 的访问计数,尽管在推理阶段搜索无法选择更好的移动,仍能获得显著的强度提升。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一名才华横溢但固执的学生学习一种复杂的策略游戏,比如国际象棋或围棋。你有一个超级聪明的老师(我们称之为“先知”),他能观察棋盘并准确地告诉你谁占优。通常,当你教学生时,你会让他在与老师对弈中练习,或者让他预判几步棋以观察后续发展。在人工智能领域,这种“预判思考”被称为蒙特卡洛树搜索(MCTS)。它就像一个模拟器,能在瞬间运行数千场微小的虚拟对局,从而推算出最佳招式。
现代人工智能的核心理念是:如果将一个聪明的“大脑”(神经网络)与这个“模拟器”(MCTS)结合起来,其结果应该是无敌的。大脑负责预测招式,而模拟器负责复核。但如果模拟器反而让大脑变得更差了呢?如果那个旨在帮助你的工具实际上却把你搞糊涂了呢?这是一个研究员 Taiki Kojima 所研究的奇特谜题。他并不是在试图打造一个赢得世界冠军的机器人,他是在试图理解一个故障:即“思考”部分是如何破坏了“执行”部分的——尽管“思考”部分在用于“教学”时依然极其有用。这是一个关于“坏指南针如何依然能成为好老师的绝佳地图”的故事。
故障的指南针
在计算机围棋的世界里(一种在 19x19 网格上进行的比赛),研究人员通常通过让 AI 向一个超强的老师学习来训练它。在本研究中,这位老师是著名的 AI 程序 KataGo。研究人员提取了一个较小、较简单的 AI,并尝试使用一种称为**知识蒸馏(knowledge distillation)**的技术来模仿老师的大脑。你可以把这想象成一个学生试图背诵老师的作业答案。
通常情况下,一旦学生学会了答案,你会让他们使用自己的“思考引擎”(M서T)来检查工作,然后再做出招式。人们原本预期这会让学生变得更强。但剧情在这里发生了反转:当研究人员让学生使用 MCTS 来挑选招式时,这个学生反而变弱了。
这个学生在没有任何思考引擎辅助的情况下,自对弈胜率约为 32%。但只要它开启了“思考引擎”来辅助选招,它的胜率就大幅下降。这就像是一个原本能完美解出数学题的学生,一旦被允许使用计算器,竟然开始考试不及格了。
失灵的价值头
研究人员必须弄清楚为什么“计算器”坏了。是计算器本身(搜索算法)有缺陷?还是学生的脑子(神经网络)提供了错误的信息?
为了测试这一点,研究人员在计算的最后一步将学生的脑子替换成了老师的脑子。突然间,胜率飙升到了 98.3%。这证明了“计算器”(MCTS)本身运作完美。问题完全出在学生的脑子里。
具体来说,问题出在**价值头(value head)*上。在 AI 术语中,“价值头”是负责判断“当前局面是好是坏”的部分。该学生的价值头在判断绝对*分值方面表现尚可(它知道局面整体是赢还是输),但在比较两个相似招式时却表现得很糟糕。它无法分辨两个相邻招式中哪一个稍微更好一点。
想象一位评委,他能告诉你一幅画是“好”还是“坏”,但当你向他展示两幅同样“好”的画作时,他却无法分辨哪一幅更出色。当 AI 试图利用这个困惑的评委来挑选最佳招式时,它不断出错。搜索引擎挖掘得越深,发现的对比就越令人困惑,从而让 AI 的决策变得越来越糟。
修复方案:不要只看指南针,要看地图
研究人员尝试通过重新训练大脑的这一特定部分来修复这个“坏评委”。评委在比较招式方面确实变好了一点,但 AI 仍然无法利用搜索引擎来玩得更好。搜索引擎作为“招式选择器”依然是失效的。
于是,研究人员尝试了一种完全不同的方法。他们不再试图修复 AI 使用 搜索引擎进行选招的能力,而是决定仅将搜索引擎作为一名老师。
这里有一个神奇的技巧:
- AI 使用搜索引擎生成一个“访问分布(visit distribution)”。这是记录搜索引擎在不同招式上花费时间的痕型。即使搜索引擎最终选错了招式,它也可能在“正确”的招式上投入了大量时间。
- 研究人员随后训练 AI 的大脑去模仿这种“思考模式”(即访问分布),而不是仅仅模仿最终的招式。
- 他们移除了通常用来防止 AI 变化过大的“安全锚(safety anchor)”。
结果令人震惊。通过忽略搜索引擎的最终决策,仅将其“思考过程”作为教训,AI 得到了巨大的提升。
- 第二代(使用旧方法):AI 的表现并不比前一版本好。
- 第三代(将搜索引擎作为老师):AI 战胜原始基准线的概率达到了 94.1%,战胜前一版本的概率达到了 82.4%。
而这一切是在使用不到前一代一半的练习数据(自对弈游戏)的情况下实现的。搜索引擎是一个糟糕的选手(它选错招式的概率高达 73%),但它是一个卓越的老师。
这为何重要
论文的结论是:AI 的决策能力与教学能力之间存在巨大差异。
这就像一位自己在运动项目上表现平平的教练。如果你要求这位教练亲自上场比赛,他会输;但如果你要求他观察比赛并告诉你在哪里应该集中注意力,他可能会非常出色。本研究中的搜索引擎就像那位教练:它无法选出赢家,但它的“注意力图谱”能精准地展示给学生看,告诉学生应该在哪里学习。
这项研究还为任何构建 AI 的人敲响了警钟:不要过度信任你的“评分卡”。 研究人员发现,标准的衡量指标(例如 AI 在测试中对招式排序的能力)往往无法预测 AI 是否真的会在实战中变强。有时,即便测试分数看起来变差了,AI 的实际水平却提高了。
归根结底,这不仅仅关乎围棋。同样的问题也发生在其他 AI 领域,比如训练语言模型。有时,你用来生成答案的工具本身存在缺陷,以至于不能直接使用,但生成这些答案的过程本身却蕴含着让 AI 变得更聪明的秘密。这个教训是:不要仅仅因为老师不会打比赛,就丢弃这位老师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。