← 最新论文
💻 computer science

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

这项研究表明,将流程图与问题陈述相结合可以显著提升 GPT-4o 等多模态大语言模型的代码生成性能,其提升幅度高达 10%,且流程图的详细程度与准确性之间存在正相关关系,表现优于某些少样本学习方法。

原作者: Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何解决一个棘手的数学谜题。通常情况下,你只需给它一段关于问题的文本描述,就像一份用文字写成的食谱。但如果除了文字,你还递给机器人一张展示步骤的图画呢?这正是这项研究对名为 GPT-4o 的人工智能所做的事情。研究人员想看看,如果向 AI 展示一个流程图——即一个程序运行方式的可视化地图——是否能帮助它比只阅读文本时写出更好的代码。

把文本描述想象成一个关于如何建造树屋的长篇、曲折的故事。而流程图则像是一幅简单的素描,展示了梯子、平台和屋顶。团队发现,当他们同时给 AI 提供“故事”和“素描”时,它建造树屋(编写代码)的能力变得更强了。事实上,AI 的成功率提升了 4% 到 10%。对于那些特别难的谜题,这种提升甚至更大,达到了 10% 的水平。

但有趣的部分在于:素描需要非常完美吗?研究人员尝试给 AI 提供不同版本的流程图。有些非常详细,展示了每一颗钉子和每一颗螺丝;其他的则是“抽象化”的,意味着它们就像是一幅粗略的草图,只展示了大局,比如“这是梯子放的地方”,而没有画出横档。

他们发现,流程图越详细,AI 的表现就越好。一个只有基本轮廓(被称为“深度 0”)的素描实际上让 AI 的表现比只读文本时还要差!但随着他们增加细节(增加到“深度 2”),AI 的性能开始攀升。最详细的流程图效果最好,但即使是“深度 2”的素图也几乎和完整的完美绘图一样出色。这就像是意识到,虽然完整的建筑蓝图很棒,但一幅仍然能显示出主要房间的稍粗略的草图,也足以把工作做得很好。

团队还尝试了一种叫做“少样本学习”(Few-Shot Learning)的技巧,这就像是在要求 AI 解决一个新谜题之前,先给它看几个它以前解决过的其他谜题的例子。他们发现,仅展示一个例子(“单样本”)就对 AI 帮助很大,平均能将准确率提高约 6%。然而,展示两个例子并没有带来多少额外帮助;在某些情况下,它甚至会让 AI 感到困惑并降低准确率。看起来,AI 更喜欢一个清晰的例子,而不是一堆例子。

现在,你可能会问:“增加这些额外的绘图会花费巨资吗?”研究人员检查了价格标签。在请求中加入流程图确实增加了“Token”(AI 阅读的小数据块)的数量,而这通常意味着成本。但转折点在于:因为有了流程图,AI 能更好地理解任务,因此它写出的代码更短、更精准。这意味着它不需要通过过多的“交谈”来完成工作。结果如何?每次生成代码的总成本极低,范围大约在 0.00119(仅文本)到0.00119**(仅文本)到 **0.00189(文本加详细流程图)之间。这意味着差异不到一分钱,却换来了 10% 的准确率提升。

那么,核心结论是什么呢?这项研究表明,向多模态 AI 模型提供逻辑的可视化地图(如流程图)以及文本指令,是让它们成为更优秀程序员的一种廉价且有效的方法。它并不是解决一切问题的魔杖,研究人员也承认,这是在特定的编程谜题(来自 AtCoder 网站)上进行的测试,所以在实际应用中可能会有不同的表现。但就目前而言,看来一点点绘图就能在帮助 AI 清晰思考方面发挥巨大的作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →