← 最新论文
🤖 machine learning

Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning

本文介绍了 CoCoEvolve,这是一个通过定义显式的、一对一的对应关系,并在训练和推理过程中通过协同进化过程来优化一致性,从而在无需昂贵标注的情况下提升跨表示理解能力的自监督框架,该框架增强了图表、表格与代码之间的理解。

原作者: Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解世界,但你只给了它三种不同的语言来描述同一件事物:一张图表的图片、一份数字组成的电子表格,以及用于绘制该图表的计算机代码。这就是“跨表示学习”(cross-representation learning)的挑战。在现实世界中,数据不仅仅是单一的存在;它既是你看到的图表,也是你阅读的表格,也是计算机遵循的指令。问题在于,这三者并不总是完美匹配的。一张图片可能由许多不同的电子表格绘制而成,而一个电子表格也可能被转化为许多不同的代码。这就像是试图将一首诗翻译成一首歌和一幅画,但你没有词典,而且翻译员一直在瞎猜。

长期以来,科学家们试图通过雇佣人类为每一个例子写下“完美”的翻译来解决这个问题。但这既昂贵又缓慢,而且通常是不可能的,因为并不存在唯一的正确答案。核心问题一直是:我们能否教会计算机在不需要人类老师每一步进行指导的情况下,去学习这些联系?我们能否让计算机通过观察图片、数字和代码是否都在讲述同一个故事,来检查自己的工作?

就在这时,一种被称为 CoCoEvolve 的新想法出现了。把它想象成一场由三个朋友进行的“传声筒”游戏,他们试图描述同一个秘密物体。在这个游戏中,一个朋友画出物体,另一个记录下测量数据,第三个编写构建它的指令。通常,如果他们出了错,这个故事就会崩塌。但 CoCoEvolve 改变了规则。他们不再等待老师说“做得好”或“再试一次”,而是让这三个朋友不断地互相检查。如果绘画与测量数据不符,或者指令构建出的图表看起来不对劲,他们就知道出错了。他们利用这种“不一致”作为改进的信号,而无需人类告诉他们答案。

该论文介绍了一个系统,其中两个 AI 模型充当这些朋友。一个模型试图将图表图像转换为表格和代码,而另一个模型则试图将该表格转回代码。它们在一个循环中不断演进。如果它们生成的代码能够实际运行并绘制出一张看起来与原始图像一致的图表,它们就会获得“奖励”。如果代码失败或图表看起来很奇怪,它们就会从失败中学习。研究人员发现,通过迫使 AI 使图片、数字和代码保持完美一致,模型对数据的理解能力得到了显著提升。

团队在四个基准测试(测试题集)上对该系统进行了测试,发现 CoCoEvolve 显著提高了 AI 的性能。在某些情况下,模型在处理未见过的全新数据时,将图表翻译为代码的能力提升了高达 37.91%,在其他复杂场景中提升了高达 46.88%。更令人印象深刻的是,该系统在不需要任何额外人工标签进行教学的情况下即可运作。它仅仅利用了不同形式数据之间的一致性作为自身的老师。

该论文还反对传统的做法,即假设每张图表都恰好对应一个完美的表格和一个完美的代码。研究人员指出,这种“一对一”的假设实际上是一个陷阱。因为一张图表可以用许多种有效的方式来描述,强迫 AI 仅选择一个“正确”答案往往会令其困惑并导致表现下降。通过拥抱“虽然存在多种有效的描述方式,但所有有效方式必须相互一致”这一理念,CoCoEvolve 避开了这些陷阱。

简而言之,这篇论文表明,与其雇佣一支教师军队来批改每一份家庭作业,我们不如通过确保 AI 的不同“语言”(图像、表格和代码)讲述同一个一致的故事,来教会 AI 成为它自己的老师。研究结果表明,这种方法是一种强大、廉价且灵活的方式,能帮助 AI 理解数据那复杂且多维的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →