GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution
本文提出了 GoCoMA 框架,通过将代码风格学与二进制预执行可执行文件(BPEA)图像表示映射到双曲空间并采用测地线余弦相似度跨模态注意力机制进行融合,显著提升了大语言模型生成代码的归属溯源能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 GoCoMA 的新工具,它的核心任务是充当“代码界的福尔摩斯”,专门用来判断一段代码到底是由哪个人类写的,还是由哪个大语言模型(LLM)生成的。
想象一下,现在的 AI 写代码写得越来越像人,甚至让人难以分辨。这就像有人用完美的笔迹模仿你的签名,或者用 AI 生成了一首听起来完全像真人写的诗。如果这段代码出了安全漏洞,或者版权有争议,我们怎么知道是谁(或者是哪个 AI)干的呢?这就是 GoCoMA 要解决的问题。
为了让你更容易理解,我们可以把 GoCoMA 的工作方式想象成**“双重身份侦探”**,它通过两个独特的视角来破案:
1. 两个视角的“双重取证”
通常的侦探只盯着“文字”看(源代码),但 GoCoMA 认为这不够,因为它还看了“指纹”和“骨架”。
视角一:源代码(像“笔迹”)
- 比喻:这就像看一个人写的文章。我们会看他的用词习惯、标点符号、段落结构,甚至他喜欢用什么特定的成语。
- 技术对应:这是代码的“风格学”(Stylometry)。不同的 AI 模型(比如 ChatGPT、Claude、Llama)在写代码时,虽然逻辑一样,但会有微妙的“说话习惯”和结构偏好。GoCoMA 用专门的 AI 模型来捕捉这些高层级的风格特征。
视角二:二进制文件图像(像"X 光片”或“指纹”)
- 比喻:想象一下,如果你把一段文字打印出来,然后把它折叠、压缩,最后变成一张只有黑白灰点的图片。这张图片里藏着纸张的纹理、墨水的分布,甚至打印机喷头的微小震动。这些是“肉眼看不见”的底层痕迹。
- 技术对应:代码在运行前会被编译成“二进制文件”(BPEA)。GoCoMA 把这些枯燥的 0 和 1 数据转换成图片。不同的编译器、优化设置会在这些图片里留下独特的“纹理”和“图案”。这就像 AI 在底层留下的“指纹”,是源代码里看不到的。
2. 核心魔法:双曲空间(Hyperbolic Space)
这是这篇论文最酷的地方。
- 普通方法(欧几里得空间)的局限:
- 比喻:想象在一个平坦的操场上(欧几里得空间)把“笔迹”和“指纹”这两个线索拼在一起。如果线索太多,或者线索之间有复杂的层级关系(比如“风格”包含“语法”,“语法”包含“词汇”),在平面上把它们挤在一起,很容易乱成一团,分不清谁是谁。
- GoCoMA 的方法(双曲空间/庞加莱球):
- 比喻:GoCoMA 把这两个线索扔进了一个像漏斗或马鞍形状的弯曲空间(双曲空间)。
- 在这个弯曲的空间里,越靠近中心代表越抽象、越高级的概念(比如整体风格),越靠近边缘代表越具体、越细节的特征(比如具体的字节纹理)。
- 这种空间就像一棵无限生长的树,它能把“大树干”和“小树枝”完美地分开,互不干扰。GoCoMA 利用这种几何特性,把“代码风格”和“二进制指纹”完美地融合在一起,既保留了它们各自的独特性,又看清了它们之间的层级关系。
3. 它是如何工作的?(三步走)
- 投影(Projection):把代码的“笔迹”和编译后的“图片指纹”分别扔进那个弯曲的“漏斗空间”里。
- 融合(Fusion):在漏斗里,用一种叫“测地线余弦注意力”的魔法(GCSA),让这两个线索互相“对话”。因为空间是弯曲的,它们能更精准地找到彼此最相关的部分,就像在迷宫里找到了最短的捷径。
- 回弹(Back-Projection):把融合后的完美线索再弹回普通的平面世界,交给最后的分类器,直接告诉你:“这段代码 99% 是 GPT-4o 写的!”
4. 结果怎么样?
论文在两个大型测试集上进行了实验,结果非常惊人:
- 单打独斗不如双管齐下:只看代码或者只看图片,都不如两者结合。
- 弯曲空间完胜平面:使用 GoCoMA 的“弯曲空间”融合方法,比传统的平面融合方法准确率高出一大截。
- 吊打通用大模型:即使是让最新的超级大模型(如 GPT-5.1)去猜是谁写的代码,它们的准确率也远不如 GoCoMA 这个专用侦探。
总结
GoCoMA 就像是一个拥有“透视眼”和“空间折叠术”的超级侦探。
它不只看代码写了什么(表面文章),还看代码编译后留下的“物理指纹”(底层痕迹)。更重要的是,它懂得在一个特殊的“弯曲空间”里整理这些线索,从而在混乱的信息中精准地揪出是哪个 AI 模型写的代码。这对于解决未来的代码版权纠纷、安全漏洞溯源(比如发现某个 AI 生成的代码有后门)具有非常重要的意义。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。