← 最新论文
💬 NLP

FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals

本文提出了一种面向 SemEval-2026 任务 13 子任务 A 的基于 CPU 的计算高效方法,用于检测大语言模型生成的代码,该方法结合了长度鲁棒的比率特征、解析工具以及一个基于浅层决策树和启发式规则的代码与文本分类器,从而在不依赖大型预训练模型的情况下实现近乎即时的推理。

原作者: Elitsa Yotkova, Violeta Kastreva, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Elitsa Yotkova, Violeta Kastreva, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座庞大的数字图书馆,其中的书籍由两类作者撰写:人类图书管理员机器人抄写员。机器人抄写员速度极快,能用多种语言写作,但它们有一个习惯:会留下特定的“破绽”,暴露其机械本质。

本文描述了一个研究团队如何为名为 SemEval-2026 的竞赛,构建了一个轻量级、超高速的侦探,用以在图书馆中识别这些机器人抄写员。

以下是该侦探的工作原理,分解为简单概念:

1. 问题:为什么识别机器人如此困难?

通常,要发现伪造者,你会寻找宏大、复杂的线索。但在计算机代码的世界里,机器人很狡猾。它们写出的代码在表面上看起来完美无缺。

  • “超级大脑”陷阱:研究人员曾尝试使用庞大、超智能的 AI 模型(如同一本全知全能的百科全书)来识别伪造者。这在训练书籍(主要由 Python 编写)上效果极佳,但当他们尝试阅读其他语言(如 Go、C# 或 JavaScript)的书籍时,“超级大脑”却陷入了困惑。这就像一位只懂英语的侦探试图在异国他乡破案;由于过于专注于特定语言,他们错过了线索。

2. 解决方案:“轻量级侦探”

团队没有使用庞大而昂贵的“大脑”,而是构建了一个简单、快速的侦探,它专注于寻找机器人无法避免重复的微小日常习惯。他们将这些称为“文体学信号”。

这就好比通过观察机器人握笔的方式来识别它,而不是分析整个句子的结构。

关键线索(“破绽”)

侦探主要寻找三样东西:

  • “话痨”式注释比例:机器人喜欢解释自己。与实际代码相比,它们往往写下过多的注释(给读者的说明)。侦探计算“话痨式说明”与“实际工作”的比例。如果一段代码中 50% 是说明,50% 是代码,那它很可能出自机器人之手。
  • “动词”检查:在机器人编写的说明中,它们以非常重复、解释性的方式使用特定的动作词(动词)。侦探会统计说明中出现的动作词数量与代码中的数量之比。
  • “文本与代码”混合:有时,机器人会不小心将整段正常对话(如聊天消息)直接粘贴到代码中。团队训练了一个微型助手逐行扫描,并询问:“这是一行代码,还是仅仅是一句话?”如果一段代码中包含太多“仅仅是句子”的内容,它就会被标记。

3. 特殊技巧(启发式规则)

侦探还基于数据中观察到的现象,使用了一些“经验法则”:

  • “语言标签”技巧:机器人常因格式问题而困惑。它们经常将语言名称(如"python"或"java")作为独立的一行写在代码开始之前。人类很少这样做。如果侦探看到单独一行写着"python",这就是一个巨大的红色警报。
  • “尾部错误”技巧:机器人有时会突然停止写作。侦探会检查代码片段的末尾。如果代码在末尾处因语法错误(如句子在单词中间结束)而戛然而止,那很可能是一个因时间或令牌耗尽而停止的机器人。

4. 如何整合所有部分

该系统不依赖单一的超级大脑,而是采用两步流程

  1. 扫描器:快速检查“语言标签”和“文本与代码”的混合情况。如果它看到明显的机器人破绽,它会立即判定:“这是机器人!”
  2. 计算器:如果扫描器不确定,它会将代码传递给一个简单的数学计算器(决策树)。该计算器会权衡“话痨比例”和“动词比例”,以做出最终猜测。

5. 结果

团队的系统极其高效

  • 无需重负荷:它可在标准计算机处理器(CPU)上运行,无需超级计算机。
  • 即时速度:它几乎能瞬间给出答案。
  • 性能:在竞赛中,这个简单、"轻量级"的侦探在所有参赛作品中进入了前 15%,击败了众多使用更复杂、更昂贵技术的系统。

总结:本文表明,你不需要超复杂的 AI 来识别 AI 生成的代码。有时,一个仅仅计算作者写了多少注释、并检查是否不小心将聊天消息粘贴到代码中的简单侦探,就足以抓住机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →