← 最新论文
💬 NLP

LLM attribution analysis across different fine-tuning strategies and model scales for automated code compliance

本文通过扰动归因分析,揭示了全量微调、参数高效微调及不同模型规模对大语言模型在建筑代码合规任务中可解释性行为的显著影响,指出全量微调产生更聚焦的归因模式,而模型规模增大虽能提升对数值约束等特定要素的关注,但在 7B 以上时语义相似度增益趋于饱和。

原作者: Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Justin K. W. Yeoh

发布于 2026-04-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Justin K. W. Yeoh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在**“解剖”人工智能的大脑**,看看它到底是怎么读懂建筑法规的。

想象一下,建筑法规(比如“排水管的垂直弯头不能超过 500 毫米”)是一本厚厚的、充满专业术语的“天书”。现在的任务是让大语言模型(LLM,一种超级 AI)把这本“天书”自动翻译成计算机能执行的代码(Python 脚本)。

以前的研究只关心**“翻译得对不对”(就像只检查作业答案对不对),却完全没管“它是怎么思考的”**(就像没管学生是背下来的,还是真的理解了逻辑)。这篇论文就是要揭开这个黑盒子,看看 AI 在翻译时,到底把注意力放在了哪些字上。

为了搞清楚这一点,作者们做了两个主要的实验,我们可以用两个生动的比喻来理解:

1. 实验一:不同的“训练方法”(就像不同的“补习班”)

作者们让 AI 学习同一种知识,但用了三种不同的“补习班”策略:

  • 全量微调 (FFT):就像**“脱胎换骨”**。把 AI 整个大脑的神经连接都重新调整一遍,让它彻底变成建筑专家。
  • LoRA:就像**“贴便签”**。只调整大脑里很小一部分神经,贴上几个关键便签来适应新任务,比较省资源。
  • QLoRA:就像**“贴便签 + 压缩饼干”**。在 LoRA 的基础上,把便签压缩得更小(量化),为了更省内存,但可能会损失一点细节。

发现:

  • “脱胎换骨”的 AI(FFT):它的思考方式最**“聚焦”**。就像一位经验丰富的老工程师,一眼就能抓住核心关键词(比如"500mm"、“垂直弯头”),忽略废话。它的注意力非常集中,生成的代码也最准确。
  • “贴便签”的 AI(LoRA/QLoRA):它们的思考方式比较**“发散”**。就像新手,虽然也能猜对,但会把很多不重要的词也当成重点,显得有点“犹豫不决”或“抓不住重点”。
  • 结论:虽然“贴便签”省资源,但老工程师(全量微调)在理解法规的深层逻辑上,确实更胜一筹。

2. 实验二:不同的“大脑容量”(就像不同年级的学生)

作者们测试了不同大小的 AI 模型(从 30 亿参数到 220 亿参数),看看“脑子越大”是不是越聪明。

发现:

  • 小模型(3B):像**“小学生”**。看到法规时,它的注意力很分散,觉得每个词都挺重要,有点“眉毛胡子一把抓”,不太确定哪个才是关键。
  • 中等模型(7B):像**“高中生”**。开始能抓住重点了,注意力开始集中。
  • 大模型(22B):像**“博士”**。它的思考方式发生了质的飞跃:
    • 它不仅关注文字内容,还能敏锐地捕捉到**“规则编号”**(比如"4.3.11d"),知道这个编号本身就是关键线索。
    • 它能精准地提取**“数字约束”**(比如"2.2 米”),知道这是生成代码的核心。
    • 但是,有个有趣的“天花板”现象:当模型大到一定程度(超过 7B),虽然它偶尔能写出神一般的代码(偶尔超常发挥),但平均成绩并没有继续大幅提升。就像请了个诺贝尔奖得主来教小学算术,虽然他能解出难题,但对于基础题,和高中生差别不大了。

总结:这篇论文告诉我们什么?

  1. 不要只看结果:以前我们只看 AI 生成的代码对不对,现在我们要看它**“为什么”**这么写。这篇论文教我们如何“透视”AI 的注意力。
  2. 方法很重要:如果你想让 AI 真正理解复杂的建筑法规,**全量微调(FFT)**虽然贵,但它能让 AI 学会更精准、更聚焦的思考方式。
  3. 越大不一定越好:虽然大模型(22B)能学会更高级的策略(比如看编号、抓数字),但到了某个程度,再增加“大脑容量”带来的提升就有限了。

一句话概括
这篇论文就像给建筑行业的 AI 做了一次**“思维体检”,告诉我们:为了让 AI 真正读懂建筑法规,我们需要给它更充分的“训练”(全量微调),并且要明白,虽然大模型更聪明,但也不是越大就越完美,关键在于它是否学会了“抓重点”**的思维方式。这对于未来让 AI 在建筑、工程领域安全、透明地工作至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →