← 最新论文
🔬 materials science

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

本文提出了一种模式优先(schema-first)的对齐框架,该框架通过综合大规模领域知识并利用由信息检索(IR)驱动的直接偏好优化(DPO)工作流,构建出紧凑且可执行的特定领域大语言模型(LLM),使其在半导体 TCAD 和有限元(FEM)模拟等数据匮乏的科学领域中表现优于通用模型。

原作者: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代电子产品那肉眼不可见的微观世界里,驱动手机和电脑的芯片已不再仅仅是被设计出来的,而是被模拟出来的。在切割第一片硅片之前,工程师们会使用强大的软件来构建这些微型器件的数字孪生体。这些被称为技术计算机辅助设计(TCAD)的模拟过程,充当了一个虚拟实验室。它们允许科学家们预测电流将如何流经仅有几个原子厚的材料层,从而在无需承担物理制造成本或时间代价的情况下,测试数百万种变化。然而,运行这些模拟过程是出了名的困难。它需要编写复杂的、计算机可读的脚本,精确地告诉软件如何构建虚拟器件、在哪里放置材料以及如何测量结果。这些脚本必须完美无缺;一个错位的词或一个错误的数字都可能导致整个模拟失败,让工程师不得不从头再来。多年来,该行业一直依赖人类专家来编写这些脚本,这是一个缓慢、易出错且难以自动化的过程。

现在,一组研究人员开发出了一种新方法,可以教人工智能正确地编写这些脚本,即使在可用于学习的数据非常稀少的情况下也是如此。他们创建了一个名为 TcadGPT 的系统,这是一个专门用于理解半导体工程语言的专用计算机模型。与那些可以写诗或总结新闻但往往在精确技术任务上表现不佳的通用型 AI 模型不同,这个新模型经过训练,能够生成模拟软件可以实际运行的代码。研究人员发现,通过将大量的合成问答与一种独特的纠错方法相结合,他们可以教会 AI 高度可靠地生成有效的脚本。他们的工作表明,在数据稀缺且错误代价高昂的高度专业化领域,一个经过精心调优的小型 AI 模型可以超越即使是最先进的通用系统,前提是它被以正确的方式进行教学。

研究人员面临的挑战是独特的。在许多领域,AI 通过阅读现有的海量文本和代码来进行学习。但在半导体设计领域,工厂使用的真实脚本通常是保密的,而可用于学习的公开手册也不是为计算机阅读而编写的。这造成了数据短缺。为了解决这个问题,团队并没有等待更多数据的出现,而是自己创造了数据。他们利用现有的用户指南和教科书,并使用强大的 AI 生成了超过 150 万个新的问答对。他们设计了两种不同的生成方法:一种方法广泛阅读文档以捕捉通用概念,另一种则专注于材料名称或物理定律等特定关键词,以确保深度精确性。这一过程为模型奠定了坚实的知识基础,使其回答关于模拟工作原理的问题时准确率达到了 85.6%,显著超过了在相同测试中得分低于 50% 的通用 AI 模型。

然而,了解事实并不等于编写代码。研究人员发现,仅仅教模型回答问题并不足以让它编写出软件可以执行的脚本。模型经常会出现物理逻辑正确但语法错误的情况,例如命令顺序错误或遗漏关键步骤。为了解决这个问题,他们引入了第二个更严格的训练阶段。他们将经过验证的、可运行的脚本拆解成一种结构化的、逻辑性的格式,去除了特定的措辞但保留了核心含义。然后,他们创建了数千个这些脚本的变体,其中一些是完美的,另一些则带有刻意的微小错误。模型随后被展示这些配对,并被要求从中选择正确的一个,从而学会识别并避免哪怕是最微小的错误。研究人员将这一过程称为 IR-to-DPO,它教会了模型严格遵守指令。

两步训练的结果令人瞩目。当在二十条模型从未见过的全新指令上进行测试时,最终版本的 TcadGPT 成功生成了模拟软件可以无误接受的脚本,成功率达到了 80%。相比之下,顶尖的通用 AI 模型在所有二十次尝试中全部失败,生成的代码虽然看起来对人类是正确的,却被机器拒绝了。这项研究还揭示了关于 AI 在这些专业领域如何学习的一个令人惊讶的洞察。研究人员测试了在测试期间给予模型访问文档库的权限(即检索技术)是否会有所帮助。虽然这种技术对通用 AI 模型有所帮助,但实际上却损害了其专门化模型的表现。研究人员发现,对于一个已经在特定主题上进行了深度训练的模型,在测试期间加入外部信息反而会干扰它,导致它失去对所学精确规则的专注。

为了证明他们的做法不仅仅是针对某一类软件的偶然成功,团队将完全相同的训练方案应用于另一种用于解决工程领域复杂物理问题的模拟工具——Elmer。尽管这个工具与半导体软件完全不同,但使用他们的方法训练出的模型在回答问题和编写可用代码方面依然优于通用 AI 模型。这表明他们构建的框架是一种稳健的方法,可以被适配到其他数据匮乏的困难科学领域。这项工作证明,在失误可能导致数百万美元损失的高风险工程领域,未来的路径并不一定是更大、更通用的模型,而是通过极端精准和严谨的教学,打造出更小、更专业的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →