← 最新论文
🤖 machine learning

HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning

HLS-Seek 是一个感知质量与资源(QoR)的代码生成框架,它利用带有不确定性感知蒙特卡洛 Dropout 切换机制的比较代理奖励模型,高效训练一个 70 亿参数的大语言模型以用于高层次综合,在实现卓越的延迟与资源优化的同时,在语法正确性和帕累托优势方面显著超越前沿模型。

原作者: Qingyun Zou, Feng Yu, Hongshi Tan, Yao Chen, Bingsheng He, WengFai Wong

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingyun Zou, Feng Yu, Hongshi Tan, Yao Chen, Bingsheng He, WengFai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位首席建筑师,正试图设计一座定制的、高速的工厂(在本例中,这座工厂即计算机芯片)。你拥有一份用纯英语或简单代码写成的蓝图。你的目标是将这份蓝图转化为一座运行速度尽可能快、同时使用最少建筑材料(如铜线和内存块)的工厂。

这就是高层次综合(High-Level Synthesis, HLS)所面临的挑战。它是将人类思想转化为硬件指令的过程。问题在于:“最佳”设计不仅仅关乎工厂能否运转,更关乎其效率。一座能运转但需要 10 小时才能造出一辆汽车的工厂,与另一座仅需 10 分钟就能造出同样汽车的工厂相比,毫无用处,即便两辆车完全相同。

以下是论文HLS-Seek如何解决这一问题的简要说明:

问题:“慢速教师”

此前,当人工智能试图学习如何设计这些工厂时,它面临着一个巨大的瓶颈。

  • 旧方法:为了训练人工智能,你需要让它编写一个设计方案,然后将其发送至一个真实的物理工厂模拟器(称为“综合工具”),以测试其速度。
  • 弊端:该模拟器极其缓慢。测试仅一个设计方案就需要数分钟甚至数小时。若要有效训练人工智能,你需要测试成千上万个设计方案。使用这种缓慢的模拟器进行训练,就像试图通过每三天只允许测试一次引擎来学习驾驶赛车一样。这既昂贵又缓慢,完全不切实际。
  • 结果:现有的 AI 模型能够编写出能运行的代码(工厂不会烧毁),但它们不知道如何让工厂变得快速高效。它们是“功能正确”但“质量无知”的。

解决方案:“快速代理教练”

HLS-Seek 的作者意识到,要训练 AI,并不需要知道每一个单一设计的确切速度。他们只需要知道两个设计方案中哪一个更好

他们构建了一个巧妙的系统,包含三个主要部分:

1. “品鉴师”(代理奖励模型)

他们训练了一位“代理教练”,而不是将每个设计方案都发送给缓慢的真实工厂模拟器。

  • 工作原理:这位教练并排查看两个设计方案,并瞬间判断:“设计 A 比设计 B 快。”
  • 类比:想象一位品尝过成千上万道菜肴的美食评论家。他们无需称量每种食材或测量烹饪时间,就能凭经验知道哪个汉堡更好;这位“代理教练”就是那位评论家。与真实模拟器(需数分钟)相比,它快如闪电(仅需毫秒)。
  • 准确性:这位教练表现极佳,在**99.5%**的情况下能做出正确的比较判断。

2. “安全网”(不确定性感知切换)

如果 AI 尝试了一个奇怪、疯狂的设计,而“代理教练”从未见过,该怎么办?教练可能会猜错。

  • 修正方案:系统为教练配备了一个“置信度计”。如果教练不确定(置信度低),系统会自动暂停,并将该特定设计发送至真实的、缓慢的模拟器以获取实际答案。
  • 学习循环:一旦真实模拟器给出答案,系统就会将该结果反馈给“代理教练”以进行教学。随着时间的推移,教练学到的东西越来越多,需要向缓慢模拟器求助的次数越来越少,最终成为一位自我完善的专家。

3. “三阶段训练营”

AI(一个拥有 70 亿参数的模型)经历了一个严格的训练营:

  • 阶段 1(多样性):它学习以多种不同方式编写代码,仅为了掌握基础。
  • 阶段 2(推理):它学习在“说话”之前先“思考”。它会生成逐步解释,说明为何选择某些设置,从而帮助其理解硬件设计的逻辑。
  • 阶段 3(强化学习):奇迹在此发生。AI 生成许多设计方案,“代理教练”对其进行排名。AI 因更好的设计获得“奖励”,并学会重复成功的做法。由于教练速度极快,AI 可以在过去仅能练习一次的时间内,练习数千次。

结果:新的冠军

论文将这一新系统HLS-Seek与现有的最佳 AI 模型(包括 GPT-5.1 等巨头以及专用硬件模型)进行了测试。

  • 速度:与使用真实缓慢模拟器的方法相比,其训练速度快了8.5 倍
  • 准确性:尽管它是一个较小的模型(70 亿参数),但它编写的代码在语法正确性和功能完美性方面,往往优于那些庞大且昂贵的模型。
  • 质量(重大胜利):就硬件的实际性能(延迟和资源使用情况)而言,HLS-Seek 在 30 个测试用例中的16 个中产生了最快的设计。在许多情况下,它不仅仅是微调设置,而是完全重构了代码,以解锁其他模型无法找到的速度。

总结

可以将HLS-Seek想象成一名学生,过去他必须等待数天才能等到老师批改作业。现在,他拥有一位超快速、高精度的“导师”,能在过去批改一道题所需的时间内批改 1,000 道练习题。如果导师偶尔不确定,他们会向首席老师双重确认,从中学习,并变得更加聪明。结果如何?这名学生学习得更快,犯错更少,并且比任何人都能建造出更好、更快的工厂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →