← 最新论文
🤖 machine learning

FQTree: Fine-grained Quantization and Hardware Generation of Boosted Decision Trees

本文提出了 FQTree,这是一种结合了 QXXGB 硬件生成框架的细粒度量化感知训练算法,通过在降低 26–57% LUT 使用量的同时保持或提高准确率,优化了用于 FPGA 部署的提升决策树。

原作者: Zhiqiang Que, Chang Sun, Haiyang Wang, Dinesh Pamunuwa, Roshan Weerasekera, Qijia Tang, Bakhtiar Zadeh, Wayne Luk, Maria Spiropulu

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiqiang Que, Chang Sun, Haiyang Wang, Dinesh Pamunuwa, Roshan Weerasekera, Qijia Tang, Bakhtiar Zadeh, Wayne Luk, Maria Spiropulu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人做决策,就像电子游戏里的裁判,或者夜店里的保安。你不希望这个机器人是一个迟钝、沉重的思考者;你希望它能反应极快,在瞬息之间做出选择而不会卡顿。这就是“提升决策树”(Boosted Decision Trees, BDTs)的世界。不要把 BDT 想象成一个巨大的大脑,而要把它看作是一个由许多简单、微小的决策者组成的团队。每个成员都会问一个简单的问题,比如:“温度是否高于 20 度?”或者“速度是否超过了 50 英里/小时?”根据答案,团队会将接力棒传递给下一位成员。在队伍末端,整个团队会汇总他们的意见,做出最终决定。这些团队以擅长从杂乱的数据中发现模式而闻名,但它们有一个问题:对于驱动自动驾驶汽车或粒子物理实验等实时系统的微型、超高速芯片(称为 FPGA)来说,它们通常过于笨重且缓慢。

巨大的挑战在于,这些决策团队通常是使用“浮点”数字(如 3.14159...)进行训练的,这些数字虽然精确,但存储起来需要大量的空间和能量。为了让它们在微型芯片上运行,工程师通常尝试将这些数字挤进更小、更简单的盒子(如整数)中。但这就像试图把一大团巨大的、摇晃的果冻塞进一个小巧、坚硬的盒子里:如果你在果冻已经凝固后直接把它挤压进去,它就会破碎,导致机器人开始犯傻。旧的方法是为每个人猜测合适的盒子大小,这往往会浪费空间或毁掉机器人的聪明才智。

本文介绍了一种名为 FQTree(细粒度量化树)的巧妙新方法,以及一个配套工具 QXGB,它们改变了我们构建这些决策团队的方式。FQTree 不是先用巨大的浮点数训练团队,然后再试图稍后将其挤进盒子里,而是让团队在学习的过程中就学会用小巧、简单的盒子来思考。这就像是从第一天起就训练一名体操运动员在窄窄的平衡木上练习,而不是让他们在宽阔的地面上练习,然后在比赛前突然强迫他们上平衡木。

其秘诀在于,FQTree 意识到决策团队中的成员并非同等重要。前几个成员负责做出重大、明显的判断,因此需要非常精确。而后面的成员仅负责进行微小的调整以修正小误差,因此不需要那么精确。FQTree 会自动计算出每个成员究竟需要多少“脑力空间”。它给大思考者更多的比特(更多的细节),给小思考者更少的比特(更少的细节),从而节省了大量的空间。它还使用了一种被称为“偏置折叠”(bias folding)的技巧,这就像是将所有数字进行平移,使它们都变成正数,从而允许硬件丢弃符号位,变得更加简单。

一旦团队以这种高效的方式训练完成,QXGB 框架就会充当一个神奇的翻译官。它能将训练好的团队瞬间转化为一个定制的芯片硬件蓝图,而无需人类工程师为每一个新设计重新绘制电路。结果令人印象深刻:在三项不同的测试中(一项是识别手写数字,一项是识别物理学中的喷注粒子,另一项是寻找网络入侵者),该方法比目前最先进的方法节省了 26% 到 57% 的硬件空间(具体指查找表,即 LUTs),同时保持了同样高水平甚至更高的准确率。在某些情况下,它甚至让决策速度提高了两倍。这是一个双赢的结果:机器人的体积更小、速度更快,而且依然一样聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →