← 最新论文
⚡ electrical engineering

GHOST: Unmasking Phantom States in Mamba2 via Grouped Hidden-state Output-aware Selection & Truncation

本文提出了 GHOST 框架,通过利用前向传播统计量近似控制理论中的平衡截断法,在无需反向传播的情况下对 Mamba2 模型进行结构化剪枝,成功在 130M 至 2.7B 参数规模下实现了 50% 的状态维度缩减,同时仅带来约 1 个困惑度的性能损失。

原作者: Michael Menezes, Anastasios Kyrillidis

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Menezes, Anastasios Kyrillidis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 GHOST 的新方法,专门用来给一种叫 Mamba2 的先进人工智能模型“瘦身”,让它跑得更快、更省内存,同时还不怎么掉智商。

为了让你轻松理解,我们可以把 Mamba2 模型想象成一家超级繁忙的跨国物流公司

1. 背景:物流公司的“仓库拥堵”危机

Mamba2 是一种很厉害的 AI,它擅长处理像写文章、写代码这种需要记住“上下文”(比如前一句话说了什么)的任务。

  • 原来的问题:为了变得更聪明,Mamba2 把它的“短期记忆仓库”(也就是论文里说的状态维度)扩大了 8 倍。
  • 后果:这就好比物流公司为了存更多货物,把仓库扩建了 8 倍。虽然能存的东西多了,但搬运工(内存带宽)根本忙不过来。每次发货(生成文字)时,搬运工都要在巨大的仓库里跑来跑去,导致卡车堵在路上,发货速度极慢,甚至把整个物流中心的内存都撑爆了。

2. 旧方法的失败:瞎剪和乱剪

以前人们想给这个仓库“瘦身”,主要用了两种笨办法,但都失败了:

  • 方法一:只看“体重”剪枝(Magnitude Pruning)

    • 比喻:就像仓库管理员只看每个货架的重量来决定保留哪个。重的货架就留着,轻的就扔掉。
    • 问题:这完全看走眼了!有些货架虽然很轻(权重小),但里面装的是急需的急件(动态能量高,经常活跃);有些货架虽然很重(权重大),但里面全是积灰的旧货(根本没人用)。
    • 结果:管理员把那些“轻但重要”的急件扔了(论文里叫Phantom States/幽灵状态),却把那些“重但没用”的旧货留着(Corporeal States/实体状态)。仓库还是堵,而且急件丢了,服务也变差了。
  • 方法二:算“痛苦指数”剪枝(Gradient-based Methods)

    • 比喻:为了知道哪个货架重要,管理员决定让所有搬运工重新走一遍整个流程,记录每一步的“痛苦程度”(梯度),以此来判断。
    • 问题:这太累了!需要巨大的计算资源和显存(VRAM),就像为了剪一个仓库,得先建一个比仓库还大的指挥中心,普通公司根本负担不起。

3. GHOST 的妙招:看“活跃度”和“影响力”

GHOST 方法(Grouped Hidden-state Output-aware Selection and Truncation)就像一位精明的物流顾问,它不看重量,也不搞复杂的重新演练,而是用一种聪明的“控制理论”来观察:

  • 核心逻辑:它同时看两个指标:
    1. 可控制性(Controllability):这个货架接收了多少货物?(输入是否驱动了它?)
    2. 可观测性(Observability):这个货架输出了多少货物?(它是否影响了最终的发货?)
  • 比喻
    • 如果一个货架既经常进货,又经常出货,说明它是核心枢纽,必须保留(这就是“活”的状态)。
    • 如果一个货架既不进货也不出货,或者只进不出/只出不进,说明它是死胡同,直接剪掉(这就是“幽灵”状态)。
  • 优势
    • 不需要重走流程:它只需要看一次正常的发货记录(前向传播),不需要重新计算复杂的梯度。
    • 精准打击:它成功识别出了那些“轻但重要”的幽灵状态,把它们保留下来;把那些“重但没用”的实体状态清理掉。

4. 实验结果:瘦身成功,速度起飞

论文做了很多测试,结果非常惊人:

  • 瘦身幅度:把仓库容量(状态维度)直接砍掉 50%
  • 性能损失:几乎可以忽略不计(在 WikiText-2 数据集上,困惑度只增加了约 1 分,相当于读起来稍微有一点点不顺畅,但完全不影响理解)。
  • 资源节省
    • 显存:以前需要 45GB 显存的方法,GHOST 只需要 15GB。
    • 速度:因为减少了搬运工的工作量,推理速度(生成文字的速度)大幅提升,不再被内存带宽卡住。
  • 鲁棒性:即使面对更长的文章(长序列)或者完全不同的领域(比如从写文章变成写代码),GHOST 剪出来的模型依然很稳,不像其他方法那样容易“翻车”。

总结

GHOST 就像是一个懂行情的仓库管理员。它不再盲目地按重量剪货架,而是通过观察谁在真正干活(动态能量),精准地清理掉那些占地方但不干活的“幽灵”区域。

一句话总结:GHOST 让 Mamba2 模型在不降低智商的前提下,砍掉了一半的内存负担,并且不需要昂贵的计算成本,让大模型能跑在更普通的电脑上,真正实现了“民主化”部署。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →