← 最新论文
💬 NLP

Language Model Maps for Prompt-Response Distributions via Log-Likelihood Vectors

该论文提出了一种基于对数似然向量构建语言模型映射的方法,通过在近似 KL 散度的空间中量化模型差异,有效揭示了模型属性、任务表现及提示词修改对条件分布的系统性影响。

原作者: Yusuke Takase, Momose Oyama, Hidetoshi Shimodaira

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yusuke Takase, Momose Oyama, Hidetoshi Shimodaira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种给大型语言模型(LLM)“画地图”的新方法。为了让你轻松理解,我们可以把语言模型想象成不同风格的厨师,把“提示词(Prompt)”想象成顾客点的菜,把“回答(Response)”想象成厨师端上来的菜

以前的研究就像是在比较这些厨师平时喜欢吃什么(无条件分布),或者让他们现场做菜然后比较做出来的菜的味道(基于生成的文本)。但这篇论文换了一种更聪明的视角。

以下是这篇论文的核心内容,用通俗的比喻来解释:

1. 核心概念:给厨师画“反应地图”

以前的做法
想象你让所有厨师在没有任何顾客点菜的情况下,随便做一道菜。你记录他们喜欢做什么菜。这能看出厨师的“口味偏好”,但看不出他们面对特定顾客要求时会怎么做。

这篇论文的做法
作者设计了一个“测试菜单”(Prompt-Response 对),比如“请做一道宫保鸡丁”。

  • 他们不要求厨师真的把菜做出来(不生成文本)。
  • 而是直接问每个厨师:“如果你接到这个订单,你心里觉得做这道菜的概率有多大?”(计算条件对数似然)。
  • 把所有厨师对这一百道菜的心理评分记录下来,就形成了一个向量(可以想象成厨师在地图上的一个坐标点)。

结果
所有厨师都被画在了一张巨大的地图上。

  • 距离代表差异:如果两个厨师在地图上的点离得很近,说明他们面对同样的订单时,心里的“做菜思路”非常相似。
  • 地图能预测表现:地图上的位置还能反映出厨师的水平(比如 OpenLLM 排行榜的分数)。高分厨师往往聚集在地图的某个特定区域。

2. 新发现:提示词的“魔法位移”

这是论文最有趣的部分。作者发现,如果你改变一下顾客的“点菜方式”,厨师在地图上的位置会发生有规律的移动

  • 场景 A(基础):顾客说“做宫保鸡丁”。厨师在位置 A。
  • 场景 B(加个咒语):顾客说“让我们一步步思考,做宫保鸡丁”(Chain of Thought)。厨师的位置会移动到 B。
  • 场景 C(重复订单):顾客把订单重复了一遍“做宫保鸡丁,做宫保鸡丁”。厨师的位置会移动到 C。
  • 神奇的加法:如果你既加咒语又重复订单,厨师的位置移动量,几乎等于“加咒语”的移动量加上“重复订单”的移动量之和!

比喻
这就像在地图上玩向量加法

  • 往“思考”方向走一步,再往“重复”方向走一步,你就到了“既思考又重复”的地方。
  • 这意味着我们可以预测:如果我们发明了一种新的点菜方式(比如“用莎士比亚风格写代码”),我们可以根据已知的小改动,推算出厨师在新指令下的表现,而不需要真的去试错。

3. 去噪工具:PMI 向量(剔除“个人口味”)

有时候,厨师在地图上的位置不仅取决于他怎么接单,还取决于他平时喜欢吃什么(无条件分布)。

  • 比如,某个厨师特别爱吃辣,不管顾客点不点辣菜,他做什么都带辣味。这会干扰我们判断他接单的逻辑。

解决方案
作者引入了一个PMI 向量(点互信息向量)。

  • 比喻:这就像给厨师做了一次“口味矫正”。我们计算的是:“顾客点了辣菜,厨师做辣菜的额外热情”减去“厨师平时本来就爱做辣菜的热情”。
  • 效果:经过这种“去噪”处理后的地图,更能反映出厨师针对特定训练数据(比如是否专门学过川菜)的差异。如果两个厨师都专门学过川菜,在 PMI 地图上他们会靠得更近,即使他们平时口味不同。

4. 为什么这很重要?

  • 不用生成文本:以前比较模型要让他们写文章,既慢又受随机性影响(有时候写得不好是运气问题)。现在只需要算算“心里概率”,速度快且稳定。
  • 理解模型行为:我们可以直观地看到不同模型(如 Llama, Qwen, Mistral)在空间上的分布,发现它们之间的亲疏关系。
  • 预测提示词效果:通过观察“提示词位移”的规律,我们可以像做数学题一样,预测新的提示词组合会如何改变模型的表现。

总结

这篇论文就像给语言模型世界画了一张高精度的导航图

  1. 它不看模型“写了什么”,而是看模型“怎么想”。
  2. 它发现改变指令就像在地图上移动坐标,而且这些移动是可以叠加计算的。
  3. 它提供了一种方法,帮我们剔除模型自带的“个人偏见”,看清它们真正的学习成果。

这就好比我们不再需要让所有厨师真的做一万道菜来比较谁好,只需要看他们在“心理菜单”上的反应,就能精准地画出他们的能力地图,甚至预测他们面对新菜单时的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →