← 最新论文
💬 NLP

Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling

本文提出了一种目标自适应的文本 - 表格建模框架,该框架利用来自冻结的“作为观察者的大语言模型”的隐藏表示,能够基于有限的交互历史有效预测陌生人工智能谈判对手的决定,其表现优于直接提示和标准基于特征的基线方法。

原作者: Eilam Shapira, Moshe Tennenholtz, Roi Reichart

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Eilam Shapira, Moshe Tennenholtz, Roi Reichart

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进一个熙熙攘攘的市场,每个人都试图买卖东西,但与你交谈的实际上是机器人。你不知道它们的代码、秘密指令,或者它们内部拥有何种“大脑”。你只能看到它们说什么以及它们提供什么。

这篇论文提出的核心问题是:仅通过观察机器人进行几次交易,你能推断出它下一步会做什么吗?

以下是研究人员尝试解决该问题的一些日常类比式的简要说明。

问题: “黑盒”购物者

在现实世界中,人工智能代理(如购物机器人)正变得普遍。它们彼此协商价格。但它们的内部逻辑是一个“黑盒”。你无法窥探内部查看其代码。

  • 挑战: 如果你遇到一个新的机器人卖家,仅通过观察它在之前与其他人进行几次谈判,你能预测它会接受你的报价还是提出还价吗?

解决方案: “文本 - 表格”侦探

研究人员构建了一个系统来充当侦探。他们没有让一个庞大而强大的人工智能去“猜测”答案(他们称之为LLM 作为预测器),而是将这个问题视为使用电子表格进行的填空题

可以这样理解:

  1. 电子表格(表格): 每当机器人做出一个决定,就像电子表格中的一行。这一行包含:
    • 游戏统计数据: 轮次编号、当前价格、剩余时间。
    • 聊天记录: 机器人之间交换的文本消息。
    • “观察者”线索: 一个特殊的新功能(如下文所述)。
  2. 适应("K"场游戏): 在侦探尝试预测机器人的举动之前,他们会看到该特定机器人玩过的K场(一个小数字,如 2、8 或 16)过往游戏。这些充当了学习该特定机器人个性的“学习指南”。

秘密武器: “观察者”

这是论文最具创意的想法。通常,当你使用人工智能来理解某种情况时,你会问它“会发生什么?”,它会给你一个答案。

研究人员做了不同的尝试。他们使用一个小型的、冻结的人工智能(称为观察者)来阅读情况和聊天记录,但他们丢弃了它的回答

  • 隐喻: 想象一名侦探(观察者)正在阅读犯罪现场。侦探不是写一份报告说“是管家干的”,而是对现场产生一种突然的感觉直觉。研究人员提取了这种“直觉”(人工智能的内部隐藏状态),并将其作为线索放入他们的电子表格中。
  • 为何有效: 论文发现,人工智能的“直觉”包含了关于机器人行为方式的隐藏信号,而这些信号是人工智能实际说出的话语所遗漏的。这就像通过一个人的姿态知道他很紧张,即使他说“我很好”。

实验:两组机器人

为了测试这一点,他们使用了两组机器人:

  1. “源”组(训练班): 由顶级科技公司(如 Google、OpenAI 等)制造的 13 个机器人。它们都使用相同的指令,但拥有不同的“大脑”。系统从它们身上学习。
  2. “目标”组(测试班): 由黑客马拉松中的学生构建的 91 个机器人。这些学生都使用相同的“大脑”,但构建了不同的“身体”(不同的规则和提示)。

系统必须从“源”组学习,然后预测完全新的“目标”组的举动。

结果:电子表格获胜

研究人员比较了三种方法:

  1. 直接猜测: 询问一个大型人工智能:“这是聊天记录和机器人的过往游戏;它下一步会做什么?”
  2. 基础电子表格: 在电子表格模型中使用游戏统计数据和聊天记录。
  3. 完整侦探(他们的方法): 电子表格模型 + “观察者”的直觉。

获胜者: 完整侦探方法获胜。

  • 它在预测机器人会说“是”还是“否”(接受/拒绝)方面表现更好。
  • 它在预测机器人下一步会提供什么价格方面表现更好。
  • 关键的是: 与仅使用聊天记录和游戏统计数据相比,“观察者”的隐藏直觉增加了约4% 的准确率

结论

论文得出结论,当试图预测一个陌生人工智能下一步会做什么时,你不应该只是让一个大型人工智能去猜测。相反,你应该:

  1. 将情况转化为结构化的数据行(统计数据 + 聊天)。
  2. 使用一个小的人工智能仅仅来“阅读”情况并提取其内部的“氛围”(隐藏状态)。
  3. 将这种“氛围”输入到一个从过往示例中学习的智能电子表格模型中。

这种方法比直接让大型人工智能去“思考”更便宜、更准确,并且在适应新的、未知的机器人方面表现更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →