Predicting Decisions of AI Agents from Limited Interaction through Text-Tabular Modeling
本文提出了一种目标自适应的文本 - 表格建模框架,该框架利用来自冻结的“作为观察者的大语言模型”的隐藏表示,能够基于有限的交互历史有效预测陌生人工智能谈判对手的决定,其表现优于直接提示和标准基于特征的基线方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你走进一个熙熙攘攘的市场,每个人都试图买卖东西,但与你交谈的实际上是机器人。你不知道它们的代码、秘密指令,或者它们内部拥有何种“大脑”。你只能看到它们说什么以及它们提供什么。
这篇论文提出的核心问题是:仅通过观察机器人进行几次交易,你能推断出它下一步会做什么吗?
以下是研究人员尝试解决该问题的一些日常类比式的简要说明。
问题: “黑盒”购物者
在现实世界中,人工智能代理(如购物机器人)正变得普遍。它们彼此协商价格。但它们的内部逻辑是一个“黑盒”。你无法窥探内部查看其代码。
- 挑战: 如果你遇到一个新的机器人卖家,仅通过观察它在之前与其他人进行几次谈判,你能预测它会接受你的报价还是提出还价吗?
解决方案: “文本 - 表格”侦探
研究人员构建了一个系统来充当侦探。他们没有让一个庞大而强大的人工智能去“猜测”答案(他们称之为LLM 作为预测器),而是将这个问题视为使用电子表格进行的填空题。
可以这样理解:
- 电子表格(表格): 每当机器人做出一个决定,就像电子表格中的一行。这一行包含:
- 游戏统计数据: 轮次编号、当前价格、剩余时间。
- 聊天记录: 机器人之间交换的文本消息。
- “观察者”线索: 一个特殊的新功能(如下文所述)。
- 适应("K"场游戏): 在侦探尝试预测新机器人的举动之前,他们会看到该特定机器人玩过的K场(一个小数字,如 2、8 或 16)过往游戏。这些充当了学习该特定机器人个性的“学习指南”。
秘密武器: “观察者”
这是论文最具创意的想法。通常,当你使用人工智能来理解某种情况时,你会问它“会发生什么?”,它会给你一个答案。
研究人员做了不同的尝试。他们使用一个小型的、冻结的人工智能(称为观察者)来阅读情况和聊天记录,但他们丢弃了它的回答。
- 隐喻: 想象一名侦探(观察者)正在阅读犯罪现场。侦探不是写一份报告说“是管家干的”,而是对现场产生一种突然的感觉或直觉。研究人员提取了这种“直觉”(人工智能的内部隐藏状态),并将其作为线索放入他们的电子表格中。
- 为何有效: 论文发现,人工智能的“直觉”包含了关于机器人行为方式的隐藏信号,而这些信号是人工智能实际说出的话语所遗漏的。这就像通过一个人的姿态知道他很紧张,即使他说“我很好”。
实验:两组机器人
为了测试这一点,他们使用了两组机器人:
- “源”组(训练班): 由顶级科技公司(如 Google、OpenAI 等)制造的 13 个机器人。它们都使用相同的指令,但拥有不同的“大脑”。系统从它们身上学习。
- “目标”组(测试班): 由黑客马拉松中的学生构建的 91 个机器人。这些学生都使用相同的“大脑”,但构建了不同的“身体”(不同的规则和提示)。
系统必须从“源”组学习,然后预测完全新的“目标”组的举动。
结果:电子表格获胜
研究人员比较了三种方法:
- 直接猜测: 询问一个大型人工智能:“这是聊天记录和机器人的过往游戏;它下一步会做什么?”
- 基础电子表格: 在电子表格模型中使用游戏统计数据和聊天记录。
- 完整侦探(他们的方法): 电子表格模型 + “观察者”的直觉。
获胜者: 完整侦探方法获胜。
- 它在预测机器人会说“是”还是“否”(接受/拒绝)方面表现更好。
- 它在预测机器人下一步会提供什么价格方面表现更好。
- 关键的是: 与仅使用聊天记录和游戏统计数据相比,“观察者”的隐藏直觉增加了约4% 的准确率。
结论
论文得出结论,当试图预测一个陌生人工智能下一步会做什么时,你不应该只是让一个大型人工智能去猜测。相反,你应该:
- 将情况转化为结构化的数据行(统计数据 + 聊天)。
- 使用一个小的人工智能仅仅来“阅读”情况并提取其内部的“氛围”(隐藏状态)。
- 将这种“氛围”输入到一个从过往示例中学习的智能电子表格模型中。
这种方法比直接让大型人工智能去“思考”更便宜、更准确,并且在适应新的、未知的机器人方面表现更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。