TRACE: Tourism Recommendation with Accountable Citation Evidence
本文介绍了TRACE,这是一个针对旅游对话推荐系统的综合数据集与评估框架,它通过联合评估推荐准确性、源自评论的可验证引用证据以及对用户拒绝的自适应恢复能力,在10,000轮多轮对话中解决了可信度方面的关键缺口。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在规划一次梦想假期。你向旅行社顾问询问餐厅推荐。一位优秀的顾问不会只说:“去这家店,很棒。”他们会说:“去‘小酒馆 X'。一位之前的食客莎拉在她的评论中写道,这里的意大利面是手工制作的,而且噪音水平非常适合安静的约会。”
现在,想象这位顾问是一个人工智能。论文《TRACE》(具有可问责引用证据的旅游推荐)指出,当前的人工智能旅行顾问正在通过一项关键测试:它们往往自信但未经证实。它们可能会推荐一个很棒的地方,但无法证明为什么推荐它,或者它们可能会完全编造一个理由。
以下是使用日常类比对该论文所做工作及发现结果的简要分解。
问题:那个“自信但撒谎”的旅行顾问
作者表示,现有的人工智能旅行规划师就像是一个背下了考试答案却未阅读课本的学生。
- 差距所在:当前的人工智能基准测试仅检查人工智能是否选择了正确的餐厅(准确性)。它们不检查人工智能是否真的阅读了评论以找到理由(依据性),或者当你说“不,我讨厌意大利面”时,人工智能是否能改变主意(恢复能力)。
- 风险:如果人工智能基于虚假理由将你送往一家餐厅,你会损失金钱和时间。你无法“刷新”一次糟糕的旅行。
解决方案:TRACE 基准测试
作者建立了一个名为TRACE的大型新测试平台。将其想象为人工智能旅行顾问的“驾驶考试”,但包含三个具体的障碍:
- 准确性:你是否根据我的需求选择了正确的车(餐厅/酒店)?
- 依据性:你能给我看收据吗?(人工智能必须引用真实人物的真实评论来证明其主张。)
- 恢复能力:如果我拒绝你的第一个建议,你能迅速找到符合我新规则的新建议吗?
他们创建了10,000 个游客与旅行顾问之间的虚构对话,涵盖了美国 8 个城市的 2,400 个真实地点。每次顾问提出建议时,必须指向真实用户评论中的特定句子。
重大发现:“三项能力差距”
研究人员测试了 14 种不同类型的人工智能系统(从简单的搜索引擎到先进的“大型语言模型”)。他们发现,没有任何单一的人工智能能同时擅长这三件事。这就像一支运动队,前锋擅长得分但防守糟糕,而后卫擅长拦截却无法得分。
以下是他们发现的“三项能力差距”:
1. “流利但幻觉”的人工智能(大型语言模型)
- 擅长之处:这些是聪明、健谈的人工智能。它们非常擅长理解你复杂的请求,并且如果你拒绝了一个建议,它们能迅速切换思路(恢复能力)。如果选项列表较小,它们在挑选正确地点方面表现非常出色。
- 失败之处:它们非常不擅长“出示收据”。它们经常编造引语,或者过于松散地转述评论,以至于失去了原意。它们很自信,但证据站不住脚。
- 类比:一个能言善辩的推销员,知道你的名字并能瞬间改变说辞,但可能会为了促成交易而编造产品的某个功能。
2. “机械但诚实”的人工智能(检索器)
- 擅长之处:这些是数据库搜索引擎。它们极其诚实。如果它们说某个地方有“安静的音乐”,它们会粘贴评论中写着“安静的音乐”的确切句子。它们从不说谎。
- 失败之处:它们不擅长理解语境。如果你说“我想要一个安静的地方,但不要太安静”,它们可能会感到困惑。此外,如果你拒绝了一个建议,它们通常只是再次尝试同一份列表,无法“恢复”并找到新选项。
- 类比:一位图书管理员,能找出你要求的书中的确切页码,但不理解故事情节,或者当你改变主意想要什么类型的书时无法提供帮助。
3. “综合者”人工智能
- 擅长之处:它们试图将许多评论合并为一个摘要。
- 失败之处:当你拒绝一个建议时,它们会彻底崩溃。它们陷入僵局,无法转变方向。
裁决
该论文得出结论,我们不能仅仅查看写着"AI X 是最好的”排行榜。我们需要一种新的评估人工智能的方式,要求具备所有三项技能:
- 给出正确答案。
- 用真实证据加以证明。
- 如果出错则进行修正。
目前,“聪明”的人工智能擅长第 1 和第 3 项,但不擅长第 2 项。“诚实”的人工智能擅长第 2 项,但不擅长第 1 和第 3 项。该论文认为,对于像旅行这样高风险的任务,我们需要一个能够同时做到这三点的系统,而 TRACE 正是构建和测试这些系统所需的工具。
它们未声称的内容
- 它们并未声称已经构建了一个完美的旅行应用供你今天下载。
- 它们并未声称这适用于医疗建议或法律合同(仅限旅游)。
- 它们并未声称某一个特定的人工智能模型是永远的“赢家”;它们表明,当前的技术被分割成不同的“专家”,尚未被整合在一起。
简而言之:TRACE是一套测试旅行人工智能的新规则手册,它证明了仅仅“聪明”是不够的;人工智能还必须成为一个能展示其工作过程的优秀侦探。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。