SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support
本文介绍了 SpheriCity,这是一个以溯源为先的对话式人工智能原型,旨在增强可持续发展决策中可靠的知识 sensemaking(意义构建)与跨文档综合能力,并通过专家反馈进行了验证,专家反馈强调了透明的溯源和工作流对建立用户信任的关键作用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:书太多,时间太少
想象一下,你是一位正在研究如何减少塑料垃圾的城市规划师。你面前有一个庞大的图书馆,里面有 36 份不同的报告,每一份都像电话簿一样厚(大约 65 到 100 页)。这些报告充满了来自世界各地不同城市的各种数据、图表和政策。
为了回答仅仅一个问题——比如“城市 A 处理塑料袋的方式与城市 B 相比如何?”——你就必须手动翻阅数百页内容,交叉比对数字,并试图将散落在不同文档中的点连接起来。这就像是在玩一个拼图游戏,但拼图碎片被藏在 36 个不同的盒子里,你必须亲手把它们全部找出来。这既缓慢、又累人,而且很容易遗漏重要的联系。
提议的解决方案:一位“超级图书管理员” AI
研究人员开发了一个名为 SpheriCity 的工具。你可以把它想象成一位超级聪明、反应极快的图书管理员,他已经读完了那 36 份厚厚的报告,并且可以就这些内容与你进行交流。
你可以用通俗易懂的英语向它提问,例如:“减少沿海城市塑料垃圾的最佳方法有哪些?”AI 会扫描报告,找到答案,并为你写一份总结。
但这里有个陷阱: 在过去,AI 聊天机器人就像是那些自信满满却记性不佳的学生。它们可能会给你一个听起来很顺耳、甚至听起来很完美的答案,但实际上却是编造出来的(即“幻觉”),或者根本没有告诉你信息的来源。在涉及环境和公共政策的可持续发展领域,如果你无法核查作业,你就不能信任答案。
为什么 SpheriCity 与众不同: “收据”法
研究人员意识到,对于专家(城市规划师和科学家)来说,信任比速度更重要。因此,他们为 SpheriCity 设计了三个特殊功能:
- “收据”(溯源性): 每当 AI 提出一个观点时,它都会附上一张数字“收据”。它不会只说“城市 X 做了这件事”;它会说“根据 2 {2023 年报告第 42 页),城市 X 做了这件事”。这让专家可以立即点击并验证来源。
- “要点式”总结(结构化): AI 不会写一篇冗长且令人困惑的文章,而是将答案组织成清晰的要点(就像购物清单一样)。这使得快速浏览、对比以及寻找缺失信息变得非常容易。
- “脚手架”(模板): 系统为专家提供了预设的问题模板。专家无需为如何表达一个复杂的问题而苦恼,他们可以直接选择类似“比较各城市的政策”这样的模板,这有助于 AI 准确理解专家的需求。
实验:与真正的专家测试
团队并没有仅仅靠猜测来判断其效果,而是通过六位真正的可持续发展专家进行了测试。
他们给专家提供了 13 个不同的问题(例如比较印度与美国的回收政策),并要求专家对 AI 的回答进行评分。他们测试了 AI 的三种不同的“大脑”策略:
- 向量搜索 (Vector Search): 寻找听起来相似的词汇。
- 图谱搜索 (Graph Search): 寻找想法之间的联系方式(类似于关系地图)。
- 混合搜索 (Hybrid): 两者的结合。
专家们根据以下维度对答案进行评分:相关性、准确性、中立性、深度是否足够?
他们的发现:专家真正关心的是什么
结果令人惊讶且非常具有实践意义。以下是专家们的反馈:
- 信任源于“收据”,而非“流畅度”: 专家并不在乎 AI 说话是否完美或听起来是否像人类。他们在乎的是能否验证来源。如果一个答案表达得很流畅但没有页码,专家会立即产生怀疑。如果它有具体的页码引用,即使文字表达很简单,专家也会信任它。
- 他们想要的是“思考伙伴”,而不是“魔术 8 号球”: 专家并不希望 AI 给出一个单一的、最终的答案。他们希望 AI 能帮助他们进行思考。他们更倾向于那些能够展示不同角度、权衡取舍和证据的答案,以便他们进行自己的推理。他们将 AI 视为探索的起点,而非最终结论。
- 微小的错误会破坏信任: 如果 AI 出了一个小细节错误——比如把一个州误称为一个城市,或者混淆了两个不同的城市——这会摧毁专家对整个答案的信心。在涉及高风险的工作中,一个错误就会让整个回答看起来不可靠。
- 信息并非越多越好: 有时,AI 会给出非常长、非常详细且听起来令人印象深刻的答案。但如果这些答案包含了微小的虚假背景或过度泛化的内容,专家对它们的评分会低于那些较短但更稳妥的答案。他们更倾向于“部分真实”而非“完整但有风险”。
总结
论文得出结论:要让 AI 在像拯救地球这样严肃的工作中发挥作用,我们不应该再试图让 AI 听起来像一个完美的真人。相反,我们应该将 AI 设计成一个透明、负责任的助手。
可以这样想:你不需要一位只会发表自信演讲却隐藏证据的律师。你需要一位能递给你文件、指向准确页码,并对你说:“这就是证据。现在,让我们决定该怎么做。”这正是 SpheriCity 致力于为可持续发展专家提供的服务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。