✨ 要点🔬 技术摘要
想象一下,你正站在一座巨大的、繁忙的图书馆里,这里的书架由光组成,而书籍则由对话构成。长期以来,人们一直在向图书管理员(实际上是被称为人工智能的超级智能程序)提出简单的问题,比如“历史区在哪里?”或“天气怎么样?”这就是信息检索 的世界:从机器中获取事实。但最近,这些图书管理员开始表现得更像合作伙伴。他们不仅是指给你一本书,还开始帮助你撰写故事、规划情节,甚至决定拯救哪个角色。这种转变正在人机决策 领域发生,该领域研究我们如何与计算机共享决策的心理负荷。核心问题不再仅仅是“AI知道什么?”,而是“我们让AI握住了多少方向盘?”我们是在把它当作地图使用,还是在让它驾驶汽车?这至关重要,因为随着AI在决策方面变得越来越出色,我们需要了解我们是否仍然是自己金融航船的船长,还是正在慢慢交出钥匙。
这篇题为《从信息到委托:绘制人机金融决策图谱》的论文,深入探讨了数字时代的钱包,以观察人们究竟是如何利用AI来处理他们的金钱事务的。作者团队来自Stripe Partners,他们分析了美国和印度用户与两个流行的AI助手——ChatGPT和Gemini之间超过150万次 真实的对话。他们不仅统计了人们询问金钱的次数,还构建了一种新型的“行为显微镜”来观察人们如何与AI互动。他们将每一次聊天按信任程度分为三个等级,就像视频游戏的难度设置一样:
第一级(告知): AI是一个图书管理员。你问:“利率是多少?”它回答。你负责思考。
第二级(塑造): AI是一个教练。你问:“我应该买这只股票吗?”或者“我该如何提高信用评分?”AI会提供建议、对比选项或帮助你进行规划。你仍然做最终决定,但AI在塑造你的决策。
第三级(行动): AI是一个驾驶员。你说:“把我的钱转到最好的账户里,”AI就真的去执行了。
研究人员发现,虽然金融服务已经是人们使用AI的一个巨大组成部分(研究中的约一半用户在某个时刻谈论过金钱),但我们大多仍停留在“图书管理员”和“教练”区域。数据表明,消费者压倒性地使用AI来告知 他们的选择(美国约为63.5%,印度约为72.1%)并塑造 他们的策略(美国约为58.6%,印度约为49.7%)。人们热衷于让AI对比信用卡、解释税务规则或研究偿还债务的最佳方式。
然而,论文明确排除了人们已经准备好让AI接管方向盘的观点。“驾驶员”级别,即AI实际执行金融交易或自主做出决策,是非常罕见的。在美国,只有0.3%的金融对话涉及委托;而在印度,这一比例仅为微小的 0.1% 。几乎没有这些对话是关于AI进行大规模自主决策的,它们大多是简单的、基于指令的任务,比如设置预算提醒或追踪支出。作者认为,尽管关于“代理型AI”(即能自主行动的AI)的炒作非常热烈,但目前人们表现得非常谨慎。他们想要一个聪明的助手来帮助他们思考,但还没准备好让机器人去签发支票。
这项研究还强调了两个国家之间一些有趣的差异。在美国,人们主要使用AI来解决银行账户问题、处理支付问题,或应对保险和公共援助。而在印度,对话更多地集中在投资、股市研究以及学习金融知识上。但两者的核心结论是一致的:我们正处于一个“塑造”时代。我们正在利用AI构建更好的金融地图并规划路线,但我们仍然是握着方向盘的人,一旦道路变得复杂,我们会随时接管。作者总结道,这一框架为我们观察未来的变化提供了一个基准,并暗示对于目前而言,AI是一个强大的判断工具,而非替代品。
技术摘要:从信息获取到任务委派:绘制人类-人工智能金融决策图谱
问题陈述
随着大语言模型(LLMs)从被动的信息检索工具演变为主动的决策支持伙伴,理解在金融等高风险领域中决策权如何在人类与人工智能之间分配成为了一个关键差距。先前的研究主要通过主题 (如“投资”或“税务”)来刻画金融 AI 交互,或仅评估 AI 输出的质量。这些方法未能捕捉 AI 在更广泛的人类决策过程中的行为角色 。具体而言,目前缺乏经验性数据来量化用户是在利用 AI 告知 其选择、塑造 其策略,还是将执行和自主决策委派 给系统。本文旨在建立一个行为测量框架,超越主题分类,转而分析决策权的分配情况。
研究方法
数据收集与预处理
本研究利用了来自美国和印度、在 2025 年 8 月至 10 月期间通过 ChatGPT 和 Gemini 收集的 153 万条真实世界用户提示词 ,涵盖 6,304 名用户 。
人口统计特征: 与人口普查基准相比,美国样本(2,499 名用户)呈现出女性比例较高、年龄较轻及收入较低的特征;印度样本(3,805 名用户)则以男性和年轻人为主。
预处理:
翻译: 将印度群体中的非英语对话(14.4 万条消息)使用 Google 翻译转换为英语,以确保跨市场可比性。
对话切分: 为解决单次会话中的“主题漂移”问题,将原始对话切分为**“子对话”(subchats)**(即特定主题的单元)。基于低频词重叠度和提示词长度应用切分规则,最终得到约 50.5 万个子对话。
模型框架
作者提出了一个三阶段 NLP 流水线来对金融交互进行分类:
金融子集识别:
任务: 通过二分类检测子对话是否讨论金融服务、收入生成或金钱相关问题。
模型: 使用了一个在 5.8k 个人工标注的子对话上进行微调的 LongFormer 模型(因其具备 4,096 个 token 的上下文窗口而被选中)。
性能: 在测试集上实现了 96.5% 的准确率 和 97.3% 的 F1 分数 。
金融服务(FS)标签化:
任务: 将金融子对话中的实体映射到由 9 个类别(如零售银行业务、投资、税务、保险)及其子类别组成的 MECE(相互独立、完全穷尽)分类体系中。
方法: 使用两阶段过程,首先利用 GPT-4o-mini 进行实体提取和标准化,随后通过确定性映射到分类体系。
验证: 通过人工审查高频关键词来过滤误报,从而形成了一个包含 2.7k 个匹配金融服务关键词的精选词典。
意图与决策权限分类:
任务: 对 12 个类别的用户意图进行多标签、多分类,并将其映射到三个**决策权限(DA)**等级:
第 1 级(告知/Inform): 提供信息或解释。
第 2 级(塑造/Shape): 发挥分析/咨询作用以影响用户选择。
第 3 级(行动/Act): 承担交易/自主角色以执行动作。
模型: 使用了一个在 3.4k 个标注子对话上进行微调的 BigBird 模型(一种稀疏注意力 Transformer)。为了解决现实世界中高代理性(第 3 级)样本稀缺的问题,研究使用了由 GPT-5.5 生成的合成数据进行数据增强。
性能: 通过针对特定标签的概率阈值处理,将 Micro-F1 从 68.0 提升至 70.6 。
主题建模:
方法: 利用 BERTopic 对总结后的子对话进行处理,并使用 Harrier 嵌入模型来识别具体的金融活动及市场间的差异。
核心贡献
行为测量框架: 本文引入了一个结合行为意图 (用户寻求什么)与委派决策权限 (用户分配多少控制权)的新颖框架。这实现了分析视角的转变:从“讨论了什么主题”转向“AI 在决策过程中扮演什么角色”。
大规模经验基准: 本研究提供了对两个不同市场(美国和印度)中人机金融交互的首次大规模刻画,为评估向日益具代理性的 AI 系统过渡建立了基准。
核心结果
金融交互的普遍性
金融服务是对话式 AI 的重要应用场景。研究期间,大约 50% 的美国用户 和 44.3% 的印度用户 至少参与过一次与金融相关的对话。金融话题分别占美国子对话的 5.1% 和印度子对话的 6.3% 。
决策权限分布
最重要的发现是,信息性与咨询性角色 占据了绝对主导地位,而非执行角色:
第 1 级(告知): 绝大多数交互属于此类。美国和印度金融子对话中,有 63.5% 和 72.1% 是纯信息性的(例如,“ISA 免税额度是多少?”)。
第 2 级(塑造): 存在显著比例的交互。美国和印度分别有 58.6% 和 49.7% 的金融子对话涉及 AI 塑造决策(例如,“我应该重新办理再融资吗?”、“对比一下这些银行”)。
第 3 级(行动): 委派执行的情况非常罕见 。仅有 0.3% 的美国和 0.1% 的印度子对话涉及 AI 代表用户采取行动。这些交互几乎完全局限于指令驱动型任务(例如“转账 500 美元”)或预算规则,没有任何证据 表明用户在委派自主金融决策(例如“把我的钱投在最好的选项里”)。
领域与意图特性
零售银行业务与信贷 以及支付 在两个市场中都是主导类别。
投资 在印度(占 34.8% 的子对话)比在美国(24.6%)更为普遍。
保险 和公共援助 的讨论在美显著更高,反映了市场的成熟度及特定的社会保障结构。
行为差异: 印度用户更多地利用 AI 进行金融学习与教育 ,而美国用户则更多地依赖 AI 进行金融问题解决 (如欺诈、账户访问)和个人财务分析 。
具体活动
主题建模显示,虽然高层类别存在重叠,但具体活动有所不同。美国用户频繁讨论保险覆盖范围 和教育金融 ,而印度用户则更关注股票分析 、交易 和卡片安全 。
意义与主张
本文声称其主要意义在于建立了人工智能在金融领域演进过程中的行为基准 。
现状: 作者断言,目前的 LLM 主要作为决策支持技术 发挥作用,旨在增强人类判断而非实现自主代理。这种 AI 能够“塑造”决策但不“执行”决策的“中间行为空间”是目前主流的交互模式。
启示: 该框架允许研究人员、监管机构和金融机构系统地追踪从信息检索向委派执行的转变。作者指出,现有的消费者保护框架可能需要演进,以应对决策“塑造”(第 2 级)而非仅仅是决策“执行”(第 3 级)带来的挑战。
审慎性: 本文并未声称 AI 已准备好进行自主金融管理。相反,它强调尽管金融服务是一个主要用例,但执行层面的委派仍然罕见 ,这表明向完全代理型 AI 的过渡仍处于早期阶段。该框架被定位为一个用于衡量这一正在发生的转变的工具。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。