← 最新论文
💻 computer science

Predicting consumer-technology ownership without a diffusion history

本文表明,由人类和前沿语言模型共同评分的消费者技术感知属性,与发布时期的基准相比,可以显著提高对所有权普及率的预测能力,尽管这种优势在所有权趋势保持不变的短期预测中会减弱。

原作者: Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图在犯罪发生之前就破解谜团的侦探。在技术领域,这是终极挑战:预测一款全新的小工具会成为家喻户晓的必备品,还是会在抽屉里吃灰。通常,专家们试图通过观察过去类似产品的表现来做出猜测,就像试图通过观察昨天的云来预测今天的天气。但如果这款小工具如此之新,以至于从未有过类似的东西呢?那里没有云可以观察。这就是“发布前”难题。为了解决这个问题,科学家们使用了一个名为 UTAUT2 的框架,这基本上是一份关于人们对新工具产生七种感觉的清单:它有用吗?它好用吗?我的朋友们觉得我应该拥有它吗?它有趣吗?它的成本太高了吗?如果我们能衡量这些感觉,也许我们就能在不需要水晶球的情况下预测未来。

这篇论文是关于测试一种新型水晶球的研究。研究人员想要看看,是否只需询问某种技术的“人格特质”(即 UTAUT2 的感受),而无需了解该产品自身的销售历史,就能预测会有多少人拥有它。他们收集了一份包含 65 种不同小工具的名单,从智能手表到厨房工具,并请两个不同的群体进行评分:真实的人类和超级智能的计算机程序(人工智能语言模型)。人类是在网上接受调查的普通人,而计算机则是两款名为 Claude Opus 4.7 和 GPT-5.5 的最先进的人工智能模型。

随后,团队构建了一个数学配方,以观察这些评分能否预测实际的拥有量。他们玩了一场数据的“捉迷藏”游戏:从名单中拿出一个小工具,尝试利用其他 64 个小工具的评分来猜测其受欢迎程度,然后检查自己是否猜对了。结果令人惊讶。当计算机进行评分时,它们比人类更擅长猜测受欢迎程度。Claude Opus 4.7 模型产生的误差比基于技术成熟度进行的简单猜测要小 17%,并且显著优于人类的评分。GPT 模型也比人类表现得更好,尽管不及 Claude 那么出色。

然而,故事中有一个转折。虽然属性评分在预测一个产品当前有多受欢迎方面表现出色,但在预测其受欢迎程度如何随时间变化方面却失败了。当研究人员观察 2022 年到 2025 年间拥有量数量的变化时,这些评分完全没有帮助。事实上,仅仅猜测“不会有任何变化”与使用那些高级 AI 评分一样准确。这表明,虽然我们可以利用这些特质来捕捉一个产品的当前成功状态的快照,但它们还不够神奇,无法告诉我们一个工具在未来几年内是会蓬勃发展还是会销声匿迹。

研究人员还必须小心 AI 可能玩的一个狡猾把戏。由于 AI 是基于互联网数据进行训练的,它可能已经“知道”哪些小工具已经出名,并只是假装根据它们的特质进行评分,而实际上它只是在回忆答案。他们进行了专门的测试来检查这一点,虽然他们无法证明 AI 没有利用其记忆,但证据表明它是在进行推理工作而非仅仅是背诵事实。

最后,这篇论文展示了一种预测技术未来的一种充满希望的新方法。通过让 AI 根据“它有多有趣”或“它有多易用”等因素对新产品进行评分,我们可以得到一个关于有多少人会拥有它的相当准确的猜测。然而,这项研究的核心结果适用于那些已经在市场上的技术,因为 AI 可以利用其训练数据来对其特质进行推理。对于那些已经被市场评判过的产品,这是一个非常敏锐的工具;但这种方法是否真的能在任何人都见过或拥有它之前,就预测出该小工具的成功,仍然是下一个重大问题。这就像拥有一台非常清晰的相机,它能准确告诉你一辆汽车今天的样子,但它仍然无法告诉你这辆车明天是否会赢得比赛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →