← 最新论文
🔬 materials science

The conditional superiority of fast silicon sampling

本研究发现,尽管利用前沿模型进行硅基采样仍是一种处于早期阶段、会低估观点方差并扭曲上下文空间的方法,但其“快速”模式通过以显著更高的计算资源和运行效率提供更高的算法保真度,展现出了相对于“慢速”模式的条件性优越性。

原作者: Nickolas Hock Yuen Lam, Ji Xuan Voo, Xiangyu Ma

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Nickolas Hock Yuen Lam, Ji Xuan Voo, Xiangyu Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图预测一群人会对一项新法律、一部怪诞的电影或一种辛辣食物趋势做出怎样的反应。在过去,你必须出门,敲开一扇扇门,去询问成千上万个真实的人类。但现在,我们有了“大语言模型”(LLMs)。把它们想象成超级聪明的数字大脑,它们几乎阅读了互联网上的所有内容。它们非常擅长模仿人类对话,以至于可以假装成人类。这引发了研究人员的一个疯狂想法:与其询问真实的人,不如直接问人工智能?这被称为“硅基采样”(silceon sampling)。这就像是在问一间充满数字克隆人的房间来填写调查问卷。但这里有一个大问题:如果我们要求这些数字克隆人快速、匆忙地回答,它们的答案会好吗?还是说我们需要一个一个问题地、缓慢而仔细地询问,才能得到真相?这篇论文深入探讨了这个问题,测试了在模拟人类观点时,速度是否会扼杀准确性。

研究人员决定通过一个特定的群体来测试这个想法:新加坡人。他们采用了一份真实的调查问卷,该问卷曾发放给超过 2,0ey0 名真实的新加坡人,内容涉及移民和伦理规则(例如,是否可以错误地申报税务或表现得无礼)等话题。然后,他们使用了一个非常先进的人工智能模型(OpenAI 的 GPT-5.4)创建了两组不同的“数字克隆人”。其中一组是使用“慢速”方法创建的:人工智能被要求一次只回答一个问题,每个问题都从头开始,就像人类参加考试一样。另一组则使用了“快速”方法:人工智能被给予一整份冗长且复杂的题目列表,并被要求一次性吐出所有的答案。

结果既有“还不错”,也有“绝对不完美”。首先是坏消息:数字克隆人并不是完美的人类副本。虽然它们在猜测“平均”观点方面做得相当出色(例如,如果大多数真实的人认为某事是“可以接受的”,人工智能也认为那是“可以接受的”),但它们未能捕捉到观点的“多样性”。真实的人类有着广泛的情感波动;有些人热爱某事,有些人讨厌,有些人则持中间立场。然而,人工智能倾向于抹平一切,让每个人听起来感觉都一模一样。它还搞错了不同观点之间的关系。例如,在现实生活中,讨厌移民的人可能也会以某种特定的模式讨厌其他某些事物。人工智能的数字克隆人并没有完全掌握这种模式;与真实的人相比,它们观点的“形状”看起来是扭曲的。

然而,这里有一个让这篇论文变得令人兴奋的转折。研究人员发现,“快速”方法实际上与“慢速”方法一样好,甚至有时甚至略好。这很令人惊讶,因为大家原本都认为,一次性给人工智能一大堆问题会让它感到困惑,或者降低它的响应能力。但数据表明,快速的数字克隆人与慢速的数字克隆人一样,都能忠实地反映真实数据。事实上,快速方法是一个巨大的省时工具。生成一个人的全套答案大约只需要 3 秒钟,而慢速方法则需要 20 秒。它还节省了约 64% 的计算资源(token),且成本减半。

那么,结论是什么?论文得出结论:虽然硅基采样仍然是一种需要“极其谨慎”使用的方法,因为它不能完美地捕捉人类思想中那种混乱且多样化的本质,但你并不需要通过放慢速度来获得你能得到的最佳结果。如果你打算使用人工智能来模拟人类观点,你大可以做得快一点。这样做既节省了时间和金钱,又不会让答案变差。但作者警告我们不要现在就过于兴奋:这些数字克隆人仍然只是探索性的工具。它们非常适合测试想法或观察模型的行为,但当我们需要确切了解一个群体在想什么时(尤其是在像新加坡这样多元化的地方),它们不应取代真实的人类调查。数字克隆人在基础方面做得越来越好,但它们还没有真正学会如何成为真正的人类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →