← 最新论文
💻 computer science

StableEval Arena: A Cost-Aware Agentic Benchmark for Stablecoin Price Stability Prediction

StableEval Arena 是一个具备成本感知能力的基准测试框架,通过衡量预测质量、运行可靠性和计算成本的联合频谱,评估基于大语言模型(LLM)的智能体系统在稳定币脱锚风险预测方面的表现,并揭示了尽管智能体能够可靠地生成结构化输出,但在准确预测罕见的严重压力事件和持续脱锚事件方面仍面临困难。

原作者: Sean Wan, Dongping Liu, Luyao Zhang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Sean Wan, Dongping Liu, Luyao Zhang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一支庞大太空舰队的舰长,你的货舱里装满了被称为“数字黄金”的货物,这些黄金理应始终价值正好一美元。这不仅仅是普通的黄金,它是一种被称为**稳定币(stablecoin)**的特殊货币,旨在保持完美的稳定,这样人们就可以在不用担心资金突然消失或价值翻倍的情况下买咖啡、付房租或进行资产交易。但问题在于,尽管这些代币理应是枯燥稳定的,但它们有时也会陷入恐慌。当市场变得可怕时,价格可能会波动、跌破一美元,甚至完全崩盘。这被称为“脱锚(de-pegging)”,如果发生了这种情况,就像是你飞船的燃料表突然对你撒了谎。

为了保护舰队的安全,我们需要一名能够预见危险的哨兵。过去,我们使用简单的数学模型或人类专家。但现在,我们有了智能体AI(Agentic AI)——能够思考、推理并自主做出决策的超级聪明计算机程序,就像是一个数字副驾驶。大问题在于,这些AI飞行员真的能比简单的规则手册更好地发现风暴吗?我们需要知道它们是否真正值得信赖,而不仅仅是看它们能否遵循指令。如果AI在飞船撞毁前一刻说“一切正常!”,那么无论它的速度有多快或报告看起来多么漂亮,这都是一次失败。

这正是**《StableEval Arena》这篇论文所要测试的内容。研究人员建立了一个大规模且具备成本意识的训练场(即“竞技场”),旨在观察这些AI智能体是否能够预测稳定币何时即将失去其一美元的挂钩。他们不仅仅是让AI猜测未来的价格;他们要求AI扮演风险管理者的角色。AI必须观察过去30天的价格历史和市场舆论,然后预测未来七天会发生什么。这枚代币会保持稳定(Stable)?会进入观察(Watch)状态(有些摇晃)?还是会进入压力(Stress)**状态(全面的危机)?

研究人员运行了两种不同类型的测试。首先,他们创建了一个“压力测试”版本,其中包含120个麻烦更常见的案例,以观察AI是否能在危险近在眼前时识别出征兆。然后,他们运行了一个“现实世界”版本,包含507个案例,其情况与自然界完全一致——在现实中,稳定币通常很平静,只有极少数情况下会出现问题。他们测试了六种不同的AI智能体,并将其与一些非常简单的基准模型(例如一个只说“假设一切正常”的规则或一个基础数学模型)进行了对比。

结果既有喜讯,也有严肃的现实警示。从好的方面来看,AI智能体在遵循规则方面表现得极其可靠。它们生成的报告格式完美,没有崩溃,且成本极低。它们非常擅长说:“嘿,今天看起来有点摇晃。”然而,涉及到最重要的工作——识别罕见的灾难性崩盘时,AI智能体大多失灵了。在507个案例的大规模测试中,AI漏掉了21次实际压力事件中的19次。它们太擅长遵循协议了,以至于能生成有效的报告,但这些报告往往在代币实际崩盘前却显示“一切正常”。

事实上,在现实世界测试中,即使是一个仅仅观察过去趋势的简单计算机程序,在预测这些罕见崩盘方面也表现挣扎,它和AI一样错过了其中的大部分。这些高级AI智能体并没有压倒或超越这些经典方法;事实上,没有任何一个智能体能够可靠地检测到那些至关重要的罕见高风险压力事件。论文的结论是,虽然这些AI智能体在服从性和效率方面表现出色,但它们还不足以被视为我们数字货币的可靠守护者。它们可以完美地执行剧本,但在识别那些最关键的罕见恐怖风暴方面,它们仍然感到吃力。研究人员建议,在AI能够更好地识别这些罕见的高风险事件之前,我们不应该让它们独自驾驶飞船。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →