想象一个名为Polymarket的巨型全球博彩大厅。人们在这里下注,赌注范围从“总统是否会签署这项法案?”到“这部电影是否会获得奥斯卡奖?”。您正在阅读的这篇论文,旨在调查是否有人利用他们比公众更早知晓的内幕消息进行下注,从而作弊。
作者马克西姆·内切普伦科(Maksym Nechepurenko)开发了一种特殊的“测谎仪”工具,称为信息泄露评分(ILS)。在之前的测试中,该工具仅针对单一特定赌注时表现完美。本文探讨的问题是:当我们试图将其同时应用于成千上万个赌注时,该工具是否依然有效?
以下是他们发现的简要故事。
1. 工具过于挑剔(“过滤器”问题)
作者试图将该工具应用于12,708 个不同的博彩市场,旨在找出“作弊者”(那些利用内幕消息下注的人)。
- 结果: 该工具仅在其中的88 个市场中有效(不到 1%)。
- 类比: 想象你有一个金属探测器,本应在一片巨大的田野中寻找金币。你扫遍了整片田野,但机器只在 88 个位置发出蜂鸣声。为什么?因为该机器被设计为仅对完美圆形且闪闪发光的金币发出蜂鸣。
- 真正的问题: 大多数博彩问题过于混乱。例如,一个赌注可能问:“领导人会被罢免吗?”但“罢免”可能意味着被解雇、辞职或死亡。该工具需要一个单一、清晰的时间点(例如某项法律签署的具体日期)才能运作。如果问题模糊不清,工具就会放弃。
- 令人惊讶的是: 即使在他们审视的 32 个已知确实发生过作弊的著名案例中,该工具也仅在一个案例中有效。其余 31 个案例对工具而言过于模糊,无法理解。
2. “事件”难以 pinpoint
要抓住作弊者,该工具需要确切知道新闻是在何时爆发的。
- 问题: 该工具试图利用人工智能来找出新闻故事爆发的确切秒数。它仅在约**58%**的情况下能得出正确的日期。
- 类比: 这就像试图通过知道小偷确切是哪一秒穿过前门来抓住他。如果你认为他们是下午 2:00 进来的,但实际上是 2:05,你的摄像头就会错过他们。
- 后果: 由于该工具对确切时间极其敏感,它仅适用于那些新闻发生在单一、清晰时刻的“干净”赌注(例如体育比分)。而在混乱的、政治的或法律的赌注中,该工具会感到困惑。
3. “负面”分数只是数学现象,而非作弊
当该工具最终起作用时,它给出的大多是负面分数。
- 误解: 起初,作者认为负面分数意味着人们正在反对真相下注(一种奇怪的作弊形式)。
- 纠正: 作者意识到这仅仅是数学上的把戏。
- 类比: 想象火箭发射的倒计时器。随着时间流逝而火箭尚未发射,它此刻发射的概率自然会下降。如果火箭在最后的一秒终于发射,博彩市场上的价格看起来就像在飙升前曾崩盘过。该工具看到了这种“崩盘”,便认为这是作弊。
- 修正: 作者添加了一个“基线修正”(类似于减去自然倒计时效应)。在此修正之后,一些所谓的“作弊”消失了,但在一种特定类型的赌注(监管公告)上,负面分数依然存在。这表明在这些特定赌注中,人们可能确实在新闻爆发前就针对结果进行反向下注。
4. “一刀切”的假设是错误的
该工具假设所有事件都以稳定、可预测的速率发生(就像以恒定速度下雨)。
- 发现: 数据显示,事件并非以恒定速率发生。有时它们成批发生;有时则耗时良久。
- 类比: 该工具使用的是“稳定降雨”模型,但现实世界更像是一场“风暴”之后紧接着“干旱”。作者不得不将工具切换为更灵活的模型(称为威布尔分布),以正确处理风暴和干旱。
大局结论
该论文得出结论,这个“测谎仪”工具是真实且有效的,但目前它过于狭隘,无法应用于整个博彩市场。
- 它在清晰、离散的事件上表现良好(例如"X 队会赢得比赛吗?”)。
- 它在模糊、复杂的事件上失效(例如“政府会改变其政策吗?”)。
作者表示:“我们发现该工具有效,但我们需要对其进行升级,以处理模糊的问题,并修正关于时间流逝的数学计算。”他们计划在未来的论文(论文 3b)中通过利用更智能的人工智能来理解混乱的问题,并将此工具与其他查看个别下注者钱包的方法相结合,来实现这一目标。
简而言之: 该工具是一把高精度的狙击步枪。如果你有清晰的目标,它能完美运作。但博彩市场充满了模糊、移动的目标,因此这把步枪错过了大多数目标。作者现在正试图制造一种能在迷雾中工作的瞄准镜。
以下是 Maksym Nechepurenko 所著论文《大规模人口层面的信息泄露:2020–2026 年 Polymarket 内幕相关子群体评估》的详细技术摘要。
1. 问题陈述
本文探讨了在去中心化预测市场(特别是 Polymarket)上检测知情交易(内幕交易)的挑战。虽然先前的研究(例如 Mitts & Ofir [2026]、Gómez-Cram 等人 [2026])已成功利用聚合交易模式在钱包或账户层面识别知情交易者,但仍需要一种市场层面、实时的诊断工具,以便在事件解决之前识别信息泄露。
作者旨在将此前在单个案例中测试过的**信息泄露分数(ILS)**及其截止解决扩展版(ILSdl)扩展到群体层面。核心问题在于确定该框架能否有效检测数千个市场中的知情资金流,或者是否存在结构性限制(如事件定义模糊),导致该方法无法适用于大多数“内幕相关”市场。
2. 方法论
本研究采用严格的多阶段流程,评估了 Polymarket 语料库(2020 年 10 月至 2026 年 4 月)中的 12,708 个候选市场,涵盖三个内幕相关类别:军事/地缘政治、监管决策和企业披露。
A. ILSdl 框架
**信息泄露分数(ILSdl)**量化了市场总价格变动中发生在底层事件公开观察时刻(Tevent)之前的比例。
ILSdl(M)=p(Tresolve)−p(Topen)p(Tevent−)−p(Topen)
其中:
- p(Tevent−) 是事件发生前一分钟的价格。
- p(Topen) 是开盘价格。
- p(Tresolve) 是最终解决价格(YES 为 1,NO 为 0)。
B. 范围条件与过滤器
为了计算有效分数,市场必须通过四个连续过滤器:
- 解决类型学:必须是“按截止日解决”(事件在日期 D 前发生)且不可归类为“无法分类”。
- 结果:必须解决为 YES(NO 结果缺乏可恢复的 Tevent)。
- Tevent 恢复:底层事件时间戳必须通过大语言模型(LLM)辅助的多源验证管道恢复,置信度 ≥0.7。
- 范围条件:正向领先时间、边缘效应约束(开盘价格不过于极端)以及锚点敏感性(分数在短窗口锚点偏移下的稳定性)。
C. 风险衰减基线校正
一项关键的方法论创新是引入了经风险衰减调整的分数(ILSdladj)。
- 问题:在截止日合约中,随着时间推移且事件未发生,价格会机械性地衰减至零(理性的贝叶斯更新)。即使没有内幕交易,这也会在原始 ILSdl 中产生负偏差。
- 解决方案:作者从观察到的价格中减去了基于生存概率基线(源自 Weibull 风险模型)推导出的预期价格。
ILSdladj(M)=p(Tresolve)−p(Topen)p(Tevent−)−E[p(Tevent−)∣Topen,D,λ^]
D. 验证
- 真实值:**ForesightFlow 内幕案例(FFIC)**清单(32 个记录在案的内幕交易事件)作为标记验证集。
- 二次验证:独立的大语言模型(LLM)在 50 个市场的样本上运行,验证 Tevent 恢复的准确性。
3. 主要贡献与发现
发现 1:结构性排除(“无法分类”类别)
- 结果:在 12,708 个候选市场中,仅有 0.7%(88 个)产生可计算的 ILSdl 值。
- 原因:主要排除因素(占 FFIC 清单的 43.8%)是解决标准模糊。诸如“赢得选举”、“被任命为最高领袖”或“被拘留”等谓词的市场缺乏单一、离散的公开时间戳(Tevent)。
- 含义:该框架的有效领域在结构上比最初设想的要窄。“无法分类”的类别包含真正的歧义,而不仅仅是分类器的噪声。
发现 2:锚点敏感性与样本收窄
- 结果:在 88 个可计算的市场中,仅有 12 个(13.6%)满足锚点敏感性条件(在短时间窗口内分数稳定)。
- 验证:独立的 Tevent 恢复在整体上仅实现了 57.8% 的精确日期一致性(目标为 ≥90%)。离散事件的一致性较高(军事/企业:78.9%),但多阶段流程的一致性较低(监管正式流程:35.7%)。
- 含义:具有实际操作意义的样本仅限于12 个锚点稳健的市场。由于事件时间模糊,大多数计算出的分数可能是噪声。
发现 3:负偏差与风险校正
- 结果:原始 ILSdl 中位数在所有子类别中均为负值(范围从 -0.88 到 -0.16)。
- 解释:起初,这表明市场对结果进行了反向定价。然而,经过风险衰减调整后:
- 监管正式流程(2024 年后):从 -0.21 变为 -0.02(基本为零)。负值纯粹是理性衰减的结果。
- 监管公告(2024 年后):保持强烈的负值(-0.80 → -0.84)。这表明存在真正的“反信息”流动或预定公告中的选择偏差。
- 军事/地缘政治/企业:部分得到校正,但仍保留一些负信号。
- 含义:原始负分通常是截止机制的产物;需要风险调整后的分数才能进行有效解释。
发现 4:风险率规范
- 结果:常数风险指数模型(用于先前的单案例研究)被拒绝用于 2024 年后的汇总群体,转而采用 Weibull 分布。
- 细微差别:当按子类别分析时,指数模型通常拟合得更好。汇总样本中对 Weibull 的偏好是由类别混合(将短截止日公告与长截止日正式流程相结合)驱动的,而非类别内的真实持续时间依赖性。
- 含义:未来的模型必须对汇总数据使用 Weibull 分布,或者按子类别重新估计风险率。
4. 意义与局限性
意义
- 范围发现:本文表明,扩展检测框架揭示了单案例研究未能发现的结构性限制(语义歧义)。
- 方法论完善:它确立了风险衰减校正对于截止日合约至关重要,以区分理性价格衰减和知情交易。
- 互补检测:市场层面的视角(ILSdl)为狭窄的市场子集提供了实时、进行中的诊断,补充了钱包层面(Mitts & Ofir)和账户层面(Gómez-Cram)的方法,后者虽为事后分析但覆盖更广泛的人群。
局限性与未来工作(论文 3b)
- 覆盖率:由于类型学和锚点约束,当前框架排除了约 99% 的候选样本。
- 歧义:“无法分类”的类别需要LLM 辅助重新分类和多锚点扩展(处理多个候选 Tevent 值),以纳入谓词模糊的市场。
- 数据:本研究依赖于单次管道运行;未来的工作将在独立快照上进行验证,并整合钱包层面特征(PIN、VPIN 等)以训练梯度提升检测器。
结论
本文结论认为,虽然 ILSdl 框架是可操作的,但其在群体规模上的应用目前仅限于一小部分高度特定的市场(12,708 个中约 12 个),这些市场的事件是离散的、时间戳可恢复的且锚点稳健。扩大检测范围的主要障碍不是分数计算,而是解决语义。作者提出了一条路线图,涉及 LLM 重新分类和多锚点扩展,以在未来工作中扩大该框架的覆盖范围。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。