Stance Detection in Prediction Markets: Addressing Imbalanced Trader Commentary via Counterfactual Augmentation and Market Context
本文提出了首个针对预测市场评论的立场检测框架,证明纳入市场背景能显著提升少数类的召回率,同时确定 50% 的反事实增强率为在不同模型配置间平衡性能的最佳比例。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下像 Polymarket 这样的预测市场,就像一个巨大、高速的赌场,人们在这里对未来事件下注(例如“谁将赢得选举?”或“股价会上涨吗?”)。投注的价格告诉你人群的整体信心,但人们写在下面的评论则揭示了他们为何会有这种感觉。有些人欢呼(支持),有些人嘘声(反对),而许多人只是默默旁观(中立)。
这篇论文就像一名侦探,试图教会计算机阅读这些评论,并分辨出谁在欢呼、谁在嘘声。然而,这名侦探面临着三个巨大的难题:
- 评论极其简短:人们输入的内容像"cooked"(完蛋了)、"rip"(挂了)或"free money"(白送钱)。这就像试图从一个表情符号中猜测整部电影的情节。
- 语言怪异:交易者使用计算机无法理解的行话。
- 嘘声罕见:在 100 条评论中,可能只有 9 个人真正在说“不,这会失败”。其余 91 人要么在说“是”,要么什么也没说。这使得计算机很难学会“不”是什么样子的。
以下是研究人员如何解决这些问题,用简单的类比来解释:
1. “语境”技巧(最重要的修复)
问题:如果你看到一条评论说“这正在动”,你完全不知道这是好事还是坏事。是价格在上涨(对买家有利)还是在下跌(对买家不利)?如果不了解具体的投注内容,计算机就是在黑暗中猜测。
解决方案:研究人员在每条评论之前都提供了“问题”。
- 之前:“这正在动。”(计算机:“我完全不知道。”)
- 之后:“问题:价格会上涨吗?评论:这正在动。”(计算机:“啊!如果价格在动,那就是好事!”)
结果:这是最大的魔法棒。这样做不需要任何额外成本,但却让计算机识别罕见“反对”(嘘声)的能力从几乎为零跃升为真正有用。这就像在要求翻译翻译句子之前,先给翻译一本关于特定主题的词典。
2. “假学生”策略(反事实增强)
问题:因为“反对”评论太少了(100 条中只有 9 条),计算机从未获得足够的练习来学会识别它们。这就像只看过三张图片,却试图学会识别一种稀有鸟类。
解决方案:研究人员使用超级智能的人工智能(大语言模型)基于真实的“支持”评论编写虚假的“反对”评论。
- 真实支持:“这会赢!”
- AI 虚假反对:“这会输!”(但用同样的行话风格、简短风格书写)。
他们将这些虚假评论添加到训练数据中,让计算机有更多练习机会。
结果:这确实有效,但前提是不要过度。
- 最佳点(50%):添加适量的虚假评论有助于计算机更好地学习。
- 过量(100%):如果添加太多虚假评论,计算机就会困惑。虚假评论听起来太完美、语法太正确,不像真实交易者那样输入杂乱、简短的行话。计算机开始学习“虚假”风格而不是“真实”风格,其表现反而变差了。
3. “二类与三类”的困境
研究人员尝试了两种教计算机的方法:
- 三类:教它识别“支持”、“反对”和“中立”。
- 二类:让它忽略“中立”,只专注于“支持”与“反对”的对比。
发现:当他们移除“中立”人群时,计算机在识别“反对”人群方面变得更强。这就像告诉保安:“别管那些只是路过的人;只专注于发现小偷。”保安在发现小偷方面会变得敏锐得多。
主要结论
- 语境为王:在展示评论之前,务必告诉计算机投注是关于什么的。这是他们发现的最强大的工具。
- 人工智能少即是多:利用人工智能生成虚假训练数据有帮助,但只需一点点。如果你用虚假数据淹没系统,就会破坏模型理解真实人类行话的能力。
- 忽略沉默:如果你想找到批评者,忽略那些只是旁观的人会有帮助。
简而言之,这篇论文表明,要教会计算机理解预测市场的情绪,你需要给它完整的故事(问题),忽略沉默的大多数,并且非常小心不要喂给它太多“虚假”例子,否则它将开始说一种没有任何真实交易者使用的语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。