ValueGraph: Value-Signal Guided Graph Pre-training for Contextualized User Representation
该论文提出了 ValueGraph,这是一个利用推断出的道德价值信号作为软约束来增强上下文用户表示的图预训练框架,证明了其在立场检测和机器人检测任务上相较于现有的基于文本、基于图以及大语言模型基准模型的性能提升具有一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在社交媒体广阔而嘈杂的景观中,理解人们为何表现出其行为方式是任何试图理解网络生活的人所面临的核心挑战。多年来,计算机科学家一直试图通过观察人们说了什么以及与谁交谈,来构建用户的数字画像。如果两个人发布了相似的词汇或回复了相同的讨论串,传统的系统就会假设他们是相似的。然而,这种方法往往忽略了一个至关重要的人类行为层面:驱动这些互动的底层道德价值观。人们参与同一则具有争议的新闻故事可能是出于完全不同的原因——一个出于真正的关注,一个出于愤怒,而第三个则是出于传播混乱的欲望。这些隐藏的动机塑造了用户的行为方式,然而标准的计算机模型通常将它们视为不可见的。要真正理解一个用户,研究人员需要一种方法,不仅能捕捉其活动的表面,还能捕捉引导其活动的道德指南针。
新加坡管理大学和 A*STAR 的一个研究小组开发了一种名为 ValueGraph 的新方法来解决这个问题。该系统并不试图猜测一个人的真实内在信仰(因为这无法被确定地知晓),而是使用一种工具从其公开帖子中推断出“价值信号”。该信号基于一个著名的心理学框架——道德基础理论(Moral Foundations Theory),该理论将道德推理分解为十个不同的维度,例如关爱、公平、忠诚和权威。研究人员训练了一个计算机程序来阅读数千条社交媒体帖子,并根据这十个道德主题为每条帖子分配分数。通过对单个用户撰写的所有帖子进行评分平均,该系统创建了一个关于该用户道德框架的粗略的、由十个点组成的剖面图。研究人员谨慎地指出,这并不是一种完美的心理诊断;它是一个嘈杂的、聚合的信号,捕捉的是用户道德语言的总体风格,而非其精确的灵魂。
ValueGraph 的核心创新在于它如何利用这些推断出的信号来教计算机识别不同类型的用户。该系统分为两个主要步骤。首先,它构建了一张人们如何互动的地图,将每一条帖子和回复视为巨大网络中的一个连接。它学习理解这些对话的结构和文本的含义,从而为每个用户创建一个基本的数字指纹。在第二步中,它引入了道德价值信号。系统观察不同用户的推断道德剖面,将具有相似价值信号的用户归为一类,同时将具有截然不同信号的用户推开。它通过将道德信号视为学习过程中的一组软规则或温和的引导,而非绝对的事实来实现这一点。这使得计算机能够学习到一种结合了用户所言、所交以及其表达之道德基调的综合表示。
研究人员在两个具有挑战性的任务上测试了这种新方法:确定用户对政治议题的立场,以及检测用户是机器人(即旨在模仿人类的自动化账户)还是真人。在第一个测试中,系统必须判断用户是支持、反对还是中立于某一特定话题。在第二个测试中,它必须区分真实人类和自动化机器人。结果显示,ValueGraph 一致优于现有方法。在立场检测任务中,它在一个数据集上达到了 63% 的准确率,在另一个数据集上达到了 77%,击败了仅依赖文本或仅依赖网络结构的强劲对手。在机器人检测任务中,该系统提高了识别自动化账户的能力,尤其是在与其他数据结合时。在一种特定的配置下,系统正确识别机器人的能力(即“召回率”——即在机器人存在时找到它们的能力)显著提升,从 62.5% 跳升至 81.0%。
令这些结果特别有趣的是,该系统在初始训练期间并不需要被告知哪些用户是机器人或哪个立场是正确的。它通过观察道德信号和对话结构自行学习这些模式。研究人员发现,当系统结合了结构化学习与道德价值引导时效果最好。如果移除道德信号,系统的性能会下降;如果仅使用道德信号而不使用对话结构,它也无法达到同样的准确水平。这表明道德价值信号起到了有用的引导作用,帮助计算机看到仅凭文本或连接本身无法看到的模式。例如,在可视化数据时,研究人员看到新方法比以往的方法创造了更清晰的人类用户与机器人之间的分离。机器人倾向于聚集在一起,表现出重复且极化的道德语言,而人类则展现出更多样化且具有语境敏感性的表达。
该团队强调,他们的方法并不声称了解用户的真实心理价值观。道德得分是基于文本推导出来的,并被视为不完美、带有噪声的数据。系统将这些不完美之处作为一种学习工具,寻找用户之间的相对差异,而非试图确定一个绝对的真相。这种方法避免了试图用确定的心理剖面来标记人的陷阱,因为这在伦理上可能存在争议,在技术上也难以可靠。相反,它利用其公共话语中的道德框架作为一个实用的工具,来构建更完善、更细致的数字表示。ValueGraph 的成功表明,融入这些基于理论的价值信号,为提高计算机理解在线人类行为的能力提供了一种强大的方式,为内容审核和个性化推荐等任务提供了更稳健的基础。通过承认用户不仅受其所言的影响,还受其表达时所采用的道德视角的影响,研究人员为理解互联网复杂的社会世界开辟了一条新路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。