← 最新论文
💻 computer science

Context-Aware LLM Evaluators for Content Moderation Judgments in a Low-Resource Setting

这项研究表明,虽然上下文感知提示和先前决策的检索可以改进用于德国报纸论坛审核的大型语言模型评估器,但模型容量的选择比提示策略更为关键,其中最大的模型在无需标注训练数据的情况下,在稀有移除类别上的表现优于监督系统。

原作者: Felix Krejca, Tobias Kietreiber, Michael Wiegand, Sebastian Neumaier

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Felix Krejca, Tobias Kietreiber, Michael Wiegand, Sebastian Neumaier

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在互联网繁忙的数字广场上,每天都有数百万条评论被发布,一个关于规模的无声危机已经显现。曾经通过阅读每一篇帖子来决定其留存或删除的专业人工审核员,正面临着不堪重负的局面。内容的庞大体积使得人类已无法跟上节奏,然而,对于什么构成有害或离题帖子的规则往往是微妙的,很大程度上取决于具体的对话内容和社区规范。为了解决这个问题,研究人员转向了大语言模型——一种能够理解并生成类人文本的人工智能。这些模型越来越多地被要求充当法官,为帖子贴上标签并做出曾经由人类独享的审核决策。然而,一个关键问题仍然存在:机器真的能理解激烈在线争论中的细微差别吗?还是它需要看到全貌才能做出公正的裁决?

这个问题促使一支来自奥地利大学的研究团队去调查,当给予不同数量的信息时,这些人工智能法官的表现如何。他们专注于一个特定的、具有挑战性的环境:一家德语报纸的评论区。在这种环境下,判断一条评论是离题、歧视,还是仅仅是一个个人故事,不仅需要阅读屏幕上的文字,还需要理解其回复的文章背景以及它所属的对话历史。研究人员想知道,向人工智能提供更多的上下文信息——比如完整的文章或整个回复链——是否能帮助它模仿人类专家的决策。他们还测试了一种不同的方法:与其给模型喂入更多的文本进行阅读,是否可以通过向它展示人类过去是如何判定类似评论的例子来达到目的?

为了寻找答案,该团队使用了来自奥地利《标准报》(Der Standard)的超过一百万条帖子的海量集合,其中包括一组由专业人工审核员评分的、包含近12,000条评论的精细标注数据集。他们测试了三个规模各异的人工智能模型,从较小、较快的模型到更大、更复杂的模型。对于每个模型,他们进行了一系列实验,改变了提示词中提供的信息。在某些情况下,模型只看到单条评论本身;在其他情况下,它看到了评论以及文章标题、全文或整个回复线程。他们还测试了一种方法,即向模型展示两个检索到的、关于人类过去如何判定类似评论的简短示例,一个是保留在网上的,另一个是被删除的。

结果揭示了这些数字法官思考方式的细微差别。研究人员发现,上下文确实有帮助,但并非以人们预期的那样运作。仅仅将更多文本倾倒进系统并不保证能获得更好的结果。事实上,对于某些类型的判断,例如识别歧视性语言或不当侮辱,加入完整的文章全文反而会让模型感到困惑,并导致其表现变差。当模型看到对话历史(即回复和讨论的流向)时,表现会更好,因为评论的真实含义往往蕴含其中。然而,对于其他类别,比如判断是否离题,看到原始文章则是必不可少的。不存在一种适用于所有情况的“最佳”信息量;合适的上下文量完全取决于模型正在被要求判断什么。

或许最令人惊讶的发现是,向模型展示过去的决策,其效果与向其展示完整的文章和对话历史一样好,但具有一个巨大的优势:它更短、更快。当研究人员给模型两个关于人类如何判定类似评论的简短示例时,模型的表现几乎与给予完整新闻文章和整个对话线程时一样好。这种检索方法也更加可靠;它提升了模型在所有类别中的表现,而增加文本有时反而会损害性能。事实证明,看到人类过去如何解决类似问题是一个强大的捷径,它让模型无需阅读大量的背景文本,就能学习到社区的标准。

人工智能模型的规模被证明是最关键的因素。拥有310亿参数的最大模型,是唯一能够持续匹配人类专家判断阈值的模型,能够做出既不过于严苛也不过于宽松的平衡决策。较小的模型则表现得非常吃力。仅有10亿参数的最小模型,在获得更多上下文或示例时往往无法进步,有时甚至表现得更差。中型模型则可能使模型将几乎所有的评论都标记为有问题,虽然捕捉到了几乎所有问题,但也产生了许多误报。这表明,虽然较小的模型可能作为捕捉明显问题的初步过滤器很有用,但它们尚未准备好独立取代人类判断。只有最大的模型才展现出了理解社区规范中微妙边界的必要能力。

与之前专门针对这些数据进行训练的计算机系统相比,这种新方法在最重要的安全领域显示出了明显的优势。这些人工智能法官在识别导致删除的罕见有害帖子(如歧视性或离题内容)方面表现显著优于旧系统。然而,旧的训练系统在识别建设性内容(如个人故事或论证充分的观点)方面仍然更胜一筹。这种差异凸显了一个现实:新方法在人类训练数据稀缺且昂贵的领域表现最好。对于定义社区安全性的那些罕见且困难的案例,由少量聪明示例引导的人工智能法官,比仅靠有限数据训练的系统做得更好。但对于常见的积极互动,旧的方法仍保持着优势。

最终,这项研究表明,内容审核的未来不在于用单一的、完美的机器取代人类,而在于为合适的工作寻找合适的工具。研究指出,对于新闻编辑室和在线社区而言,最佳策略是使用尽可能大的模型,并依赖于向其展示人类如何处理类似情况的方法,而不是用无穷无尽的文本淹没它们。这种方法可以实现可扩展、可靠的审核,即使是在缺乏大规模标注示例数据库的语言和社区中也是如此。它提供了一条前进的路径,让技术在处理互联网海量内容的同时,能够尊重人类对话中那种依赖于上下文的微妙本质,前提是选择了正确的模型并提供了正确的信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →