← 最新论文
💬 NLP

Measuring AI "Slop" in Text

本文通过专家访谈开发了一套分类法和可解释的维度,旨在解决人工智能“废料”(slop)缺乏标准定义的问题,并证明了虽然二元判断具有主观性,但它们与连贯性和相关性等潜在因素相关,从而能够实现对人工智能生成文本更好的评估。

原作者: Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Chantal Shaib, Tuhin Chakrabarty, Diego Garcia-Olano, Byron C. Wallace

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的集市。长期以来,摊主们(人类)售卖的是新鲜的手工制品。但最近,大量廉价、量产的商品涌入其中。它们从远处看还算不错,但近看之下,却感觉单薄、重复且空洞。在 AI 的世界里,人们开始将这种低质量、AI 生成的垃圾称为**“slop”(废料/注水内容)**。

这篇论文就像是一支由专家组成的团队,试图建立一本针对这种“slop”的质量控制手册。他们想要回答两个大问题:究竟是什么让一段文本感觉像是“slop”? 以及 我们能否构建一台机器来自动识别它?

以下是他们研究结果的拆解,使用了简单的类比:

1. 定义“Slop”(分类学)

研究人员并没有凭空猜测什么是 slop。他们采访了 19 位专家——包括作家、记者、哲学家和 AI 科学家——以获得一个清晰的定义。他们意识到 “slop” 不仅仅是一种问题;它是三种主要问题的结合,就像一顿糟糕的饭菜,既太咸、又太淡,还盛在脏盘子里。

他们将这些问题组织成了一个名为**分类学(Taxonomy)**的清单:

  • 信息效用(“空碗”问题):
    • 密度(Density): 文本充满了词汇,但实际含金量极低。它就像一碗汤,90% 是水,只有 10% 是肉汤。
    • 相关性(Relevance): 文本谈论的内容与所问的问题无关。这就像你点了一个汉堡,结果对方却给你讲了一场关于奶牛历史的讲座。
  • 信息质量(“变质食材”问题):
    • 事实性(Factuality): 文本在编造事实或弄错事实(幻觉)。
    • 偏见(Bias): 文本听起来过于机械化或过于中立(本应具有人类气息时),或者采取了一种奇怪的、片面的立场。
  • 风格质量(“糟糕的呈现方式”问题):
    • 重复与模板化(Repetition & Templatedness): AI 不断重复同样的话,或者反复使用完全相同的句子结构,就像一台坏掉的唱片机。
    • 冗长(Verbosity): 它用 100 个词来表达原本只需 10 个词就能说清楚的内容。它是“辞藻华丽”而非“富有智慧”。
    • 连贯性与语调(Coherence & Tone): 思想逻辑不通,或者语调感觉很怪(比如一个机器人试图讲笑话)。

2. 人类测试(标注 Slop)

为了验证他们的清单是否奏效,他们聘请了专业的文字编辑来阅读 150 篇新闻文章和 100 篇问答(Q&A)段落。他们要求编辑们标出文本中具体的“糟糕(sloppy)”部分。

令人惊讶的结果:
即使是专家,也并不总是在什么才是 “slop” 上达成一致。

  • 主观性问题: 一位编辑可能认为一段文本是 “slop”,是因为它太啰嗦了;而另一位编辑则认为它没问题。
  • 关联性: 然而,当编辑们确实一致认为某段文本是 slop 时,通常是因为该文本缺乏相关性(没有回答问题)或密度(内容太空洞)。
  • 领域差异:
    • 新闻领域,slop 主要体现在风格和语调不好(过于正式、过于重复)。
    • 问答领域,slop 主要体现在事实错误或结构混乱。

3. 机器能识别吗?(自动检测)

研究人员尝试测试目前的 AI 工具是否能在没有人类帮助的情况下自动标记这种 slop。他们测试了三项内容:

  1. 标准数学指标: 他们使用了传统的数学工具(如统计词长或检查重复词汇)。
    • 结果: 这些工具在识别“冗长”文本方面表现尚可,但它们无法捕捉到更微妙的东西,比如“这是否相关?”或“这是否有意义?”。
  2. AI 奖励模型(Reward Models): 他们使用了经过训练、用于评估写作质量的高级 AI 模型。
    • 结果: 这些模型可以区分“好”与“坏”的写作,但它们无法专门识别人类定义的这种特定的 “slop”。它们忽略了其中的细微差别。
  3. AI 法官(LLM 作为评判者): 他们要求强大的 AI 模型(如 GPT-5 等)阅读文本并判断:“这是 slop 吗?”以及“标出糟糕的部分”。
    • 结果: 它们失败得很惨。 这些 AI 法官表现得很糟糕。它们经常完全漏掉 slop,或者标错了部分。它们往往只关注“冗长”问题,而忽略了其他一切。

总结

论文得出结论:虽然我们已经有了一个关于 slop 长什么样的人类定义的清单(它主要是关于无关、空洞或重复),但我们目前还没有一个可靠的机器人能够自动发现它。

目前,如果你想知道一段文本是否是 “slop”,你仍然需要人类去阅读并运用判断力。自动化的工具就像是一个只能发现大石头、却会错过隐藏在沙子里的珍贵宝石(或微小且烦人的垃圾)的金属探测器。

该论文并未声称:

  • 它没有说我们应该禁止 AI 写作。
  • 它没有声称这种方法能解决未来的 AI 问题(它只是说这是一个开放性的挑战)。
  • 它不建议将此用于医疗或法律决策。
  • 它严格专注于定义问题,并展示目前的自动化解决方案尚未准备好解决这一问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →