← 最新论文
💬 NLP

AI Application Gives Users Real-Time Feedback on the Level of Peace in the Social Media Videos They Watch

本文介绍了一种利用大语言模型实时分析 YouTube 视频转录文本的 AI 应用,该应用成功测量了与和平相关的五个社会维度并向用户提供其媒体饮食方面的反馈,其表现优于传统的感性分析,并展示了基于书面文本训练的模型在应用于口语时的局限性。

原作者: P. Gilda (Columbia University), P. Dungarwal (Columbia University), A. Thongkham (Columbia University), E. T. Ajayi (St John's University), S. Choudhary (Columbia University), T. M. Terol (Columbia Un
发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: P. Gilda (Columbia University), P. Dungarwal (Columbia University), A. Thongkham (Columbia University), E. T. Ajayi (St John's University), S. Choudhary (Columbia University), T. M. Terol (Columbia University), C. Lam (Columbia University), J. P. Araujo (Columbia University), M. McFadyen-Mungalln (Columbia University), L. S. Liebovitch (Columbia University), P. T. Coleman (Columbia University), H. West (Columbia University), K. Sieck (Toyota Research Institute), S. Carter (Toyota Research Institute)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你每天摄入的新闻就像是一顿饭。几十年来,我们一直被告知要检查食物的成分以确保其健康。但如今,我们大多数人通过社交媒体视频(如 YouTube)而非经过编辑的报纸来获取新闻。这篇论文的作者提出了一个问题:我们听到的这些视频词汇中,其“营养价值”是多少? 它们是在喂养我们的和平,还是在喂养冲突?

他们开发了一个名为 BAIT 的数字工具(一个 Chrome 浏览器扩展程序),它充当了视频的“和平营养标签”。当你观看视频时,BAIT 会实时分析所说的词汇,并根据内容的“和平程度”或“冲突驱动程度”给出评分。

以下是他们如何构建它的,用简单的语言解释如下:

1. 失败的配方:尝试使用“书面”食谱

首先,团队尝试教计算机通过大量的书面新闻文章来识别和平。

  • 类比: 想象一下,试图通过仅仅阅读书面的食谱卡片,来教一位厨师识别汤的味道。计算机很好地学会了某些书面词汇(如“外交”或“停战”)通常出现在关于和平国家的文章中。
  • 结果: 当他们在书面新闻上进行测试时,计算机表现得非常出色,准确率达到了约 97%
  • 问题: 当他们尝试使用这种相同的“书面食谱”来分析口语化的视频转录文本时,它失败得很惨。它会将几乎所有的视频都标记为“和平的”,即使事实并非如此。
  • 原因: 作者意识到,口语与书面文本是完全不同的物种。 在镜头前说话的新闻主播会使用填充词、停顿、情感语调和对话中的奇思妙想,这些在印刷文章中是不存在的。计算机就像是一个试图仅凭菜单来评判一场现场烹饪表演的厨师;它错过了真正的风味。

2. 新方法:“情境味觉测试员”

既然“书面食谱”行不通,团队便改变了策略。他们不再寻找特定的关键词,而是要求计算机理解对话的氛围语调

他们专注于由数十年社会科学研究确定的五种特定的“风味”

  1. 同理心 vs. 轻蔑: 说话者是友善的还是嘲讽的?
  2. 新闻 vs. 观点: 他们是在报道事实,还是仅仅在宣泄情绪?
  3. 促进 vs. 预防: 他们是在谈论建设性的事物,还是仅仅在试图阻止坏事发生?
  4. 创造力 vs. 秩序: 对话是对新想法持开放态度,还是僵化且具有控制欲的?
  5. 细微差别 vs. 简化: 他们看到了灰色地带,还是仅仅呈现黑白分明的极端情况?

为了衡量这些指标,他们测试了两类 AI:

  • “词频计数器”(情感分析): 这个工具只是统计快乐或悲伤的词汇。它就像一个只能测量温度却不知道现在是晴天还是暴风雨的温度计。它的表现非常糟糕(几乎是在随机猜测)。
  • “情境阅读器”(大语言模型): 这些是先进的 AI,它们可以阅读整个段落并理解词汇背后的“故事”。它们充当了一位成熟的美食评论家,能够理解说出“这项政策是一场灾难”时,带有讽刺意味与带有真实愤怒之间的区别。

3. 结果:“情境阅读器”胜出

团队让一组人类专家(和平研究人员)观看 52 个视频并根据那五种“风味”进行评分。然后,他们将人类评分与 AI 评分进行了对比。

  • “词频计数器” AI 几乎不比抛硬币好多少。
  • “情境阅读器” AI(特别是最新的模型) 约有 60% 的时间判断正确。
  • 类比: 这是一个巨大的胜利。这意味着 AI 现在几乎能像人类专家一样理解视频的“语调”,而不仅仅是单词。它能分辨出一段激烈的辩论虽然依然保持尊重(和平),但与一段听起来很平静却充满了隐藏轻蔑(不和平)的演讲之间的区别。

4. BAIT 现在的功能

最终产品 BAIT 是一个位于你 YouTube 视频旁边的浏览器扩展程序。

  • 对于观众: 它为你提供关于“媒体饮食”的实时反馈。它帮助你意识到:“噢,过去一小时里我一直在看充满轻蔑和简化的视频。”其目标是提高你的自我意识,让你可能会选择观看更有建设性的内容。
  • 对于创作者: 它为视频制作者提供关于其内容语调的反馈,帮助他们了解他们的言辞在受众心中留下的印象。

核心结论

论文声称,虽然我们还无法完美地衡量和平,但我们终于建立了一个能够倾听口语视频并理解其情感语调的工具,其表现远优于以往的工具。通过使用能够理解情境(而非仅仅是关键词)的先进 AI,我们现在可以开始衡量所看视频的“和平程度”,并希望通过了解我们正在消费的内容,能帮助我们在现实生活中表现得更加和平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →