SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter
本文介绍了 SMILE-Next 这一全面的真实世界笑声数据集,并提出了一种专用的大语言模型框架,该框架具备笑声特定自指令和笑声专家混合(MoLE)机制,以显著提升对复杂社交笑声信号的检测、分类与推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,笑声是一种人类用来交流的复杂、隐秘的代码。它不仅仅是因为觉得某事有趣;有时我们笑是为了礼貌,为了掩饰尴尬,或者为了表明自己很紧张。长期以来,计算机在破解这种代码方面一直表现糟糕。它们能判断出某人“笑了”,但却难以理解“为什么”笑,或是“哪种”笑。
本文介绍了SMILE-Next,这是一个旨在教会计算机成为“笑声侦探”的新项目。以下是他们如何做到的简单解释:
1. 新的“教科书”(数据集)
想象研究人员正在为人工智能编写一本庞大而全新的教科书。在此之前,这些教科书关于笑声的内容只有寥寥几页,且大多来自电视节目或 TED 演讲。
- 新在哪里:他们收集了数千个来自现实生活的视频片段——脱口秀、电影,甚至是两个人在街头的闲聊。
- 三堂课:教科书不再仅仅询问“他们笑了吗?”,而是教导人工智能三项具体技能:
- 检测:发现笑声的发生。
- 分类:识别笑声的类型(是快乐的“愉悦”大笑?是礼貌的“我在点头附和”的笑?还是尴尬的“我不知道该说什么”的笑?)。
- 推理:解释为什么会发生。例如:“他笑了,因为老板开了个玩笑,但他实际上对会议感到紧张。”
2. “翻译”策略(文本化)
这是本文最大的技巧。通常,人工智能试图同时观看视频和聆听音频,就像一个人试图在听嘈杂的收音机时读书一样。由于信号纠缠在一起,它会感到困惑。
研究人员决定先将所有内容翻译成文本。
- 比喻:想象视频是一种外语。与其强迫人工智能从头学习这门语言,他们聘请了一个翻译团队(专用工具)将视频转化为书面故事。
- 故事包括:说了什么(逐字稿)、声音听起来如何(音高、语调)、面部表情如何(微笑、皱眉),以及人们彼此之间的关系(老板/员工、朋友)。
- 为何有效:通过将视频转化为故事,人工智能可以利用其超能力——阅读和理解语言——来解开笑点。对于计算机来说,“阅读”一段关于尴尬沉默的描述,比“观看”它要容易得多。
3. “专业团队”(笑声专家混合体)
一旦人工智能拥有了“教科书”和“翻译后的故事”,研究人员就需要一种方法,在不使其困惑的情况下,教会它精通这三项技能(检测、分类、推理)。
- 比喻:想象一位全科医生,虽然样样通晓但并非专科专家。研究人员给这位医生配备了一支由三位专业助手(称为“专家”)组成的团队。
- 专家 1 擅长发现笑声。
- 专家 2 擅长猜测笑声的类型。
- 专家 3 擅长解释原因。
- 路由器:有一位“经理”(路由器)会审视问题。如果问题是“他们笑了吗?”,经理就会呼叫专家 1。如果问题是“他们为什么笑?”,就会呼叫专家 3。它们都在同一个大脑中协同工作,但会根据任务切换角色。这使得人工智能更快、更聪明。
4. “实战演练”(自我指令)
他们收集的真实世界视频很棒,但不足以涵盖所有可能的情况。
- 比喻:为了让人工智能更聪明,他们利用强大的 AI(GPT-4)编写了新的实战演练。
- 他们告诉 AI:“这里有一些笑声的例子。现在,构思 1,000 个人们可能会笑的场景,包括那些奇怪或尴尬的。”
- 这使得人工智能能够在从未见过的场景中进行练习,从而极大地提高了其应对现实生活突发状况的能力。
结果
当他们测试这个新系统时:
- 与之前试图直接观看视频的模型相比,它在理解笑声方面表现优异得多。
- 通过查看文本中描述的肢体语言和语调,它能够正确地将笑声识别为“尴尬”而非“有趣”。
- 人类更喜欢它的解释,因为它们感觉更准确、更像人类。
简而言之:这篇论文不仅仅构建了一个更好的笑声检测器;它构建了一个将视频转化为故事、利用专家团队分析该故事、并在虚构场景中进行练习以成为人类社交线索大师的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。