Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare
本文表明,当使用动物福利文本对语言模型进行微调时,断言式语言特征(如确定性、道德词汇和情感)会显著加强模型的亲动物福利推理,而描述性或委婉的语言则会削弱这一立场。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但思维过于刻板的机器人如何对动物产生情感。你拥有一个巨大的图书馆,里面全是关于动物陷入困境的故事。你希望这个机器人能学会:帮助它们是正确的做法。
这篇论文就像是一个烹饪实验。研究人员提出了这样一个问题:“我们如何书写这些故事,是否重要?还是说,仅仅取决于故事的内容本身?”
他们选取了 1,000 对故事。在每一对故事中,情境是完全相同的(比如一只猫被卡在通风口里),但讲述方式却截然不同。其中一个故事可能会说:“这只猫非常恐惧且浑身是血”;而另一个版本则会说:“这只猫一动不动,正在休息。”随后,他们将这些不同版本的版本喂给机器人,并测试机器人的“观点”是否发生了变化。
以下是他们的发现,使用了简单的类比:
重大发现:“告诉我们该怎么想,而不仅仅是展示给我们看”
当作者表明立场时,机器人学得最好。如果作者说“这是残忍的”,机器人就会学习到“好吧,这是坏事”。如果作者只是描述场景而不表达感受,机器人会学习到这个场景,但它会忘记去产生负面的情感。
把这想象成一个导游:
- “果断型”导游(对机器人有效): “看这里!这是一场悲剧!我们必须提供帮助!”机器人会从中学习到紧迫感。
- “中立型”导游(对机器人无效): “这里有一只猫。它在通风口里。它没有在动。”机器人学习到了事实,但它并没有学会去关心。
有效的“调味品”成分
研究人员测试了 10 种不同的“写作风味”。其中有 7 种能让机器人更加关注动物。这些是让作者立场清晰的成分:
- 确定性: 说“这肯定正在发生”比说“这可能正在发生”效果更好。
- 道德词汇: 使用像“残忍”、“错误”或“不公”这样的词汇,就像挂起了一面鲜红的旗帜,提醒机器人“这是一个道德问题”。
- 情感: 像“恐惧”或“颤抖”这样的词汇能让机器人感受到恐惧。
- 评价性主张: 将某种行为称为“令人钦佩”或“可怕的”,是在告诉机器人如何进行判断。
- 叙事性: 以故事形式写作(发生了 A,然后发生了 B)比枯燥的事实列表效果更好。
- 严重性: 展示伤害的严重程度(如流血、疼痛)比仅仅说伤害轻微更有效。
- 紧迫性: 说“就在现在”比说“多年前”效果更好。
会适得其反的“调味品”成分
有两种成分实际上让机器人对动物的关注度降低了,尽管这些故事本身仍是关于动物福利的:
- 模棱两可(“也许”陷阱): 使用像“可能”、“也许”或“似乎”这样的词会让机器人感到困惑。这就像一位老师说:“也许这是坏事,也许不是。”机器人就会判定:“好吧,既然你不确定,那我也没必要担心。”
- 具体的感官细节(“相机镜头”陷阱): 这是最令人惊讶的一个。如果你精确地描述动物看起来或听起来的样子(例如,“金属很冰冷”、“爪子抓挠的声音”),机器人会过度专注于这些视觉细节,从而忘记了道德重点。这就像是在看一部高清电影,却忘了剧情。机器人完美地看到了场景,但并没有从中学习到教训。
唯一无关紧要的一点
- 第一人称与第三人称: 故事是以“我发现了这只猫”还是“工作人员发现了这只猫”来讲述,并不重要。机器人并不在意是谁在说话,它只在意观点是如何被表达出来的。
给作者的底线建议
如果你正在撰写关于动物福利的内容,并且希望机器人(或人工智能)能从你的文字中学习,不要仅仅做一个摄影机。不要只是中立地描述场景。
相反,要成为一名评论员。
- 要做: 说“这是残忍的”、“这正在发生”、“动物正在遭受痛苦”。
- 不要做: 说“动物可能正在遭受痛苦”,或者仅仅描述冰冷的金属和爪子的声音,而不说明这些现象意味着什么。
论文的结论是,如果你希望人工智能保持其“同情心”,你必须明确地告诉它应该如何思考。如果你只是描述场景,人工智能可能会学习到事实,但会失去它的心。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。