Steerable Chatbots: Exploring Personalization Control Interfaces via LLM Activation Steering
本文引入了“可控聊天机器人”(steerable chatbots)作为一种全新的个性化范式,允许用户通过激活转向(activation steering)而非提示词来直接控制大语言模型的输出,并通过一项用户研究评估了三种界面设计,以展示其在实现更好偏好对齐方面的潜力,同时强调了用户在控制与透明度方面存在的多样化价值观。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个无所不知的超级智能机器人交谈。通常情况下,如果你想让它以某种特定的方式行事——比如变得超级奢华或超级省钱——你必须用文字来解释。你可能会说,“我想要一顿豪华晚餐,”或者“我的预算很紧。”但有时,很难找到合适的词汇,或者机器人在刚开始交流时并不完全“理解”你的意思。这篇论文介绍了一种与这些机器人沟通的新方法,不仅是通过文字,还可以通过一个控制其性格的“音量旋钮”。
这项研究背后的科学家们正致力于一个被称为“人机交互”(Human-Computer Interaction)的领域,这基本上是在研究人类与机器如何和谐相处。他们正在使用一种叫做“激活引导”(activation steering)的技术。把大型语言模型(聊天机器人的大脑)想象成一台巨大且复杂的收音机。通常,你通过输入请求来更换频道。但“激活引导”就像是一个旋钮,可以直接调高或调低机器人大脑内部特定的“频率”。如果你把“奢侈”旋钮调高,机器人就会开始思考昂贵的事物。如果你把“预算”旋钮调高,它就会思考如何省钱。研究人员提出的核心问题是:如果我们给普通人这个特殊的旋钮,它应该是什么样子的?应该是滑动式的吗?是设置一次后就不用管了吗?还是应该由机器人自己去搞定?
这篇论文引入了一个新概念,叫做“可控聊天机器人”(Steerable Chatbots)。研究人员没有要求你写一段完美的段落来告诉机器人你的喜好,而是构建了能够让你直接使用简单的数字或滑块来控制机器人性格的界面。他们测试了三种不同的方式。第一种叫做 SELECT,就像手机上的音量滑块;你可以在聊天时实时上下拖动,瞬间改变机器人的氛围。第二种叫做 CALIBRATE,就像配一副新眼镜;在开始对话之前,机器人会展示两个不同的答案,然后由你选出更喜欢的一个,从而在对话开始前帮助它找到完美的设置。第三种叫做 LEARN,就像一个能读懂你心思的朋友;机器人会倾听你的话语并猜测你的偏好,在后台自动调整其设置,无需你进行任何操作。
研究人员首先进行了计算机测试,以确保这些“旋钮”确实有效。他们发现,转动旋钮确实改变了机器人的回答,使其在向一个方向转动时谈论廉价餐厅,而在向另一个方向转动时谈论豪华餐厅。随后,他们邀请了14位真实用户来尝试这三种新型聊天机器人。结果很有趣:这三种使用旋钮的方式都比仅仅依靠文字让机器人自行猜测更能让机器人理解用户。然而,人们并不都喜欢同一种控制方式。有些人非常喜欢拥有滑块(SELECT),因为他们觉得自己完全掌控了局面。另一些人则更倾向于让机器人自己去搞定(LEARN),因为这感觉更自然,也更省力。还有一些人喜欢设置步骤(CALIBRATE),因为它感觉很精准,就像做视力检查一样。
这项研究表明,给予人们一个直接控制聊天机器人性格的“旋钮”是一个强大的工具,尤其是在你刚开始使用它、还没有足够的长期聊天记录来教导机器人时。但并没有一种设计是适合所有人的。有些人想当船长,而另一些人则希望船能自动航行。论文总结道,未来与人工智能交流的方式可能不仅仅在于更好的打字技巧,而在于为我们提供不同类型的控制手段——滑块、设置向导或自动驾驶仪——以便我们可以选择自己要在多大程度上引导对话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。