Interpreting Style Representations via Style-Eliciting Prompts
本文提出了一种新颖的框架,该框架通过训练解码器生成“风格诱导提示词(style-eliciting prompts)”来解释潜在风格表示,这些提示词作为一种可解释且实用的接口,用于恢复风格属性,并比现有方法更有效地引导大语言模型模仿特定的写作风格。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个神奇的“风格盒子”。盒子里藏着一段秘密代码(一个数学向量),它完美地捕捉了一个人的写作方式——包括其语气、句子长度、词汇量和节奏。问题在于,这段代码仅仅是一串数字。这就像拥有一份用你听不懂的语言编写的食谱;你知道它能做出蛋糕,但你完全不知道里面用了什么原料,也不知道该如何亲手烘焙。
这篇论文介绍了一种将这种秘密代码重新翻译成直白英文指令的新方法。
问题所在:“黑盒”化的写作风格
研究人员已经开发出了能够分析写作并将之转化为这些秘密数字代码的工具。这些工具非常擅长判断两段文本是否由同一人创作,但它们却很难解释其中的原因。
以往试图解决这一问题的尝试是要求大型 AI 模型直接“观察文本并描述风格”。这就像是让一位厨师在没看到食谱的情况下,仅凭品尝一道菜来描述它。厨师可能会说“味道不错”,或者因为自身的偏见而猜错原料。其结果往往是模糊不清的描述,导致你无法真正利用这些描述来重现那道菜。
解决方案:“风格翻译器”
作者创建了一个全新的系统,它充当了秘密数字代码与清晰、分步骤的“食谱”(他们称之为“风格提示词”)之间的翻译官。
他们没有采取“猜测描述”的方式,而是采用了逆向工程的方法:
- 食谱先行: 他们首先准备了 1,010 条具体且清晰的指令(例如“使用短促、有力的词汇”或“听起来像是一位友好的幼儿园老师”)。
- 烹饪过程: 他们将这些指令输入给 AI,生成了 180 万个不同的故事和回答。
- 模型训练: 他们向 AI 展示:“这是这个故事的秘密数字代码,而这是我们用来制作它的精确食谱。”他们训练了一个新的模型(一个“解码器”),让它学习如何通过观察代码并输出对应的食谱。
研究成果:一份神奇的菜单
团队通过三种方式测试了这个系统,结果证明它比以往任何方法都更有效:
- 逆向工程: 当给定一段由 AI 编写的故事时,他们的系统可以通过观察秘密代码,高精度地推测出原始食谱。其表现远优于仅仅要求 AI “描述”风格。
- 重做菜肴: 当他们将推测出的食谱再次输入给 AI 时,生成的新故事听起来与原著如出一辙。其“风味”得到了完美的保留。
- 烹饪人类食物: 他们将此技术应用于真实的真人写作(而非仅仅是 AI 写作)。尽管该系统是在 AI 食谱上训练出来的,但它仍然可以观察人类的写作,推导出其“食谱”,并让 AI 以那种人类的风格进行写作。
大局观
你可以将这想象成一个控制各种写作风格的通用遥控器。以前,如果你想让 AI 写得像诗人或律师,你必须猜测要在对话框中输入哪些词。现在,这个系统可以观察一段文字,解码其“风格 DNA”,并为你递上一份清晰的说明书,告诉 AI 如何精准地复制这种风格。
作者强调,这并不是关于改变所写内容的内容,而是关于掌握表达内容时的声音与方式。他们已经将他们的“食谱库”(数据集)和“翻译器”(代码)开放给他人使用,希望让 AI 写作变得更加透明且可控。
他们并未声称:
- 他们并未声称这可以确定地识别出谁写了某段文本(作者身份识别),而只能描述其风格。
- 他们并未声称这适用于每种语言(目前侧重于英语)或每种类型的写作(如小说或技术手册),因为其训练数据主要来自在线问答网站。
- 他们并未声称这是一个用于破解或窃取秘密的工具,尽管他们也指出,如果有人想要隐藏身份或窃取特定的提示词,该技术在理论上可能被误用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。