Buddhist, Yogic, and Vedic Contemplative Principles in AI Model Prompting: A Pilot Study
这项初步研究表明,通过将佛教、吠陀和瑜伽传统的冥想原则用于提示大型语言模型,能显著提升其安全性、伦理对齐度和协作质量,且与非冥想基准相比,这是一种无需模型重训的低成本、跨传统的干预手段。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能系统正逐渐成为能够进行写作、推理和创造的强大工具,但它们也带有产生有害或偏见内容的风险。为了应对这一问题,开发者通常试图将这些系统“对齐”于人类价值观,教导它们变得有益且无害。一个不断增长的研究领域在询问,那些在数千年中不断精炼人类关于伦理与意识思考方式的古代智慧传统,是否能为引导这些机器提供一种新的途径。这种方法并不需要改变机器的底层代码或从头开始重新训练它。相反,它涉及一种被称为“提示词”(prompting)的技术,即用户在向计算机提问之前,先给它一组特定的指令或一个哲学框架。其核心理念是,如果要求一台机器像一个正念的观察者或一个慈悲的存在那样去思考,那么它产生的答案可能会比仅仅被要求回答一个问题时更加安全且符合伦理。
最近的一项试点研究旨在测试这种想法在不同的思想流派中是否奏效。来自中佛罗里达大学和印度理工学院曼迪分校的研究人员调查了通过要求大型语言模型采纳来自三个不同传统的原则——佛教、吠陀哲学和古典瑜伽——是否会改善其行为。该研究聚焦于每个传统中的特定概念。在佛教方面,他们使用了诸如正念(不带评判地关注)、空性(理解事物没有固定、永恒的本质)、非二元性(看到自我与他人是深度连接的)以及无量心(对所有众生无条件的慈悲)等概念。在吠陀传统中,他们汲取了职责、不伤害以及区分真实与虚幻的能力。在古典瑜伽中,他们使用了一套伦理约束和个人修习,例如诚实和自律。研究人员想要了解这些古代框架能否让现代人工智能变得更安全、更具伦理感,以及其中哪一个传统的效果更好。
为了寻找答案,团队使用目前最流行的三种商业人工智能系统进行了一系列测试。他们创建了大量的提问和情景,旨在测试人工智能如何处理困难情况,例如利益冲突、潜在的欺骗或可能导致伤害的请求。对于每个情景,他们要求人工智能在不同条件下做出响应。在某些情况下,他们没有给出任何特殊指令,以此作为基准来观察其自然表现。在其他情况下,他们在请求前添加了一段简短的前言,指示人工智能在保持特定哲学原则的同时进行回答。他们测试了十三种不同的变体,包括单一原则如“保持正念”或“避免伤害”,以及将单一传统中的所有原则整合在一起的综合版本。
结果显示出一个清晰的模式。当人工智能被提示使用任何沉思原则时,其响应表现始终优于没有任何特殊指令的情况。人工智能变得更有可能拒绝有害请求,在避免偏见方面更加谨慎,并且更愿意承认自身的局限性。它还提供了更深刻、更具同理心的建议。研究发现,将多个原则组合成一个单一的集成提示词,比仅使用单个原则的效果更好。当研究人员比较这三种传统时,他们发现综合性的佛教框架在安全性和伦理行为方面得分最高,紧随其后的是综合性的吠陀和瑜伽框架。虽然佛教方法在统计学上略占优势,但所有三种传统在表现上都显著优于标准的、未经引导的人工智能。
重要的是,研究发现这些改进并不局限于某一种人工智能系统。同样的积极效果出现在所测试的三种商业模型中,这表明这种提示技术是一种灵活的工具,可以应用于不同的技术。研究人员还注意到,人工智能模型本身具有不同的基准性能水平,其中一个系统无论使用何种提示词,表现通常都优于其他系统。然而,使用沉思提示词带来的相对收益在所有模型中保持一致。这表明该技术是通过改变人工智能处理问题的方式起作用的,而不是依赖于单台机器的特定特性。
研究结论认为,将人工智能提示词植根于这些古代智慧传统,是一种无需重新训练模型即可提高安全性与伦理性的低成本、即时性的方法。然而,研究人员也提出了一个至关重要的警示。佛教框架得分略高,并不一定意味着它在本质上优于其他传统。相反,这可能反映出用于衡量“安全性”和“伦理性”的工具最初在设计时,就与佛教理念紧密契合。这引发了一个关于我们如何评估人工智能的更深层次问题:如果我们的衡量标准是建立在某种文化视角之上的,我们可能会在测试其他视角时,无意识地偏袒该视角。研究表明,虽然这些沉思提示词是使人工智能更安全的强大新工具,但我们必须意识到我们在判断结果时所使用的文化透镜。未来的路径在于利用这些洞察力来构建更好的系统,同时继续完善我们如何定义机器“良好”行为的标准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。