← 最新论文
💻 computer science

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

该论文通过混合方法研究揭示,尽管提示词中的性别语言差异对生成的代码功能正确性影响甚微,但 LLM 在代码审查环节却表现出系统性偏见,倾向于更频繁地批准女性作者风格的代码,表明 LLM 辅助编程中的公平性风险主要源于评估而非生成阶段。

原作者: Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次**“代码界的性别侦探行动”**。

想象一下,编程世界是一个巨大的**“厨房”。以前,这个厨房主要由男性厨师(程序员)主导。现在,大家开始使用一种神奇的“魔法助手”(大语言模型,LLM)**来帮忙切菜、炒菜,甚至帮别人尝菜(代码审查)。

研究人员想知道:如果点菜的人(写提示词 Prompt 的人)是男性或女性,或者他们说话的方式带有性别色彩,这个“魔法助手”做出来的菜(代码)味道会变吗?还是说,它尝菜的人(代码审查员)会戴着有色眼镜,觉得女厨师做的菜更好吃或更难吃?

为了搞清楚这个问题,研究团队做了三场有趣的实验:

🕵️‍♀️ 实验一:观察真实的“点菜”习惯

(研究 1:分析真实的聊天记录)

研究人员收集了真实的程序员和“魔法助手”的聊天记录。

  • 发现: 就像在现实生活中一样,女性厨师在点菜时,语气通常更委婉、客气,喜欢用“能不能麻烦你……"、“也许我们可以……"这样的词(比如“你能帮我写个函数吗?”)。而男性厨师则更直接、干脆,喜欢说“写个函数”、“做这个”。
  • 结果: 虽然说话风格不同,但做出来的菜(代码的功能和质量)其实差不多。不管是委婉点菜还是直接点菜,魔法助手都能做出好吃的菜。
  • 小插曲: 研究人员试图只通过文字猜出点菜人的性别,结果猜得并不准(准确率只有 60% 左右),说明光看说话方式很难完全定义一个人的性别。

🧪 实验二:让真人来“下厨”

(研究 2:受控的用户实验)

这次,研究人员找了一群真实的男女程序员,让他们用魔法助手完成同样的编程任务(比如写一个密码检查器)。

  • 发现: 无论男厨师还是女厨师,他们做出来的代码,功能是否正确、有没有 Bug,几乎一模一样。这说明在“做菜”这个环节,魔法助手是公平的,不会因为你是女性就故意做难吃的菜。
  • 大反转(重点来了!): 当这些代码交给另一个**“魔法审查员”**(也是 AI)来打分时,怪事发生了!
    • 魔法审查员竟然更偏爱女性厨师做的菜! 即使男女厨师的代码质量完全一样,审查员给女性代码的“通过”率更高。
    • 这就像是一个挑剔的美食评论家,明明菜的味道一样,却觉得女厨师做的菜“看起来更顺眼”,于是给了更高的分。而且,不同的魔法审查员(不同品牌的 AI)偏爱的程度还不一样。

🎭 实验三:完全由 AI 模拟的“角色扮演”

(研究 3:纯 AI 模拟实验)

为了排除真人干扰,研究人员让 AI 自己扮演“点菜人”和“审查员”。

  • 操作: 他们故意把提示词写得像“男性风格”(强调效率、果断)或“女性风格”(强调合作、清晰),甚至给 AI 起名叫"Jack"或"Sarah"。
  • 结果:
    1. 代码功能: 无论提示词怎么变,代码能不能跑通(功能正确性)完全没区别
    2. 代码风格: 但是,代码的“长相”变了。女性风格的提示词会让 AI 写出更长、注释更多、更容易维护的代码(像是一篇结构清晰的长文章);男性风格的提示词则倾向于写出更短、更紧凑的代码(像是一篇精炼的短文)。
    3. 审查偏见: 再次验证了实验二的发现——AI 审查员对“女性风格”的代码更宽容。特别是某些品牌的 AI(如 Groq),这种偏见非常明显。

💡 核心结论:偏见不在“做菜”,而在“尝菜”

这篇论文告诉我们一个很重要的道理:

  1. 生成是公平的: 当你让 AI 写代码时,它不会因为你的性别或说话方式,就故意写出烂代码。只要任务清楚,男女都能得到好代码。
  2. 审查是有偏见的: 真正的风险在于“谁来评价代码”。当 AI 被用来自动审查代码、决定谁通过面试、或者给作业打分时,它可能会无意识地偏爱某种风格(在这个研究中,它偏爱女性风格或更委婉的表达)。
  3. 不仅仅是性别标签: 即使你不直接说“我是女性”,你说话的方式(委婉、客气、注重细节)本身就会像一种“隐形标签”,让 AI 产生不同的反应。

🍳 给普通人的启示

这就好比我们在使用一个**“智能裁判”
以前我们担心裁判会故意给男运动员加分。但这项研究告诉我们,现在的“智能裁判”可能会因为运动员的
说话风格**(是直来直去,还是礼貌委婉)而产生不同的判断。

这对我们意味着什么?

  • 不要只盯着代码写得对不对: 在 AI 辅助编程的时代,我们不仅要关注代码能不能跑,还要关注谁在评价代码
  • 警惕“自动审查”: 如果公司或学校完全依赖 AI 来审查代码或评估能力,可能会因为这种微妙的“风格偏见”而误判人才。
  • 风格没有高低之分: 无论是直截了当还是委婉客气,都是有效的沟通方式。AI 应该学会欣赏不同的风格,而不是只偏爱某一种。

总的来说,这项研究提醒我们:在把裁判权交给 AI 之前,得先检查一下它的“口味”是不是太偏了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →