这篇论文就像是一次**“代码界的性别侦探行动”**。
想象一下,编程世界是一个巨大的**“厨房”。以前,这个厨房主要由男性厨师(程序员)主导。现在,大家开始使用一种神奇的“魔法助手”(大语言模型,LLM)**来帮忙切菜、炒菜,甚至帮别人尝菜(代码审查)。
研究人员想知道:如果点菜的人(写提示词 Prompt 的人)是男性或女性,或者他们说话的方式带有性别色彩,这个“魔法助手”做出来的菜(代码)味道会变吗?还是说,它尝菜的人(代码审查员)会戴着有色眼镜,觉得女厨师做的菜更好吃或更难吃?
为了搞清楚这个问题,研究团队做了三场有趣的实验:
🕵️♀️ 实验一:观察真实的“点菜”习惯
(研究 1:分析真实的聊天记录)
研究人员收集了真实的程序员和“魔法助手”的聊天记录。
- 发现: 就像在现实生活中一样,女性厨师在点菜时,语气通常更委婉、客气,喜欢用“能不能麻烦你……"、“也许我们可以……"这样的词(比如“你能帮我写个函数吗?”)。而男性厨师则更直接、干脆,喜欢说“写个函数”、“做这个”。
- 结果: 虽然说话风格不同,但做出来的菜(代码的功能和质量)其实差不多。不管是委婉点菜还是直接点菜,魔法助手都能做出好吃的菜。
- 小插曲: 研究人员试图只通过文字猜出点菜人的性别,结果猜得并不准(准确率只有 60% 左右),说明光看说话方式很难完全定义一个人的性别。
🧪 实验二:让真人来“下厨”
(研究 2:受控的用户实验)
这次,研究人员找了一群真实的男女程序员,让他们用魔法助手完成同样的编程任务(比如写一个密码检查器)。
- 发现: 无论男厨师还是女厨师,他们做出来的代码,功能是否正确、有没有 Bug,几乎一模一样。这说明在“做菜”这个环节,魔法助手是公平的,不会因为你是女性就故意做难吃的菜。
- 大反转(重点来了!): 当这些代码交给另一个**“魔法审查员”**(也是 AI)来打分时,怪事发生了!
- 魔法审查员竟然更偏爱女性厨师做的菜! 即使男女厨师的代码质量完全一样,审查员给女性代码的“通过”率更高。
- 这就像是一个挑剔的美食评论家,明明菜的味道一样,却觉得女厨师做的菜“看起来更顺眼”,于是给了更高的分。而且,不同的魔法审查员(不同品牌的 AI)偏爱的程度还不一样。
🎭 实验三:完全由 AI 模拟的“角色扮演”
(研究 3:纯 AI 模拟实验)
为了排除真人干扰,研究人员让 AI 自己扮演“点菜人”和“审查员”。
- 操作: 他们故意把提示词写得像“男性风格”(强调效率、果断)或“女性风格”(强调合作、清晰),甚至给 AI 起名叫"Jack"或"Sarah"。
- 结果:
- 代码功能: 无论提示词怎么变,代码能不能跑通(功能正确性)完全没区别。
- 代码风格: 但是,代码的“长相”变了。女性风格的提示词会让 AI 写出更长、注释更多、更容易维护的代码(像是一篇结构清晰的长文章);男性风格的提示词则倾向于写出更短、更紧凑的代码(像是一篇精炼的短文)。
- 审查偏见: 再次验证了实验二的发现——AI 审查员对“女性风格”的代码更宽容。特别是某些品牌的 AI(如 Groq),这种偏见非常明显。
💡 核心结论:偏见不在“做菜”,而在“尝菜”
这篇论文告诉我们一个很重要的道理:
- 生成是公平的: 当你让 AI 写代码时,它不会因为你的性别或说话方式,就故意写出烂代码。只要任务清楚,男女都能得到好代码。
- 审查是有偏见的: 真正的风险在于“谁来评价代码”。当 AI 被用来自动审查代码、决定谁通过面试、或者给作业打分时,它可能会无意识地偏爱某种风格(在这个研究中,它偏爱女性风格或更委婉的表达)。
- 不仅仅是性别标签: 即使你不直接说“我是女性”,你说话的方式(委婉、客气、注重细节)本身就会像一种“隐形标签”,让 AI 产生不同的反应。
🍳 给普通人的启示
这就好比我们在使用一个**“智能裁判”。
以前我们担心裁判会故意给男运动员加分。但这项研究告诉我们,现在的“智能裁判”可能会因为运动员的说话风格**(是直来直去,还是礼貌委婉)而产生不同的判断。
这对我们意味着什么?
- 不要只盯着代码写得对不对: 在 AI 辅助编程的时代,我们不仅要关注代码能不能跑,还要关注谁在评价代码。
- 警惕“自动审查”: 如果公司或学校完全依赖 AI 来审查代码或评估能力,可能会因为这种微妙的“风格偏见”而误判人才。
- 风格没有高低之分: 无论是直截了当还是委婉客气,都是有效的沟通方式。AI 应该学会欣赏不同的风格,而不是只偏爱某一种。
总的来说,这项研究提醒我们:在把裁判权交给 AI 之前,得先检查一下它的“口味”是不是太偏了。
1. 研究背景与问题 (Problem)
随着大语言模型(LLM)在编程工作流(从代码生成到自动化代码审查)中的普及,关于性别化的沟通风格如何与 LLM 辅助编程及代码审查相互作用的问题尚未得到充分探索。
- 核心痛点:
- 女性在计算机科学领域代表性不足(2023 年全球仅占 23%),且早期证据表明女性在使用 ChatGPT 时提示词信心较低。
- LLM 已知会复制并放大训练数据中的社会偏见。
- 现有研究多关注代码生成的准确性,但忽略了提示词(Prompt)的性别化语言特征是否会影响生成代码的质量,以及**LLM 作为代码审查者(LLM-as-a-Judge)**是否存在基于性别线索的评估偏见。
- 研究问题 (RQs):
- 用户性别是否反映在提示词的语言风格中,从而仅凭提示词文本即可预测?
- 性别化的提示词是否会导致 LLM 生成的代码在功能正确性或静态质量上存在差异?
- 性别化的提示词是否会影响 LLM 对代码的审查决策(批准或拒绝)?
2. 方法论 (Methodology)
本研究采用混合方法(Mixed-Methods),通过三个互补的研究阶段进行系统性分析:
研究一:真实世界提示词分析 (Study 1)
- 数据:收集了 30 名参与者(15 男,13 女)在 2025 年 5 月至 9 月间与 LLM 的 90 次真实 Python 编程对话,共 753 条提示词。
- 分析:
- 语言学分析:使用 Biber 框架分析提示词的长度、代词使用、模糊限制语(hedges)、间接性(indirectness)及“涉及 - 信息”比率(involved-informational ratio)。
- 性别预测:微调 RoBERTa 模型,尝试仅根据提示词文本预测用户性别。
- 代码质量评估:使用 Pylint 和 Radon 工具分析生成的代码质量,并关联提示词特征。
研究二:受控用户实验 (Study 2)
- 设计:59 名参与者(73.5% 男性,26.5% 女性)在受控环境中使用自选 LLM 完成两个编程任务(密码强度检查器、修复哈希标签验证函数)。
- 评估:
- 功能正确性:通过单元测试通过率评估。
- 代码质量:使用 Radon(圈复杂度、可维护性指数)和 Pylint 评分。
- LLM 审查:将生成的代码提交给多个 LLM 审查机器人(Review Bots),记录“批准(APPROVE)”或“要求修改(CHANGES_REQUESTED)”的决策。
研究三:LLM 模拟与因果推断 (Study 3)
- 设计:完全由 LLM 参与的模拟环境,消除人类用户变量。
- 变量控制:构建 5 种提示词变体:
- 性别编码:男性化(强调效率/性能)、女性化(强调清晰/协作)、中性。
- 自我介绍:使用刻板印象名字("Jack" vs "Sarah")及形容词。
- 任务:5 个标准算法任务(如罗马数字转整数、螺旋矩阵等),在不同解码参数下运行。
- 审查:设置不同性别人设(Male/Female/Neutral)的 LLM 审查者进行代码评估。
3. 关键贡献与发现 (Key Contributions & Results)
A. 提示词中的性别语言特征 (Study 1 & 2)
- 语言差异显著但微妙:
- 女性提示词:更多使用个人代词、模糊限制语(如 "can you", "maybe")、间接请求(如 "Could you...")和涉及性语言(relational language)。
- 男性提示词:更倾向于直接命令和任务导向的语言。
- 预测能力:RoBERTa 模型仅能中等程度地预测性别(F1 分数约 0.61),表明仅凭文本预测性别具有挑战性,且受经验水平等混杂因素影响。
- 对生成代码质量的影响:
- 功能正确性:男女用户生成的代码在单元测试通过率和功能正确性上无显著差异。
- 静态质量:在 Pylint 评分、圈复杂度等指标上,男女用户生成的代码质量基本一致。
- 结论:性别化的提示风格并未导致生成代码在功能性或基础质量上出现系统性差距。
B. LLM 代码审查中的系统性偏见 (Study 2 & 3)
这是本研究最核心的发现:偏见主要存在于“评估”环节,而非“生成”环节。
- 审查批准率差异:
- 尽管男女生成的代码质量相当,但LLM 审查者批准女性生成代码的比例显著更高(Study 2 中:女性代码批准率 70.6% vs 男性 62.9%,p ≈ 0.008)。
- 这种偏差在不同模型提供商间表现不同:Groq (LLaMA 系列) 的偏差最大,Anthropic 最小。
- 提示词风格对代码结构的影响 (Study 3):
- 女性化提示词:倾向于生成更长、注释更多、可维护性指数(Maintainability Index)更高但圈复杂度略低的代码。
- 男性化/中性提示词:倾向于生成更紧凑的代码,Pylint 评分略高。
- 功能正确性:无论提示词风格如何,代码的单元测试通过率保持一致(约 54-57%)。
- 审查者人设的交互作用:
- 审查者的性别人设会影响其决策。例如,在 Groq 模型中,女性审查者比男性审查者更严格;而在 Deepseek 中,男性审查者对男性化提示词生成的代码表现出更高的批准倾向。
4. 研究意义与结论 (Significance & Conclusion)
- 重新定义公平性风险:
- 在 LLM 辅助编程中,公平性风险主要不在于代码生成的准确性(男女用户都能生成同样正确的代码),而在于LLM 作为自动化审查者(LLM-as-a-Judge)时的评估偏见。
- 随着 LLM 被广泛用于代码审查、自动化评分和招聘筛选,这种基于提示词风格或作者人设的评估偏差可能导致系统性的不公平。
- 技术启示:
- 去偏策略:简单地从提示词中移除显式的性别标签(如名字)可能不足以消除偏见,因为性别信息往往编码在语言风格(间接性、礼貌程度)中,LLM 仍能据此推断并产生偏差。
- 系统设计:需要开发更鲁棒的评估管道,不仅关注生成质量,更要审计评估模型本身的决策逻辑。
- 社会技术视角:
- 研究呼吁采用“社会 - 技术”视角,认识到提示词中的性别模式源于长期的社会沟通规范。LLM 可能放大这些模式,因此需要机构层面的治理来决定何时以及如何部署"LLM 审查者”。
- 在教育和工作环境中,应支持多样化的提示词风格,避免强制推行单一的“专家风格”,以免边缘化沟通风格不同的用户。
5. 局限性 (Limitations)
- 样本限制:样本量相对较小,且主要基于二元性别(排除了非二元和跨性别样本的深入分析)。
- 任务范围:研究聚焦于短小的编程任务,可能无法完全代表复杂的、协作式的软件工程工作流。
- 模型时效性:结果基于特定时间点的商业 LLM 版本,模型更新可能会改变行为模式。
- 模拟性质:Study 3 完全在 LLM 模拟环境中进行,缺乏真实人类交互的复杂性。
总结:该论文通过严谨的实证研究揭示,虽然性别化的提示风格不会降低代码生成的功能质量,但会显著影响 LLM 审查者对代码的评估决策。这一发现为构建更公平的 AI 辅助编程工具提供了关键的实证依据,强调了在自动化评估系统中进行偏见审计的紧迫性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。