← 最新论文
🤖 AI

UTS at PsyDefDetect: Multi-Agent Councils and Absence-Based Reasoning for Defense Mechanism Classification

UTS 在 PsyDefDetect 系统中,通过利用基于缺失的推理构建提示级规则、引入多智能体审议委员会,并辅以针对微调模型的定向覆盖集成以纠正对少数类别的系统性偏差,从而在心理防御机制分类任务中取得了第二名的成绩。

原作者: Dima Galat, Marian-Andrei Rizoiu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Dima Galat, Marian-Andrei Rizoiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图理解人们为何在情绪激动时会说出那样的话。有时,他们并非仅仅在表达真实想法;他们正在使用一种被称为防御机制的心理“屏蔽”技巧。这些屏蔽手段的范围从非常不成熟(如通过身体行为发泄)到非常成熟(如冷静地解决问题)。

计算机面临的挑战在于,这些屏蔽手段十分棘手。一个人可能会说:“我很好,只是在应对许多未知情况。”表面上看,这似乎是一种健康、成熟地应对压力的方式。但事实上,这个人正在隐藏自己的感受。他们缺失了本应存在的情绪。对计算机而言,识别缺失的内容远比识别存在的内容要困难得多。

本文介绍了一个团队(UTS at PsyDefDetect),他们构建了一个智能计算机系统来解决这一难题。他们在与 64 支其他队伍的竞赛中脱颖而出,获得了第二名。以下是他们如何做到的简明解释。

1. 核心理念:“房间里的幽灵”

该团队意识到,防御机制是由缺失定义的。

  • 隐喻:想象一名侦探正在寻找窃贼。大多数侦探寻找的是足迹(存在之物)。但这支团队意识到,窃贼实际上是由足迹本应存在空无一物的空间所定义的。
  • 应用:如果某人谈论一场悲剧却听起来并不悲伤,计算机需要识别出缺失的悲伤才是线索。他们为系统编程了“临床规则”,专门寻找这些缺失的部分(缺失的情绪、受阻的思维或被否认的现实)。这一招就为他们的性能带来了巨大的提升。

2. “专家委员会”(审议委员会)

他们没有让单一的人工智能做出猜测,而是建立了一个多智能体委员会

  • 隐喻:想象一个法庭。他们不是让陪审团通过简单多数投票(这总会选出最常见的答案),而是设立了一个由专业律师组成的合议庭。
    • 第一阶段:三位不同的“律师”(AI 智能体)审视案件并提出可能的判决。
    • 第二阶段:如果他们意见不一,针对每种可能判决的特定“辩护人”就会站出来。代表“第 7 级”(成熟)的辩护人论证为何该判决适用;代表“第 6 级”(强迫性)的辩护人则论证为何那个更适用。他们不只是大喊“我赢了!”,而是提出证据。
    • 第三阶段:法官审视证据的强度。如果“第 6 级”的辩护人拥有确凿证据,即使其他三个智能体投票支持“第 7 级”,他们也能获胜。
  • 结果:这个系统本身表现优异,但它存在一个缺陷:它对最常见的答案(第 7 级)过于自信,往往忽略了罕见且困难的案例。

3. “第 7 级吸引子”(重力问题)

数据存在严重偏差。超过一半的样本属于“第 7 级”(成熟)。

  • 隐喻:想象房间中央有一块巨大的磁铁(第 7 级)。无论你向哪里扔出一个球(一段对话),磁铁都会将其吸过去。人工智能不断被吸进去,即使情况并非如此,它也会说“这是成熟的”。
  • 问题:人工智能“自信地错了”。它会选择罕见的答案(如第 3 级或第 4 级)并答对,但也会选择它们却答错;更糟糕的是,它会选择常见答案(第 7 级),而在这些特定案例中,它有 80% 的概率是错的。

4. “外科手术式打击”团队(覆盖集成)

为了解决磁铁问题,他们添加了第二道防线:一个针对性覆盖团队

  • 隐喻:把委员会想象成负责日常决策的总经理。覆盖团队则是一支专门的“质量控制”小队,只有当总经理做出冒险猜测时才会介入。
  • 工作原理
    • 他们训练了三个更小的、专门的 AI 模型(如同专科医生)来审查委员会的预测。
    • 如果委员会说“第 7 级”,但专门模型说“等等,这实际上是第 6 级”,系统就会检查证据。
    • 他们使用了一个构建者 - 批评者 - 守卫系统:
      • 构建者:提出修改建议。
      • 批评者:试图证明修改是错误的(提出反对意见)。
      • 守卫:只有当证据确凿时,才允许修改通过。
  • 结果:这个团队在 472 次预测中仅进行了 16 次修改。但这 16 次修改极其准确,将团队从第 3 名推升至第 2 名

5. “漏桶”警告

该论文还发现了一个隐蔽的问题。

  • 隐喻:想象参加一场考试,题目是你复习过的题目的略微不同版本。如果你死记硬背了复习指南的答案,你就能拿 100 分。但如果考题来自与复习指南相同的对话,那你并不是在真正学习;你只是在记忆。
  • 发现:测试数据与训练数据共享了相同的对话。如果人工智能只是“记住”了对话,它的准确率看起来高达 97%。但当他们阻止这种作弊行为(确保它不会两次看到相同的对话)时,准确率下降到了现实的 65%。这让他们明白,检索(寻找相似示例)必须非常谨慎,以避免作弊。

获胜总结

该团队并非通过使用最大、最强大的 AI 模型获胜。他们获胜是因为:

  1. 教导 AI 注意缺失之物(情绪的缺失)。
  2. 创建一个辩论系统,其中证据比简单的投票更重要。
  3. 使用一个小型、高度自律的“修正团队”,来修正主系统偶尔自信犯错的情况。

他们的最终得分是宏观 F1 分数 0.406,击败了其他 63 支队伍。他们证明了在心理学中,有时最重要的线索正是情感本应存在却一片寂静的时刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →