← 最新の論文
🤖 AI

UTS at PsyDefDetect: Multi-Agent Councils and Absence-Based Reasoning for Defense Mechanism Classification

PsyDefDetect における UTS システムは、プロンプトレベルのルールにおける欠落に基づく推論と多エージェント審議評議会を活用し、さらに少数クラスに対する体系的バイアスを修正するための微調整済みモデルの標的オーバーライドアンサンブルによって強化されたことで、心理防衛機制の分類において第 2 位を獲得しました。

原著者: Dima Galat, Marian-Andrei Rizoiu

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Dima Galat, Marian-Andrei Rizoiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがイライラしているときに、人々がなぜそのようなことを言うのかを理解しようとしていると想像してください。彼らは単に正直を言っているのではなく、防衛機制と呼ばれる心理的な「盾」のテクニックを使っているのです。これらの盾は、身体的に行動するといった非常に未熟なものから、問題を冷静に解決するといった非常に成熟したものまで幅広いです。

コンピュータにとっての課題は、これらの盾が厄介だということです。ある人が「大丈夫だよ、ただ多くの不確実性に対処しているだけ」と言うかもしれません。表面的には、それはストレスに対処する健康的で成熟した方法のように聞こえます。しかし実際には、その人は自分の感情を隠しています。彼らはあるべき感情を欠落させているのです。コンピュータにとって、あるものを検出するよりも、欠落しているものを検出する方がはるかに困難です。

この論文は、この謎を解くためにスマートなコンピュータシステムを構築したチーム(PsyDefDetect の UTS)について説明しています。彼らは 64 の他のチームとの競争に参加し、2 位に入賞しました。彼らがどのようにしてこれを実現したか、簡単に説明します。

1. 核となるアイデア:「部屋の中の幽霊」

チームは、防衛機制が欠如によって定義されていることに気づきました。

  • 比喩: 探偵が泥棒を探している状況を想像してください。ほとんどの探偵は足跡(存在するもの)を探します。しかし、このチームは、泥棒は実際には足跡があるべき場所の空っぽな空間によって定義されていることに気づきました。
  • 応用: 誰かが悲劇について話しているのに悲しげに聞こえない場合、コンピュータは欠落している悲しみが手がかりであることを認識する必要があります。彼らはシステムに「臨床的なルール」をプログラムし、これら欠落した部分(欠落した感情、ブロックされた思考、または否認された現実)を特定するようにしました。この単一のトリックが、彼らのパフォーマンスを劇的に向上させました。

2. 「専門家評議会」(審議評議会)

1 つの AI に推測を任せるのではなく、彼らはマルチエージェント評議会を構築しました。

  • 比喩: 法廷を想像してください。陪審員が単純な多数決で投票する(そうすれば最も一般的な答えが常に選ばれます)のではなく、専門的な弁護士のパネルを持っています。
    • 第 1 フェーズ: 3 人の異なる「弁護士」(AI エージェント)が事件を検討し、可能な判決を提案します。
    • 第 2 フェーズ: 彼らが異議を唱えた場合、各可能な判決に対する特定の「擁護者」が立ち上がります。「レベル 7(成熟)」の擁護者は、それがなぜ適合するかを主張します。「レベル 6(強迫的)」の擁護者は、なぜそれの方がより適合するかを主張します。彼らは単に「私が勝ちだ!」と叫ぶのではなく、証拠を提示します。
    • 第 3 フェーズ: 裁判官が証拠の強さを検討します。「レベル 6」の擁護者が強力な証拠を持っている場合、他の 3 つのエージェントが「レベル 7」に投票していたとしても、彼らが勝ちます。
  • 結果: このシステム自体は非常に優れていましたが、欠点がありました。それは最も一般的な答え(レベル 7)に対して過剰に自信を持ち、稀で困難なケースを無視しがちだったのです。

3. 「L7 引力」(重力の問題)

データは大きく偏っていました。例の半分以上が「レベル 7(成熟)」でした。

  • 比喩: 部屋の中央に巨大な磁石(レベル 7)がある状況を想像してください。あなたがボール(会話)をどこに投げても、磁石がそれを引き寄せます。AI は、実際にはそうではない場合でも、「これは成熟している」と言い続けるように吸い寄せられていました。
  • 問題: AI は「自信を持って間違っていました」。稀な答え(レベル 3 や 4 など)を選んで正解することもあれば、間違えることもあり、また一般的な答え(レベル 7)を選んで、それらの特定のケースでは 80% の確率で間違えていました。

4. 「外科的打撃」チーム(オーバーライドアンサンブル)

磁石の問題を修正するために、彼らは第 2 層の防御としてターゲット型オーバーライドチームを追加しました。

  • 比喩: 評議会は日常の決定を行う一般管理者だと考えます。オーバーライドチームは、管理者がリスクの高い推測を行った場合にのみ介入する専門の「品質管理」部隊です。
  • 仕組み:
    • 彼らは、評議会の予測を見るために、3 つのより小さく専門的な AI モデル(専門的な外科医のようなもの)を訓練しました。
    • 評議会が「レベル 7」と言っても、専門モデルが「待て、これは実際にはレベル 6 だ」と言う場合、システムは証拠を確認します。
    • 彼らはビルダー・クリティック・ガードシステムを使用しました。
      • ビルダー: 変更を提案します。
      • クリティック: その変更が間違っていることを証明しようとします(それに反対して論じます)。
      • ガード: 証拠が確固たるものであれば、その変更のみを通過させます。
  • 結果: このチームは 472 の予測のうち 16 回しか変更を加えませんでした。しかし、その 16 の変更は非常に正確だったため、チームを 3 位から2 位に押し上げました。

5. 「漏れのあるバケツ」警告

この論文はまた、巧妙な問題も発見しました。

  • 比喩: 勉強した問題の少し異なるバージョンが出題されるテストを受けると想像してください。もし学習ガイドの答えを暗記していれば、100% 取れます。しかし、テストの問題が学習ガイドと同じ会話から出ている場合、あなたは本当に学んでいるのではなく、単に記憶しているだけです。
  • 発見: テストデータはトレーニングデータと同じ会話を共有していました。AI が単に会話を「記憶」しただけであれば、97% の精度に見えました。しかし、彼らがそれを不正行為させないようにした(同じ会話を二度見せないようにした)ところ、精度は現実的な 65% に低下しました。これは、検索(類似例の発見)が不正行為を避けるために非常に慎重に行われなければならないことを彼らに教えました。

勝利の要約

このチームは、最も大きく強力な AI モデルを使用することで勝利したわけではありません。彼らは以下の方法で勝利しました。

  1. AI に何が欠落しているか(感情の欠如)に気づくことを教えること。
  2. 単純な投票よりも証拠が重要となる議論システムを作成すること。
  3. 主要なシステムが自信を持って間違えた少数のケースを修正するために、小さく非常に規律正しい「修正チーム」を使用すること。

彼らの最終スコアはMacro-F1 0.406で、他の 63 チームを破りました。彼らは、心理学において、最も重要な手がかりは、感情があるべき場所の沈黙である場合があることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →