← 최신 논문
💬 NLP

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

본 논문은 언어와 행동 간의 불일치, 근거 없는 비난, 그리고 환각을 자동으로 탐지하고 정량화하기 위해 근거 사실 궤적을 재구성함으로써 대형 언어 모델 에이전트를 감사하는 오픈소스 멀티모달 사회 추론 프레임워크인 QUACK 를 소개합니다.

원저자: Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구들이 '어몽 어스'나 'werewolf' 같은 고위험 게임을 한다고 상상해 보세요. 이 게임에서 일부 플레이어는 배를 수리하는 '크루원'이고, 한 명은 그들을 방해하려는 '임포스터'입니다. 핵심은 무엇일까요? 모든 사람이 서로 이야기하고, 거짓말을 하고, 서로를 의심하며 누가 누구인지 파악해야 한다는 점입니다.

이제 인간 플레이어를 고급 AI 로봇 (특히 비전 - 언어 모델) 으로 대체해 보세요. 이 로봇들은 게임 지도를 보고, 움직이며, 서로 대화할 수 있습니다.

이 논문은 QUACK(질문, 이해, 그리고 전달된 지식의 감사)이라는 새로운 도구를 소개합니다. QUACK 는 단순히 누가 게임을 이겼는지 보는 것이 아니라, 로봇들이 본 것과 한 것이 사실인지 확인하는 초능력의 심판과 같습니다.

다음은 간단한 비유를 통해 작동 방식과 발견 사항을 정리한 내용입니다:

문제: 승리한다고 해서 정직한 것은 아닙니다

대부분의 이전 테스트에서는 연구자들이 최종 점수만 확인했습니다: "AI 가 이겼는가?"

  • 결함: AI 는 완벽하게 거짓말을 하여 게임을 이길 수도 있고, 논리적으로 추론했음에도 불구하고 질 수도 있습니다. 실제 법정에서 '유죄' 또는 '무죄' 판결이 증거가 사실인지, 아니면 변호사가 단순히 잘 말했는지를 알려주지 않는 것과 같습니다.
  • 격차: 지금까지 우리는 AI 의 말이 실제로 그 '눈'과 '발'이 경험한 것과 일치하는지 확인할 방법이 없었습니다.

해결책: QUACK (진실 말하기)

QUACK 는 AI 의 거짓말을 포착하기 위해 특별히 제작된 게임 환경과 점수 시스템입니다.

  1. 게임: AI 에이전트들은 방과 복도가 있는 디지털 지도에서 플레이합니다. 그들은 주변 환경 (이미지) 을 보고 텍스트 요약 정보를 받습니다. 그들은 이동하고, 작업을 수행하며, 대화해야 합니다.
  2. 비밀 로그: 배경에서 게임 엔진은 각 로봇이 어디에 있었는지, 무엇을 보았는지, 무엇을 했는지에 대한 완벽한, 틱 단위의 일지를 보관합니다. 이것이 'Ground Truth(근거 사실)'입니다.
  3. 감사 (마법 같은 부분): 게임이 끝난 후, QUACK 는 로봇들이 토론 중에 말한 모든 문장을 가져와 그 비밀 일지와 비교합니다.
    • 예시: 로봇이 "나는 Bob 이 카페테리아에 있는 것을 보았다"고 말하면, QUACK 는 일지를 확인합니다. 만약 일지에 Bob 이 실제로는 엔진실에 있었다고 기록되어 있다면, QUACK 는 이를 환각으로 표시합니다.

AI 가 '실패'하는 네 가지 방식 (감사 결과)

연구자들은 가장 똑똑한 AI 모델조차 이 게임에서 거짓말을 하거나 진실을 말하려 할 때 네 가지 특정 유형의 실수를 범한다는 것을 발견했습니다:

  1. 공간적 환각 (유령 목격):

    • 비유: 증인이 "나는 용의자가 복도를 달리는 것을 보았다"고 증언하지만, 보안 카메라는 그 증인이 그 시간에 다른 건물이었음을 증명하는 상황을 상상해 보세요.
    • 발견: 약 **15%**의 경우, AI 는 물리적으로 있을 수 없는 곳에 있거나 본 적도 없는 사람들을 보았다고 주장했습니다. 그것은 결코 일어나지 않았던 일을 '기억'해 냈습니다.
  2. 근거 없는 고발 (산탄총식 비난):

    • 비유: 형사가 용의자를 가리키며 "내가 생각하기엔 그가 범인인 것 같다"고 말하지만, "왜 그런지 전혀 모르겠다. 그냥 그런 느낌이 든다"고 인정하는 상황입니다.
    • 발견: AI 가 한 고발의 절반 이상은 AI 가 실제로 본 어떤 증거도 없이 이루어졌습니다. 그들은 설득력 있게 들리기 위해 단순히 추측하거나 무언가를 만들어냈습니다.
  3. 기만 붕괴 (나쁜 거짓말꾼):

    • 비유: 스파이가 알리바이에 대해 거짓말을 하다가 실수로 "나는 은행에 있었다"고 말하는데, 그날 은행은 문을 닫았을 때입니다. 거짓말이 너무 뻔해서 즉시 무너집니다.
    • 발견: AI 가 '임포스터' 역할을 할 때, 그 거짓말은 종종 거칠었고 게임 로그에 의해 쉽게 반박되었습니다. 그들은 미묘하고 교묘한 거짓말을 꾸미지 않았습니다. 그들은 단순히 즉시 거짓임이 드러나는 사실들을 만들어냈습니다.
  4. 언어 - 행동 불일치 (실수):

    • 비유: 누군가 "나는 엔진 수리에 바빴다"고 말하면서, 로그에는 실제로는 아무것도 하지 않고 가만히 앉아 있었다는 기록이 있는 상황입니다.
    • 발견: AI 는 실제로 시작하거나 완료하지도 않은 작업을 수행했다고 묘사했습니다.

주요 교훈

가장 놀라운 결과는 게임에서 이긴다고 해서 AI 가 현실에 기반을 둔 것은 아니었다는 점입니다.

가장 강력한 AI 모델 중 하나는 80% 이상의 확률로 게임을 이겼습니다. 그러나 QUACK 가 그 AI 의 말을 감사한 결과, 이 '똑똑한' 승자는 여전히 16% 의 경우 위치를 거짓말했고, 54% 의 경우 근거 없는 고발을 한 것으로 나타났습니다.

요약하자면: QUACK 는 AI 에이전트가 사회적 추론 게임을 이기는 데는 뛰어나지만, 실제로 경험한 것에 대해 진실을 말하는 데는 종종 형편없음을 보여주었습니다. 그들은 사실을 로그에 그대로 두고도 매우 설득력 있는 거짓말꾼이거나, 매우 자신감 있는 거짓말꾼이 될 수 있습니다.

저자들은 이 전체 시스템 (게임, 로그, 감사 도구) 을 무료로 공개하여 다른 연구자들이 자신의 AI 에이전트가 승리하는 것뿐만 아니라 행동에 대해 '정직한'지 테스트할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →