← 최신 논문
🤖 AI

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

이 논문은 새로운 협력적 그리드 월드 벤치마크인 Relay Chain을 통해 시각-언어 모델이 내부 신념 표현을 행동 예측으로 효과적으로 라우팅하는 데 실패한다는 점을 밝혀내는 진단 방법인 CARD를 소개한다.

원저자: Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

게시일 2026-08-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 분야가 성장함에 따라, 연구자들은 기계가 타인의 마음을 이해할 수 있는지에 대해 점점 더 많은 관심을 기울이고 있습니다. '마음 이론(theory of mind)'이라고 알려진 이 능력은, 어떤 정보가 자신의 시야에서 가려져 있을 때도 다른 사람이 무엇을 보고, 알고, 원하는지를 추론할 수 있게 해줍니다. 이는 협력을 가능하게 하는 정신적 접착제로서, 우리가 단순히 자신의 관점이 아니라 파트너의 관점을 바탕으로 파트너의 다음 움직임을 예측할 수 있게 해줍니다. 인공지능 시스템이 로봇 비서, 운전 부조종사, 또는 팀 구성원으로서 인간과 함께 일하기 위해 배치됨에 따라, 과학자들은 이 시스템들이 이러한 능력을 갖추고 있는지 알아야 합니다. 만약 AI가 파트너가 무엇을 아는지 진정으로 파악하지 못한다면, 다른 면에서 아무리 지능적으로 보일지라도 효과적으로 협력할 수 없습니다.

이를 조사하기 위해 슈투트가르트 대학교의 연구팀은 현대적인 시각-언어 모델(vision-language models)의 '두뇌' 내부를 들여다보는 새로운 방법을 개발했습니다. 이 모델들은 이미지를 볼 수 있는 동시에 언어를 이해할 수 있는 고급 컴퓨터 프로그램입니다. 연구진은 이 모델들이 실제로 행동을 결정할 때 파트너의 정신 상태에 대한 내부적 이해를 사용하는지 알고 싶었습니다. 그들은 디지털 격자 위에서 진행되는 협동 게임인 '릴레이 체인(Relay Chain)'이라는 새로운 테스트 환경을 만들었습니다. 이 게임에서 두 명의 에이전트는 제3의 에이전트가 통과할 수 있도록 문을 여는 레버를 잡고 있습니다. 성공 여부는 전적으로 에이전트들이 여행자가 건너가는 것을 파트너가 볼 수 있는지 여부를 아는가에 달려 있습니다. 만약 에이전트가 건너가는 모습을 볼 수 없다면 레버를 잡고 있어야 하며, 만약 볼 수 있다면 레버를 놓아야 합니다. 이 설정은 AI가 단순히 세상에서 일어나고 있는 일이 아니라, 자신의 파트너가 무엇을 보고 있는지에 대한 믿음을 바탕으로 결정을 내리도록 강제합니다.

연구진은 모델을 조사하기 위해 '활성화 스티어링(activation steering)'이라는 기술을 사용했습니다. AI의 내부 생각을 방대한 신호의 풍경이라고 상상해 보십시오. 연구팀은 파트너가 무엇을 보고 있는지에 대한 AI의 내부 기록인 '믿음(belief)'을 나타내는 특정 신호들을 식별했습니다. 그런 다음 AI가 게임을 하는 동안 이 믿음 신호를 인위적으로 강화하거나 약화시켰는데, 이는 본질적으로 모델의 내부 상태를 파트너의 시야에 대해 더 확신하거나 덜 확신하도록 유도하는 것이었습니다. 만약 AI가 진정으로 파트너의 마음을 이해하여 결정을 내리는 것이라면, 그 내부의 믿음을 바꾸는 것이 AI가 취하는 행동을 변화시켜야 합니다. 예를 들어, 모델이 파트너가 여행자를 볼 수 있다고 믿도록 유도되었다면 레버를 놓아야 할 것입니다. 반대로 파트너가 볼 수 없다고 믿도록 유도되었다면 레버를 잡고 있어야 할 것입니다.

결과는 이 모델들이 작동하는 방식의 결정적인 결함을 드러냈습니다. 실험 결과, 모델들은 파트너의 믿음에 대한 명확하고 읽을 수 있는 표현을 실제로 보유하고 있었습니다. "당신의 파트너가 여행자를 보고 있습니까?"라고 직접 물었을 때, 모델들은 정확하게 답변했으며, 연구진은 내부 신호를 조절함으로써 그 답변을 바꿀 수도 있었습니다. 그러나 모델들에게 협동 행동을 수행하라고 요청했을 때(레버를 놓을지 잡을지 결정할 때), 그들의 내부 믿음 신호는 완전히 무시되었습니다. 심지어 연구진이 모델의 파트너가 무엇을 보는지에 대한 내부 믿음을 강제로 변경했을 때도, 모델의 결정은 동일한 행동을 유지했습니다. 모델은 파트너의 시야에 대한 완벽한 기억을 가지고 있는 것처럼 행동했지만, 정작 움직임을 결정할 때는 그 기억을 사용하지 않는 것처럼 보였습니다.

이러한 불일치는 테스트된 네 가지 유형의 오픈 소스 모델(소형부터 대형 시스템까지) 모두에서 일관되게 나타났습니다. 모델들은 정보가 부족해서 실패한 것이 아니라, 그 정보를 행동을 결정하는 시스템의 부분으로 전달하지 못했기 때문에 실패한 것이었습니다. 연구진은 모델이 질문의 단어 선택에 혼란을 느꼈거나 스티어링 방법이 너무 약해서 등록되지 않았을 가능성 등 다른 가능성들을 배제했습니다. 그들은 수십 가지의 다른 지시문 표현 방식을 테스트했으며, 어떤 프롬프팅도 모델이 내부 믿음을 사용하여 행동을 안내하도록 강제할 수 없다는 것을 발견했습니다. 모델들은 행동을 취하는 데 있어서는 자신의 지식에 대해 사실상 "눈이 먼" 상태였습니다.

이 연구는 인공지능 시스템이 파트너의 정신 상태를 설명하도록 훈련될 수는 있지만, 그 설명을 자신의 행동과 자동으로 연결하지는 않는다는 결론을 내립니다. 모델들은 다른 사람이 무엇을 아는지에 대해 말할 수는 있지만, 그 지식을 무엇을 할지 결정하는 데 사용하지는 않습니다. 이는 단순히 모델에게 믿음에 관한 질문에 답하도록 가르치는 것만으로는 진정한 협력적 에이전트를 만드는 데 충분하지 않다는 것을 시사합니다. AI가 인간과 원활하게 협력하기 위해서는 타인에 대한 내부적 이해가 의사 결정 과정에 직접 연결되어야 하는데, 현재의 모델들은 그러한 연결 고리가 결여되어 있는 것으로 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →