PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge
이 논문은 자유 형식 추론 과정에서 등장인물의 지식 결여를 명시적으로 드러냄으로써 기존의 이벤트 은닉 방식의 성능 한계를 극복하고 거짓 신념 과제에서 7.3%의 향상을 달 achievements한, 거대 언어 모델의 마음 이론 능력을 강화하는 프롬프팅 방법인 PICTURE를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 붐비는 방에 앉아 알렉스와 제이미라는 두 친구의 이야기에 귀를 기울이고 있다고 상상해 보세요. 당신은 전체 진실을 알고 있습니다. 당신은 제이미가 항아리에 쿠키를 숨기는 것을 보았고, 그 후 알렉스가 몰래 들어와 그 쿠키를 상자로 옮기는 것을 지켜보았습니다. 하지만 여기서 까다로운 점은, 질문이 당신이 무엇을 아느냐고 묻는 것이 아니라는 것입니다. 질문은 "알렉스는 쿠키를 어디에서 찾을까요?"라고 묻습니다. 올바르게 답하기 위해서는, 인간이 자연스럽게 하는 일이지만 컴퓨터에게는 놀라울 정도로 어려운 일을 해야 합니다. 바로 자신이 아는 것을 모르는 척하는 것입니다. 당신은 알렉스의 입장이 되어, 상자를 잊고, 오직 항아리만을 기억해야 합니다. 이 정신적 초능력을 "마음 이론(Theory of Mind)"이라고 부릅니다. 이는 다른 사람들이 자신과는 다른 자신만의 생각, 믿음, 그리고 비밀을 가지고 있다는 것을 이해하는 능력입니다.
오랫동안 과학자들은 인공지능(특히 거대 언어 모델 또는 LLM)에게 이 방법을 가르치기 위해 노력해 왔습니다. 이러한 AI 모델들은 인터넷의 거의 모든 것을 읽은 매우 똑똑한 학생들과 같지만, 누군가가 무엇을 생각하는지 추측하는 데 있어서는 종종 실수를 범합니다. 그들은 캐릭터의 "잘못된" 믿음(쿠키가 항아리에 있음) 대신 "실제" 진실(쿠키가 상자에 있음)에 기반하여 답하는 경ern이 있습니다. 당신이 읽게 될 이 논문은 이러한 AI 모델들이 실제 진실을 사용하는 것을 피하고 이야기 속 캐릭터처럼 생각하도록 돕는 새로운 방법을 밝혀냄으로써 이 문제를 다룹니다.
문제점: "숨바꼭키" 함정
과거에 연구자들은 이야기와 "숨바꼭키" 놀이를 함으로써 이 AI 문제를 해결하려 했습니다. 그들은 AI에게 이렇게 말했습니다. "자, 질문에 답하기 전에, 등장인물이 보지 못한 이야기 속의 모든 문장을 삭제해." 만약 캐릭터가 방을 나갔다면, AI는 그들이 없는 동안 일어난 모든 일을 지워야 했습니다. 이것을 "사건 숨기기(event hiding)"라고 부릅니다.
이것은 마치 선생님이 학생에게서 시험지를 가져가며 "이 페이지는 네가 알아야 할 답을 담고 있으니 보지 마"라고 말하는 것과 같습니다. AI가 진실을 볼 수 없다면, 그것을 사용하고 싶은 유혹을 느끼지 못할 것이라는 아이디어였습니다. 하지만 이 접근 방식에는 중대한 결함이 있었습니다. 이 방식은 AI에게 특정 코드나 경직된 목록과 같은 매우 엄격한 규칙을 따르도록 강요했습니다. 그것은 마치 창의적인 작가에게 "너는 오직 불렛 포인트만을 사용하여 이야기를 써야 하며 형용사는 사용할 수 없어"라고 말하는 것과 같았습니다. 이러한 엄격함은 종 often AI를 혼란스럽게 만들었고, AI가 형식을 맞추기 위해 너무 애쓰다가 오히려 실수를 저지르게 만들었습니다. 때때로 AI는 엉뚱한 문장을 삭제하거나, 자신의 생각을 담기에는 너무 작은 상자에 억지로 끼워 맞추려다 막히기도 했습니다.
새로운 아이디어: "숨기지 말고 드러내라"
이 논문의 저자인 전효진과 이상근은 완전히 다른 접근 방식을 시도했습니다. AI로부터 진실을 숨기는 대신, AI가 모든 것을 볼 수 있게 하되, 캐릭터가 모르는 것이 무엇인지 명시적으로 기술하도록 요청하기로 했습니다.
당신이 친구가 무슨 생각을 하는지 맞히는 게임을 하고 있다고 상상해 보세요. 친구의 눈을 가려 단서를 보지 못하게 하는 대신, 당신은 친구에게 이렇게 말합니다. "나는 쿠키가 상자에 있다는 것을 알지만, 너는 그것을 몰라. 너는 오직 항아리에 있다는 것만 알아." 이렇게 말함으로써, 당신은 친구에게 상자를 무시하도록 상기시켜 줍니다.
연구자들은 이 새로운 방법을 PICTURE라고 부릅니다. 이는 "사고 과정에서의 생성된 지식 결여를 통한 관점 취하기(Perspective-taking with Generated Lack of Knowledge in Chain-of-Thought Reasoning)"의 약자입니다. 이름이 매우 길어서, 이를 나누어 설명해 보겠습니다:
- 숨기지 않음: AI는 모든 비밀과 움직임이 포함된 전체 이야기를 전달받습니다.
- "지식 결여" 단계: 답변하기 전에, AI는 캐릭터가 무엇을 알고 무엇을 모르는지를 정확히 나열하는 자유 형식의 설명(일반적인 대화처럼)을 작성하도록 요청받습니다.
- "정지" 표지판: "리암은 오웬이 무를 옮겼다는 사실을 모른다"라고 쓰는 것은, AI에게 정신적인 "정지" 표지판을 만들어 줍니다. 이는 AI에게 "좋아, 나는 이 사건을 보고 있지만, 리암은 모르기 때문에 이 사건을 답변에 사용할 수 없다"라고 스스로에게 말하게 합니다.
그들이 발견한 것
연구팀은 물건을 옮기거나, 방을 나가거나, 대화를 나누는 등의 다양한 이야기 퍼즐을 통해 이 아이디어를 테스트했습니다. 그들은 이 "PICTURE" 방법이 기존의 "숨바꼭키" 방식 및 일부 표준적인 AI 기법들과 비교하여 어떻게 작동하는지 비교했습니다.
결과는 꽤 유망했습니다. 평균적으로, PICTURE를 사용한 AI는 기존 방식들에 비해 "오해(false-belief)" 퍼즐(캐릭터가 진실에 대해 틀린 정보를 가진 경우)에서 7.3% 더 많은 정답을 맞혔습니다. 이는 AI 연구 분야에서 매우 큰 성과입니다.
더 중요한 것은, 이 논문이 이 방법이 AI에게 "억제 통제(inhibitory control)"라는 기술을 가르친다고 제안한다는 점입니다. 심리학에서 이것은 눈앞에 있는 사실임에도 불구하고 그것에 반응하지 않도록 스스로를 제어하는 능력을 의미합니다. 예를 들어, 유명한 테스트에서 만약 당신이 파란색 잉크로 쓰인 "RED"라는 단어를 보고 잉크의 색깔을 말해야 한다면, 당신은 "RED"라는 단어를 읽으려는 충동을 멈춰야 합니다. 이 논문은 캐릭터가 무엇을 모르는지를 명시적으로 언급함으로써, AI가 "실제" 답을 사용하려는 충동을 억제하고 대신 캐릭터의 관점을 고수하는 법을 배운다는 것을 보여줍니다.
이것이 중요한 이유
이 논문은 우리가 AI가 사람을 더 잘 이해하게 만들기 위해 진실을 눈가림할 필요는 없다는 점을 시사합니다. 사실, 진실을 숨기는 것은 AI를 지나치게 엄격하고 혼란스러운 형식에 가둠으로써 상황을 악화시킬 수 있습니다. 대신, AI가 모든 것을 보게 한 뒤 각 캐릭터가 놓치고 있는 정보의 간극을 명확하게 설명하도록 요청함으로써, 우리는 AI가 스스로 정보를 필터링하도록 도울 수 있습니다.
저자들은 이 방법이 소규모 오픈 소스 모델부터 거대하고 강력한 모델에 이르기까지 다양한 유형의 AI 모델에서 잘 작동한다는 것을 발견했습니다. 비록 AI가 여전히 실수(특히 여러 캐릭터가 등장하는 복잡한 이야기에서)를 범하긴 하지만, PICTURE 방식은 중요한 진전인 것으로 보입니다. 이는 때때로 기계에게 인간의 마음을 이해하는 법을 가르치는 가장 좋은 방법이, 전체 그림을 보게 한 뒤 그 그림 속 각 개인이 무엇을 놓치고 있는지 부드럽게 상기시켜 주는 것임을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.