← 최신 논문
💬 NLP

Can Interpretation Predict Behavior on Unseen Data?

이 논문은 분포 내 학습 중에 관찰된 어텐션 패턴이 트랜스포머 모델의 분포 외 동작을 성공적으로 예측할 수 있음을 입증하며, 인과적 메커니즘의 연결이 부재한 상황에서도 관찰 분석이 분포 변화 하에서의 신뢰성을 예견할 수 있다는 새로운 해석 가능성 목표를 확립한다.

원저자: Victoria R. Li, Jenny Kaufmann, Tian Qin, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Victoria R. Li, Jenny Kaufmann, Tian Qin, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 신비롭고 매우 똑똑한 로봇이 어떻게 생각하는지 이해하려고 노력 중이라고 상상해 보세요. 오랫동안 과학자들은 로봇을 진정으로 "알기" 위해서는 로봇을 쿡 찌르거나, 전선을 비틀거나, 특정 부품을 꺼서 무엇이 고장 나는지 확인해야 한다고 믿었습니다. 이것은 마치 자동차 엔진이 어떻게 작동하는지 알아내기 위해 엔진을 분해하는 정비사와 같습니다. 만약 점화 플러그를 제거했을 때 차가 멈춘다면, 당신은 점화 플러그가 필수적이라는 것을 알게 됩니다. 인공지능의 세계에서 이것은 "인과적 해석(causal interpretation)"이라고 불립니다. 하지만 함정이 있습니다. 이 로봇들은 너무 복적해서 쿡 찌르는 행위가 혼란스러운 답을 줄 수도 있고, 혹은 로봇이 당신이 미처 몰랐던 백업 플랜을 사용할 수도 있기 때문입니다. 그래서 새로운 질문이 등장했습니다. 로봇을 분해하지 않고도, 그저 정상적으로 작동하는 모습을 관찰함으로써 로봇을 이해할 수 있을까? 구체적으로, 로봇이 이전에 보았던 과제를 수행하는 방식을 보고, 한 번도 본 적 없는 새롭고 이상한 과제에 어떻게 행동할지 추측할 수 있을까? 이것이 바로 이 논문이 다루는 거대한 퍼즐이며, "무언가를 망가뜨려 배우는 것"에서 "패턴을 관찰하여 예측하는 것"으로의 이동을 의미합니다.

이 연구를 진행한 연구진은 수백 개의 작은 AI 로봇(트랜스포머라고 불리는)을 대상으로 게임을 진행하여, 익숙한 간단한 과제를 수행하는 동안 로봇의 "생각"을 관찰함으로써 로봇의 미래 행동을 예측할 수 있는지 확인하기로 했습니다. 그들은 로봇에게 괄호가 포함된 게임((( )) 또는 ()())을 가르쳤습니다. 까다로운 점은 훈련용 게임이 모호했다는 것입니다. 로봇은 단순히 열린 괄호와 닫힌 괄호의 총 개수만 세는 방식(단순한 평면적 규칙)으로도 이길 수 있었고, 혹은 괄호가 나무 구조처럼 완벽하게 중첩되어 있는지 확인하는 방식(복잡한 계층적 규칙)으로도 이길 수 있었습니다. 두 규칙 모두 훈련 데이터에서는 완벽하게 작동했습니다.

그런 그 후, 연구진은 로봇에게 커브볼을 던졌습니다. 그들은 괄호의 총 개수는 맞지만, "나무" 규칙을 깨뜨리는 방식으로 뒤섞인 새로운 괄호 세트를 주었습니다. 이것이 "보지 못한 데이터(unseen data)"였습니다. 어떤 로봇들은 단순한 개수 세기 규칙에 머물러 새로운 테스트에서 실패했습니다. 다른 로봇들은 나무 규칙을 파악하여 통과했습니다. 큰 질문은 이것이었습니다. 연구진이 로봇이 여전히 쉬운 게임을 하고 있는 동안의 내부 "주의(attention)"(로봇이 문장의 어느 부분에 집중하고 있는지)를 관찰함으로써, 로봇이 새로운 어려운 게임에서 성공할지 실패할지를 예측할 수 있을까?

답은 놀랍게도 "예"였습니다. 연구진은 로봇이 쉬운 게임을 하는 동안 어디에 집중하는지를 관찰하는 것만으로도, 그 로봇이 까다로운 새로운 데이터에서 성공할지 실패할지를 높은 정확도로 예측할 수 있다는 것을 발견했습니다. 이는 마치 학생이 학습지 문제를 푸는 모습을 지켜보는 것과 같습니다. 만약 당신이 쉬운 문제들을 풀 때 학생이 특정한 영리한 지름길을 사용하는 것을 본다면, 당신은 그 학생이 아직 보지 못한 어려운 시험에서도 동일한 영리한 논리를 사용할 것이라고 추측할 수 있습니다.

하지만 이 논문은 우리가 기계를 "이해한다"고 생각하는 일반적인 방식에 도전하는 발견도 해냈습니다. 보통 우리는 로로봇이 문제를 해결하기 위해 뇌의 특정 부분을 사용하고 있는 것을 보면, 그 부분이 해결책을 일으키는 '원인'이라고 가정합니다. 그러나 여기서 연구진은 때때로 그들이 발견한 "단서"(특정 주의 패턴)가 실제로 성공을 이끄는 엔진이 아니었다는 사실을 발견했습니다. 어떤 경우에 로봇은 오히려 성능을 저하시키는 패턴을 사용하고 있었음에도 불구하고, 그 패턴이 똑똑한 로봇들과 상관관계가 있었기 때문에 연구진은 그것을 사용하여 올바른 예측을 할 수 있었습니다. 이는 마치 승리하는 말에게서 행운의 부적을 보는 것과 같습니다. 부적이 말을 빠르게 달리게 만든 것은 아니지만, 만약 당신이 그 부적을 본다면 그 말이 이길 것이라고 여전히 정확하게 추측할 수 있는 것과 같습니다.

저자들은 기계를 반드시 망가뜨려야(인과적 개입) 이해할 수 있다는 생각에 명시적으로 반대합니다. 그들은 기계를 망가뜨리는 것이 배우는 하나의 방법이긴 하지만, 유일한 방법은 아니며 때로는 오해를 불러일으킬 수 있다는 것을 보여줍니다. 시뮬레이션에서 그들은 "행운의 부적" 패턴을 제거했을 때 로봇의 성능이 오히려 더 좋아지는 것을 발견했는데, 이는 그 패턴이 성공의 원인이 아니었음을 증명하며, 그 패턴이 성공의 예측 변수였음에도 불구하고 말입니다.

그렇다면 핵심은 무엇일까요? 이 논문은 AI를 판단하는 새로운 방법을 제안합니다. 단지 "우리가 정확한 원인을 찾아냈는가?"라고 묻는 대신, "다음에 무슨 일이 일어날지 예측할 수 있는가?"라고 물어야 합니다. 만약 우리가 익숙한 데이터에서의 AI 내부 패턴을 보고, 미지의 상황을 어떻게 다룰지 정확하게 추측할 수 있다면, 그것은 설령 우리가 그 이면의 기계적인 "왜"를 완전히 이해하지 못하더라도 강력한 형태의 이해입니다. 연구진은 270개의 서로 다른 모델에 대해 이 실험을 수행했으며, 이러한 예측적 접근 방식이 일관되게 작동함을 발견했습니다. 이는 AI를 실제 현장에 배치하기도 전에 그것이 언제 실패할지를 포착할 수 있는 새로운 도구를 제공합니다. 그들은 AI의 의식을 해결했거나 모든 신경 연결의 완벽한 지도를 만들었다고 주장하는 것이 아닙니다. 다만, 데이터의 "춤"을 관찰하는 것이 무용수의 다음 동작을 알려줄 수 있다는 것을 증명했을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →