Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments
이 논문은 반사실적 실험을 사용하여 설명 방식이 관련 입력에 대한 모델의 동작을 정확하게 예측할 수 있는지 평가함으로써 LLM 설명 방법론을 평가하고 개선하는 에이전트 파이프라인인 CHIVE를 소개하며, 현재의 해석 가능성 기술들이 예측 이점을 제공하지 못한다는 점을 밝히는 동시에 CHIVE가 생성한 데이터로 학습하는 것이 일반화 능력을 향상시킨다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 연구가 무엇에 관한 것인지 이해하기 위해, 한 사람이 특정한 선택을 하는 이유를 이해하려고 노력하는 상황을 상상해 보십시오. 만약 그들에게 이유를 묻는다면, 그들은 어떤 이유를 대겠지만, 그 이유는 추측이거나, 합리화이거나, 혹은 단순히 틀린 것일 수도 있습니다. 인공지능의 세계에서 연구자들은 이와 유사한 문제에 직면합니다. 거대 언어 모델(LLM)은 코드를 작성하고, 이야기를 들려주며, 문제를 해결할 수 있는 강력한 도구이지만, 동시에 "블랙박스"이기도 합니다. 우리는 그들이 내뱉는 문장은 볼 수 있지만, 그 단어들을 만들어내기 위해 돌아가는 내부의 톱니바퀴를 쉽게 들여다볼 수는 없습니다. 과학자들은 이 톱니바퀴 내부를 들여다볼 수 있는 도구를 만들기 위해 오랫동안 노력해 왔으며, 모델의 행동이 발생하는 진정한 원인을 찾고자 했습니다. 목표는 모델이 자신의 추론에 대해 정직하게 말하고 있는지, 아니면 다른 의도를 숨기고 있는지를 아는 것입니다. 문제는 이것입니다: 어떻게 하면 어떤 설명이 실제로 좋은 설명인지 알 수 있을까요? 만약 한 연구자가 "모델이 특정 단어 때문에 혼란을 느껴서 실수를 했다"라고 말한다면, 그것이 사실인지 어떻게 테스트할 수 있을까요?
앤스로픽(Anthropic)의 연구진은 단순한 추측을 넘어 "만약 ~라면 어떨까"의 영역으로 들어감으로써 이를 테스트하기로 결정했습니다. 그들은 단순히 모델에게 스스로를 설명하라고 요청하는 대신, 모델의 환경을 능동적으로 변화시켜 그 설명이 유효한지 확인하는 시스템을 구축했습니다. 그들은 이 과정을 '반사실적 조사(counterfactual investigation)'라고 부릅니다. 작동 방식은 이렇습니다: 만약 당신이 모델이 특정 단어 때문에 오류를 범했다고 믿는다면, 그 단어를 바꾸고 오류가 사라지는지 확인하는 것입니다. 만약 단어를 바꿨을 때 오류가 사라진다면, 당신의 설명은 아마도 옳았을 것입니다. 만약 오류가 그대로 남아 있다면, 당신의 설명은 틀린 것입니다. 이 방법은 모호한 이론을 테스트 가능한 사실로 바꿉니다. 연구진은 과학자들이 AI 모델 내부를 들여다보기 위해 사용하는 현재의 도구들이 이러한 변화를 예측하는 데 실제로 도움이 될 수 있는지, 그리고 모델이 자신의 행동을 더 잘 이해하도록 가르칠 수 있는지 알고 싶었습니다.
이를 위해 연구진은 CHIVE라고 불리는 새로운 자동화된 파이프라인을 만들었습니다. 이 시스템은 지치지 않는 조사관처럼 작동합니다. 먼저 타겟 AI 모델에게 실제 대화에서 추출한 수천 개의 질문을 던지며, 모델이 예상치 못하거나 이상한 행동을 보이는 순간을 찾아냅니다. 일단 이상한 행동을 발견하면, 시스템은 거기서 멈추지 않습니다. 질문을 가져와서 이름 변경, 문장 삭제, 단어 교체와 같이 작고 구체적인 편집을 가한 뒤, 모델에게 다시 질문을 던집니다. 시스템은 원래의 질문과 편집된 질문 사이에서 이상한 행동이 얼마나 자주 발생하는지 확인하기 위해 이 과정을 수십 번 반복합니다. 만약 특정 단어를 바꾸었을 때 이상한 행동이 사라진다면, 시스템은 그 단어가 원인이었다는 증거로 기록합니다. 이 과정은 행동의 원인이 무엇인지 알려져 있고 실험 자체에 의해 검증된 고품질의 사례들을 수천 개 생성해 냅니다.
연구진은 이 방대한 검증된 사례 모음을 사용하여 두 가지 주요 아이디어를 테스트했습니다. 첫째, 그들은 AI 모델을 해석하기 위해 과학자들이 사용하는 기존 도구들이 실제로 도움이 되는지 확인하고 싶었습니다. 이 도구들은 모델의 내부 활동을 읽도록 설계되었는데, 이는 마치 의사가 뇌 스캔을 읽는 것과 비슷하게 답변 뒤에 숨겨진 "생각"을 찾는 과정입니다. 연구진은 이 도구들을 똑똑한 컴퓨터 에이전트에게 주고, 프롬프트의 특정 변화가 모델의 행동을 바꿀지 예측하도록 했습니다. 그들은 이 도구들이 에이전트에게 상당한 이점을 주어, 단순한 대화 내용만 읽어서는 놓칠 수 있는 숨겨진 원인들을 볼 수 있게 해줄 것이라 기대했습니다. 놀랍게도, 이 도구들은 아무런 도움도 되지 않았습니다. 에이전트는 대화의 텍스트만 가지고 있을 때와 비교했을 때 내부 읽기 도구에 접근할 수 있음에도 불구하고 비슷하거나 오히려 더 낮은 성능을 보였습니다. 도구들은 특정 입력과 그 결과로 나타나는 행동 사이의 연결 고리를 밝혀내는 데 실패했고, 에이전트는 이전과 마찬가지로 암흑 속에 남겨졌습니다.
둘히, 연구진은 모델이 수집된 데이터를 사용하여 자신의 행동을 예측하도록 가르칠 수 있는지 물었습니다. 그들은 타겟 모델들을 가져와서 수행했던 수천 번의 실험 데이터로 학습시켰습니다. 학습 과제는 간단했습니다: 모델에게 대화 내용과 제안된 변화를 보여주고, 그 변화가 이상한 행동을 멈추게 할지 추측하게 하는 것이었습니다. 결과는 훨씬 더 유망했습니다. 이 학습을 받은 모델들은 이러한 변화의 결과를 예측하는 데 있어 현저히 더 나아졌습니다. 모델들은 이전에는 인지하지 못했던 자신의 행동 패턴을 인식하는 법을 배웠습니다. 이러한 개선은 연구진이 훈련 과정에서 본 적 없는 완전히 새로운 유형의 질문과 시나리오로 모델을 테스트했을 때도 유지되었습니다. 모델들은 자신의 행동이 입력값에 의해 어떻게 영향을 받는지에 대한 일반적인 기술을 습득한 것입니다.
연구진은 모델들이 단순히 답을 암기하고 있는 것인지, 아니면 자신에 대한 더 깊고 내부적인 이해를 얻은 것인지도 탐구했습니다. 이를 테스트하기 위해, 연구진은 한 모델은 자신의 행동에 대한 데이터로 학습시키고, 다른 모델은 다른 모델의 행동에 대한 데이터로 학습시켰습니다. 만약 첫 번째 모델이 자신의 내부 상태에 대한 특별하고 독점적인 접근 권권을 가지고 있다면, 두 번째 모델보다 더 높은 성능을 보여야 했습니다. 그러나 두 모델 모두 동일하게 우수한 성능을 보였습니다. 이는 모델들이 자신에 대한 숨겨진 특권적 지식에 접근한 것이 아니라, 보여진 데이터로부터 인과관계의 패턴을 인식하는 법을 배웠음을 시사합니다. 마치 학생이 예시를 공부하며 과목을 익히는 것과 같습니다.
이 연구 결과는 이 분야의 현주소를 명확하게 보여줍니다. 더 단순하고 통제된 테스트에서는 유망해 보였던 AI 모델 내부를 들여다보는 현재의 도구들은, 실제 세상의 복잡한 대화에서 발생하는 무질서하고 복잡한 행동에 적용될 때는 작동하지 않는 것으로 보입니다. 그 도구들은 모델이 왜 그런 행동을 했는지 설명해 주는 "아하!" 하는 순간을 제공하지 못했습니다. 반면, 이 연구는 모델이 환경의 변화에 대한 자신의 반응을 예측하는 능력을 훨씬 더 향적으로 키울 수 있음을 보여줍니다. 이는 AI의 행동을 이해하는 길이 기계 내부를 들여다보기 위한 더 나은 현미경을 만드는 것이 아니라, 오히려 기계가 자신의 행동 패턴을 인식하도록 훈련하는 데 있을지도 모른다는 점을 시사합니다. 연구진은 모든 데이터와 코드를 공개하여, 미래의 AI 행동 설명이 단지 우리가 무엇인가를 생각하는 것에 그치지 않고, 세상이 변할 때 실제로 일어나는 일에 근거할 수 있도록 토대를 마련했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.