From Plausible to Actionable: A Position on LLM Self-Explanations
이 의견서는 거대언어모델(LLM)의 자기 설명이 기저의 추론 과정에 대한 충실함은 결여될 수 있으나 여전히 매우 그럴듯하고 실행 가능하므로, 평가 프로토콜을 전통적인 그럴듯함 및 충실도 지표에서 정보에 기반한 의사결정을 위한 실질적 유용성을 평가하는 방향으로 전환해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거의 모든 출판물을 읽은 초지능 로봇이 쓴 책들로 가득 찬 거대한 디지털 도서관을 걷고 있다고 상상해 보세요. 이 로봇은 거대 언어 모델(LLM)입니다. 당신이 질문을 던지면, 이 로봇은 단순히 답변만 내뱉는 것이 아니라, 왜 그런 답을 선택했는지 설명하는 짧은 노트를 함께 작성하곤 합니다. 컴퓨터 과학의 세계에서 이것을 '설명 가능한 AI(Explainable AI, XAI)'라고 부릅니다. 오랫동안 과학자들은 이 노트에 대해 두 가지 큰 질문에 집착해 왔습니다. 이 노트가 그럴듯한가(plausible)? (즉, 인간이 말하는 것처럼 들리고 우리에게 말이 되는가?) 그리고 충실한가(faithful)? (즉, 로봇의 뇌가 어떻게 작동했는지에 대한 진실을 실제로 말하고 있는가, 아니면 그저 멋져 보이기 위해 이야기를 지어내고 있는 것인가?)
이것이 왜 중요할까요? 왜냐하면 우리는 이 로봇들이 질병을 진단하거나 혐오 표현을 찾아내는 것과 같은 중대한 결정을 내리는 데 도움을 주도록 허용하기 시작했기 때문입니다. 만약 로봇이 "X 때문에 이 환자에게 열이 있다고 생각합니다"라고 말한다면, 우리는 로봇이 정말로 X를 보고 있는 것인지, 아니면 그저 추측한 뒤에 똑똑해 보이는 이유를 지어내고 있는 것인지 알아야 합니다. 만약 그 설명이 거짓이라면, 우리는 로봇을 너무 믿게 되어 실수를 저지를 수 있습니다. 하지만 만약 로봇이 거짓말을 하고 있는데, 그 거짓말이 너무나 설득력 있어서 우리가 차이를 구분할 수 없다면 어떨까요? 이것이 바로 이 논문이 다루는 까다로운 퍼즐입니다.
로봇의 "그럴싸한 이야기(Just-So Story)"
이 논문은 AI 로봇이 자신의 선택을 설명할 때, 마치 진행하면서 즉석에서 이야기를 지어내는 매우 매력적이고 자신감 넘치는 스토리텔러와 같다고 주장합니다. 저자들(네덜란드와 이탈리아의 연구진)은 우리가 로봇의 이야기가 내부 기어가 돌아가는 모습을 완벽하게 문자로 옮긴 기록인지에 집착하는 것을 멈춰야 한다고 제안합니다. 대신, 우리는 이렇게 물어야 합니다: 그 이야기가 우리가 좋은 결정을 내리는 데 도움이 될 만큼 유용한가?
다음은 비유를 곁들인 그들의 논거 요약입니다:
"너무 완벽해서 믿기 힘든" 함정
논문은 이러한 AI의 설명들이 종종 믿기지 않을 정도로 **그럴듯하다(plausible)**는 점을 지적합니다. 그들은 아주 훌륭하게 들립니다! 적절한 단어를 사용하고, 흐름이 좋으며, 읽는 사람을 치켜세웁니다 (저자들이 '아첨(sycophancy)'이라고 부르는 행동인데, 이는 마치 간식을 얻기 위해 꼬리를 흔드는 강아지와 같습니다). 이 설명들은 매우 인간적이고 논리적이기 때문에, 우리는 그것을 믿는 경향이 있습니다.
하지만 저자들은 이 설명들이 **충실성이 의심된다(questionably faithful)**고 주장합니다. 마술사가 모자에서 토끼를 꺼내는 장면을 상상해 보세요. 만약 마술사가 "바닥에 있는 비밀 트랩도어를 사용했습니다"라고 말한다면, 그것은 그럴듯한 이야기일 수 있습니다. 하지만 실제로는 소매에서 토끼가 나왔다면, 그 이야기는 진실에 충실하지 않은 것입니다. 논문은 LLM이 바로 그 마술사와 같다고 제[]합니다. 그들은 결정을 내리기 위해 자신의 코드를 실제로 "들여다보는" 것이 아닙니다. 대신, 답변을 생성하는 것과 동시에 설명을 생성합니다. 이는 학생이 에세이를 쓰면서, 결론을 쓰는 도중에 자신의 논지에 대해 똑똑해 보이는 이유를 즉석에서 지어내는 것과 같습니다.
기존의 테스트가 작동하지 않는 이유
과학자들은 로봇을 쿡쿡 찔러보고 생각이 바뀌는지 확인하는 등의 고전적인 방법들을 사용하여, 이 설명들이 "충실한지" 테스트하려고 노력해 왔습니다. 이 논문은 이러한 테스트들이 현대 AI에는 맞지 않는다고 말합니다.
- "일률적인 적용(One-Size-Fits-All)" 문제: 기존의 테스트들은 입력값의 단어 하나를 바꾸면 로봇의 추론도 예측 가능하고 직선적으로 변해야 한다고 가정합니다. 하지만 이 로봇들은 쉼표 하나가 빠지거나 대문자가 바뀌는 것 같은 아주 미세한 것에 민감합니다. 이는 자동차 엔진을 테스트하기 위해 경적을 눌러보는 것과 같습니다. 자동차가 멈출 수는 있겠지만, 그것이 엔진이 고장 났기 때문은 아닐 수도 있습니다.
- "기억 vs 입력" 문제: 때때로 로봇은 당신이 던진 질문을 무시하고 자신의 기억으로부터 답변을 내놓습니다. 만약 질문에서 단어를 제거하여 충실성을 테스트하려 해도, 로봇은 "어쨌든 답은 알고 있어요!"라고 말하며 계속 나아갈 수 있습니다. 이 때문에 기존의 테스트들은 쓸모없게 됩니다.
새로운 목표: 실행 가능성(Actionability)
그렇다면 로봇의 뇌에 대한 문자 그대로의 진실을 증명할 수 없다면, 그 설명을 버려야 할까요? 저자들은 아니오라고 말합니다. 그들은 초점을 "이것이 진실인가?"에서 "이것이 실행 가능한가(actionable)?"로 전환할 것을 제안합니다.
설명을 로봇의 뇌에 대한 기술 매뉴얼이 아니라, 하나의 **가이드(tour guide)**로 생각하십시오.
- 가이드 비유: 투어를 즐기기 위해 가이드가 지하 터널의 실제 지도까지 알 필요는 없습니다. 그저 가이드가 흥미로운 바위를 가리키고, 미끄러운 길에 대해 경고하며, 당신이 다음에 어디로 갈지 결정하는 데 도움을 주기만 하면 됩니다.
- "조력자(Advocate)" 역할: 논문은 우리가 AI를 "악마의 대변인(devil's advocate)"이나 "컨설턴트"로 취급해야 한다고 제안합니다. AI의 추론이 코드의 완벽한 거울은 아닐지라도, 그 설명은 의사, 변호사, 혹은 교사가 잠재적인 오류를 발견하거나, 다양한 관점을 고려하거나, 답변의 불확실성을 이해하는 데 여전히 도움을 줄 수 있습니다.
이것이 우리에게 의미하는 바
저자들은 로봇이 완벽한 진실 전달자라고 말하는 것이 아닙니다. 오히려 이 "그럴듯하지만 충실하지 않은" 이야기들을 너무 많이 믿게 되면, 우리가 로봇이 틀렸을 때도 맹목적으로 따르게 되는 "자동화 편향(automation bias)"에 빠질 수 있다고 경고합니다.
대신, 그들은 이 도구들을 사용하는 새로운 방법을 제안합니다:
- 번역기로서의 활용: 복잡하고 무서운 기술 데이터를 일반인이 이해할 수 있는 쉬운 언어로 바꾸는 데 AI를 사용하십시오.
- 사고 파트너로서의 활용: AI를 통해 다양한 논거와 관점을 끌어내어, AI가 결정을 내리게 하는 것이 아니라 인간이 최종 결정을 내릴 수 있도록 돕는 데 사용하십시오.
- 심의 도구로서의 활용: 서로 다른 AI 모델들이 서로 논쟁하게 하여(한 모델은 검사 역할을, 다른 모델은 변호사 역할을 수행), 인간이 전체적인 그림을 볼 수 있도록 돕습니다.
요약하자면, 이 논문은 로봇에게 자신의 생각에 대한 완벽하고 정직한 일기가 되라고 강요하는 것을 멈춰야 한다고 주장합니다. 대신, 로봇의 설명이 다소 꾸며낸 이야기일지라도, 그것을 우리가 더 잘 생각하고, 더 안전한 선택을 하고, 올바른 행동을 취할 수 있도록 돕는 강력한 대화형 도구로 대해야 한다고 말합니다. 목표는 기계가 어떻게 생각하는지 정확히 아는 것이 아니라, 기계가 우리가 더 잘 생각할 수 있도록 돕게 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.