For What Reason? Interpreting Models' Encoding of Causation and Antithesis
이 논문은 지시어 튜닝된 트랜스포머 모델이 인과 및 대립 담화 관계를 어떻게 인코딩하는지 조사하며, 예측 결정이 여러 레이어에 걸쳐 서로 다른 단계에서 이루어지고 이 모델들이 담화 기반 추론에 대해 비대칭적 표현을 보인다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 단어를 듣는 것을 넘어, 그 단어들을 하나로 묶어주는 보이지 않는 실을 느낌으로써 대화를 이해하려고 노력한다고 상상해 보십시오. 인공지능의 세계에서 이 실은 '담화 관계(discourse relations)'라고 불립니다. 이것은 이야기의 접착제와 같아서, 한 문장이 다음 문장의 이유가 되는지, 혹은 다음 문장을 반박하는 놀라운 반전인지를 알려줍니다. 컴퓨터가 진정으로 유용하고 안전해지려면, 단순히 단어의 사전적 정의를 아는 것이 아니라 이러한 연결 고리를 이해해야 합니다. 만약 로봇이 "나는 공부했다, 그래서 합격했다"(행복한 인과관계)와 "나는 공부했다, 그럼에도 불구하고 낙제했다"(슬픈 모순)의 차이를 구별하지 못한다면, 당신에게 끔찍한 조언을 하거나 당신의 감정을 오해할 수도 있습니다. 이 논문은 현대 AI의 '두뇌' 속으로 들어가서, 이 모델들이 어떻게 이러한 까다로운 관계들을 실제로 처리하는지 파헤칩니다.
연구자들인 아비딥 바타차리아(Abhidip Bhattacharyya)와 시라 와인(Shira Wein)은 두 가지 인기 있는 AI 모델(LLaMA와 Mistral) 내부에서 탐정 놀이를 하며, 이 모델들이 인과관계(어떤 일이 다른 일 때문에 발생하는 것)와 대조(어떤 일이 그럼에도 불구하고 발생하는 것)를 어떻게 구별하는지 알아내기로 했습니다. 그들은 간단한 게임을 설정했습니다: AI에게 "존은 열심히 공부했다, 그래서 그는 합격하기에 ___ 했다"와 같이 빈칸이 있는 문장을 보여주고, 빈칸을 "할 수 있었다(able)" 또는 "할 수 없었다(unable)" 중 하나로 채우도록 요청하는 것입니다. 연결어( 'so'를 'yet'으로 바꾸는 것 등)를 바꾸거나 동사의 의미를 뒤집음으로써, 그들은 AI의 내부 기어가 정확히 어떻게 돌아가는지 확인할 수 있었습니다.
그들이 발견한 내용은 다음과 같으며, 이는 마치 공장의 조립 라인이 어떻게 작동하는지 발견하는 것과 비슷합니다.
사고의 조립 라인
연구팀은 AI가 결정을 한 번에 내리는 것이 아니라는 사실을 발견했습니다. 대신, 그것은 계주 경기와 같습니다. AI가 'so'나 'yet' 같은 단서 단어를 읽을 때, AI의 뇌의 초기 및 중간 계층(생각해 보면 고층 빌딩의 처음 몇 개 층과 같습니다)은 즉시 국소적인 의미를 파악하기 시작합니다. 이들은 "오, 'so'는 보통 좋은 결과를 의미하고, 'yet'은 반전을 의미하는구나!"라고 말하는 역할을 합니다.
하지만 이 초기 계층들이 최종 결정권을 갖는 것은 아닙니다. 정보가 타워 위쪽의 높은 계층으로 이동함에 따라, 결정이 확정됩니다. 연구진은 일단 중간 계층이 제 역할을 다하고 나면, 상위 계층은 그 결정을 결승선까지 전달하는 역할만 수행한다는 것을 발견했습니다. 만약 여러분이 상위 계층의 '생각'을 다른 문장과 교체하여 방해하더라도, AI는 마음을 바꾸지 않습니다. 이미 너무 늦었기 때문입니다; 결정은 이미 내려졌습니다. 하지만 AI가 'so'나 'yet'이라는 단어를 보는 바로 그 순간에 중간 계층을 건드린다면, 실제로 답변을 뒤집을 수 있습니다. 이는 중간 계층이 이러한 특정 단서들에 대한 실제 의사 결정자임을 시사합니다.
숨겨진 편향
가장 흥고한 발견 중 하나는 AI가 완벽하게 중립적이지 않다는 점입니다. 연구진은 특정 계층들이 내재된 **편향(bias)**을 가지고 있다는 것을 발견했습니다. 어떤 계층들은 문장의 내용과 상관없이 'unable'이라는 답변을 선호하는 강한 성향을 보이는 반면, 어떤 계층들은 'able' 쪽으로 크게 기울기도 합니다. 이는 마치 어떤 판사는 본래 까칠해서 '아니오'라고 말하고 싶어 하고, 어떤 판사는 낙관적이어서 '예'라고 말하고 싶어 하는 판사 팀을 가진 것과 같습니다. 최종 답변은 진실이 승리할 때까지 이러한 편향된 계층들 사이의 줄다리기입니다.
동사의 역할
이 연구는 또한 AI가 단순히 연결어 그 이상을 살필 만큼 똑똑하다는 것을 보여주었습니다. 만약 문장이 부정적인 동사(예: '열심히 공부했다' 대신 '규칙을 어겼다')를 사용한다면, AI는 'able'이 맞는지 'unable'이 맞는지 알아내기 위해 더 열심히 노력해야 합니다. 연구진은 AI가 긍정적인 동사와 부정적인 동사를 사용할 때 서로 다른 내부 경로를 사용한다는 것을 발견했습니다. 동사가 부정적일 때, AI 내부의 연결은 덜 안정적이고 더 혼란스러웠는데, 이는 부정적인 감정이나 행동이 AI의 추론 과정을 다소 불안정하게 만든다는 것을 시사합니다.
결론
요약하자면, 이 논문은 AI 모델이 단순히 정답을 '아는' 것이 아니라, 단계별로 정답을 '만들어낸다'는 것을 시사합니다. 뇌의 초기 부분은 단서를 포착하고, 중간 부분은 결정을 내리며, 상위 부분은 그 판결을 전달합니다. AI는 이 작업에 매우 능숙하지만(거의 항상 정답을 맞힙니다), 특정한, 때로는 편향된 내부 회로에 의존하여 이를 수행합니다. 이는 AI가 진정으로 인간의 가치와 일치하기 위해서는, 우리가 AI가 무엇을 답하는지뿐만 아니라, 어떻게 결정하는지도 알아야 한다는 것을 이해하는 데 도움을 줍니다. 왜냐하면 정답에 이르는 경로가 정답 자체만큼이나 중요하기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.