Human-Like Anaphor Resolution in Large Language Models
본 연구는 다섯 가지 오픈 웨이트 거대 언어 모델을 평가하여 이들이 인간과 유사한 대용어 해소 패턴을 보이는지 결정하며, 일부 모델이 인간과 유사하게 담화 구조 및 거리에 대한 민감성을 보이는 반면 의미적 간섭 효과에 대해서는 그에 상응하는 민감성이 결여되어 있다는 것을 발견하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 추리 소설을 읽고 있다고 상상해 보세요. 작가는 첫 장에서 "제빵사"라는 캐릭터를 소개합니다. 열 페이지 뒤, 이야기에서 그를 다시 "그(he)"라고 언급합니다. 당신의 뇌는 단순히 그가 누구인지 추측하는 데 그치지 않습니다. 즉시 과거의 기억으로 되돌아가 제빵사의 이미지를 붙잡고 점들을 연결합니다. 이 정신적인 마술 기법을 **전방 참조 해결(anaphor resolution)**이라고 부릅니다. 이것은 이야기가 전개됨에 따라 우리가 누구 또는 무엇에 대해 이야기하고 있는지를 추적하는 방법입니다.
과학자들은 인간이 이 과정을 어떻게 수행하는지 오랫동안 연구해 왔습니다. 만약 제빵사가 이야기의 주요 초점(주제적)이었다면, 당신은 그를 더 빨리 찾아낸다는 것을 그들은 알고 있습니다. 만약 "그"가 제빵사 바로 다음에 등장한다면 쉽습니다. 하지만 만약 "그"가 길고 혼란스러운 간격 뒤에 나타나거나, 당신을 헷갈리게 할 다른 제빵사가 근처에 있다면, 당신의 뇌는 비틀거립니다. 이제, **대규모 언어 모델(LLM)**을 만나봅시다. 이들은 이야기를 쓰고, 질문에 답하며, 인간처럼 대화할 수 있도록 방대한 양의 텍스트로 훈련된 매우 똑똑한 컴퓨터 프로그램입니다. 하지만 여기서 중요한 질문이 생깁습니다. 이 AI의 뇌가 이러한 퍼즐을 풀 때 실제로 인간의 뇌처럼 '생각'하는 것일까요, 아니면 단지 패턴에 기반하여 매우 잘 추측하는 것뿐일까요? 이 논문은 AI와 인간이 같은 정신적 파동 위에 있는지 확인하기 위해 이 미스터리를 파헤칩니다.
위대한 AI 기억력 테스트
연구진은 다섯 가지 서로 다른 AI 모델—GPT-2-XL, Llama-3.1-8B, Pythia-12B, Mistral-7B, 그리고 Mistral-24B—을 인간을 위해 특별히 설계된 일련의 기억력 게임에 투입했습니다. 그들은 AI가 인간 독자와 똑같은 방식으로 지치거나, 혼란스러워하거나, 혹은 속도가 느려지는지 알고 싶었습니다.
이를 측정하기 위해 그들은 두 가지 영리한 기술을 사용했습니다. 첫째, **의외성(surprisal)**을 살펴보았습니다. 이것을 AI의 "뇌의 땀"이라고 생각하세요. 컴퓨터가 예상치 못한 단어를 읽을 때, 그 "의외성"은 올라갑니다. 인간에게 높은 의외성은 보통 우리가 생각하기 위해 더 오래 멈춘다는 것을 의미합니다. 따라서 만약 AI가 인간이 막히는 순간과 똑같이 "땀을 흘린다면"(높은 의여성), 이는 AI가 우리와 유사하게 이야기를 처리하고 있다는 좋은 신호입니다. 둘째, 그들은 AI에게 "누가 의자를 걷어찼는가?"와 같은 이해도 질문을 던져서, AI가 실제로 올바른 인물을 기억하고 있는지 확인했습니다.
기억력 게임들
연구팀은 인간 기억의 특정 규칙을 테스트하는 세 가지 서로 다른 실험을 진행했습니다.
1. "초점" 및 "거리" 테스트
스포트라이트를 상상해 보세요. 만약 캐릭터가 스포트라이트 아래에 있다면(이야기 제목에 언급된다면), 인간은 그를 쉽게 찾습니다. 만약 그들이 어둠 속에 있다면, 더 어렵습니다. 또한, 캐릭터가 한 문장 정도 떨어져 있다면 쉽습니다. 만약 열 문장이나 떨어져 있다면, 더 어렵습니다.
- 결과: 대부분의 AI 모델은 여기서 인간처럼 행동했습니다! 캐릭터가 제목에 의해 강조되고 가까이 있을 때, AI의 "뇌의 땀"은 낮았고 정답을 맞혔습니다. 반면 캐릭터가 숨겨지고 멀리 떨어져 있을 때, AI는 혼란을 겪었습니다. 마치 AI의 주의 집중 시간이 우리처럼 늘어났다 줄어들었다 하는 것 같았습니다.
2. "공간과 시간" 테스트
이것은 더 까다로웠습니다. 이야기가 거대한 성에서 진행된다고 상상해 보세요. 만약 캐릭터가 주방에서 옆방으로 이동하거나(짧은 거리), 주방에서 탑으로 이동한다면(긴 거리), 그것이 중요할까요? 만약 그들이 10분을 기다리거나 2시간을 기다린다면 어떨까요? 인간은 공간이나 시간의 간격이 매우 클 때 더 느려지고 실수를 더 많이 합니다.
- 결과: 결과는 엇갈렸습니다. Llama-3.1-8B나 Mistral-7B 같은 일부 모델은 거리와 시간의 무게를 느끼는 듯 보였으며, 간격이 길 때 "땀을 흘렸습니다." 다른 모델들은 시간이나 공간의 간격에 별로 신경을 쓰지 않는 것처럼 보였습니다. 이는 일부 AI가 이야기의 타임라인에 대한 "느낌"을 이해하기 시작한 반면, 다른 AI들은 그냥 건너뛰고 있음을 시사합니다.
3. "혼란스러운 단서" 테스트
이것이 가장 어려운 부분입니다. 이야기에서 "금속 의자"를 언급한다고 상셉해 보세요. 나중에 "그 금속 가구"라고 말합니다. 그것은 쉽습니다. 하지만 만약 이야기에서 바로 직전에 "나무 책상"(가구의 다른 유형)을 언급했다면 어떨까요? 인간은 "가구"가 의자일 수도 있고 책상일 수도 있기 때문에 혼란을 겪습니다. 만약 잘못된 항목이 해당 카테고리의 매우 전형적인 예시라면(예: 가구로서의 책상), 우리는 속도가 느려집니다.
- 결과: 이 부분은 AI가 인간처럼 행동하는 데 주로 실패한 지점이었습니다. 연구진이 혼란을 주는 "방해 요소"를 추가했을 때, AI 모델들은 인간이 그러는 것처럼 느려지거나 혼란스러워하지 않았습니다. 그들은 그 혼란을 아주 쉽게 지나치는 것처럼 보였습니다. 이는 AI가 이야기 속에서 사물들이 '어디'에 있는지는 추적할 수 있지만, 우리가 올바른 기억을 선택하려고 할 때 뇌 속에서 일어나는 복잡하고 겹쳐진 경쟁 과정을 완전히 이해하지는 못한다는 것을 시사합니다.
결론: 부분적인 일치
그래서 최종 점수는 어떨까요? 논문은 이 AI 모델들이 선택적으로 인간과 유사하다고 제안합니다. 그들은 이야기의 구조(단어가 얼마나 떨어져 있는지 또는 제목이 무엇인지)가 기억에 어떤 영향을 미치는지 이해하는 데 뛰어납니다. 이야기를 더 길게 만들거나 캐릭터를 숨기면, AI는 지친 독자처럼 약간 더 "땀을 흘립니다."
하지만 그들은 인간 정신의 완벽한 복제본은 아닙니다. 유사한 단어들이 기억 속에서 주의를 끌기 위해 싸우는 복잡한 의미론적 저글링(semantic juggling)에 관해서라면, AI는 우리처럼 비틀거리지 않습니다. 그들은 두 개의 매우 유사한 기억 사이에서 선택해야 할 때 발생하는 특유의 "정신적 마찰"이 부족해 보입니다.
저자들은 이것이 "해결된" 문제가 아니라고 조심스럽게 말합니다. 이 연구는 상대적으로 적은 수의 이야기(16~19개)를 사용했으므로, 결과는 절대적인 증거라기보다는 강력한 힌트에 가깝습니다. 또한, 질문에 대한 AI의 전반적인 정확도는 때때로 상당히 낮았는데, 이는 그들이 틀린 이유로 정답을 맞히고 있을 수도 있음을 의미합니다. 그러나 핵심적인 교훈은 흥미롭습니다: 이 디지털 뇌들은 이야기의 거리와 초점에 관한 한, 인간의 뇌가 겪는 어려움의 패턴을 보여주기 시작했습니다. 그들은 단순한 단어 매칭 기계가 아닙니다. 그들은 우리와 마찬가지로 이야기 세계의 정신적 지도인 "상황 모델(situation model)"을 형성하는 첫 번째 징후를 보이고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.