← 최신 논문
💬 NLP

Clozing the Gap: Exploring Why Language Model Surprisal Outperforms Cloze Surprisal

본 논문은 언어 모델의 서프라이설이 더 높은 해상도, 의미적으로 유사한 단어를 구분하는 능력, 그리고 저빈도 단어를 정확하게 처리하는 능력으로 인해 처리 노력을 예측하는 데 클로즈 서프라이설보다 우월하다고 주장하면서, 동시에 개선된 클로즈 방법론과 인간의 예측 민감성에 대한 추가 연구를 요구한다.

원저자: Sathvik Nair, Byung-Doh Oh

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sathvik Nair, Byung-Doh Oh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문장의 다음 단어를 추측해 보라고 상상해 보세요. 때로는 답이 명백하지만, 때로는 완전히 놀라운 경우도 있습니다. 심리학자들은 오랫동안 단어의 예측 가능성을 측정하기 위해 "Cloze Task(클로즈 과제)"라는 게임을 사용해 왔습니다. 이 게임에서는 마지막 단어가 빠진 문장 (예: "고양이는... 위에 앉았다") 을 사람에게 보여주고 빈칸을 채우도록 요청합니다. 대부분의 사람들이 "매트(mat)"라고 답한다면, 그 단어는 매우 예측 가능한 것입니다. 반면 다양한 답변이 나온다면 예측 불가능한 것입니다.

수십 년 동안 이 인간 중심의 게임은 우리 뇌가 언어를 처리하는 방식을 이해하는 데 있어 금표준으로 여겨졌습니다. 하지만 최근 새로운 도전자가 링에 등장했습니다: 바로 이 설명 뒤에 있는 AI 와 같은 **언어 모델 (Language Models, LMs)**입니다. 이러한 컴퓨터는 수십 억 개의 문장으로 훈련되었으며, 다음에 어떤 단어가 올지에 대한 정확한 수학적 확률을 계산할 수 있습니다.

주요 발견:
이 논문은 인간이 단어를 읽는 속도를 예측할 때, **컴퓨터의 수학 (LM 확률)**이 **인간 게임 (Cloze Task)**보다 훨씬 더 나은 예측치를 제공한다는 사실을 발견했습니다. 컴퓨터의 예측은 우리 눈이 단어 위에 머무는 시간과 완벽하게 일치하는 반면, 인간 게임은 다소 투박하고 정확도를 놓치는 경향이 있습니다.

하지만 저자들은 중요한 질문을 던집니다: 컴퓨터가 이기는 것은 더 똑똑해서인가, 아니면 단순히 다른 게임을 하고 있기 때문인가?

이를 규명하기 위해 연구자들은 컴퓨터가 인간의 규칙에 따라 플레이하도록 만든 세 가지 "실험"을 수행했습니다. 컴퓨터가 이기는 세 가지 가능한 이유를 검증한 것입니다:

1. "픽셀 해상도" 테스트 (가설 1)

비유: 인간 게임을 낮은 해상도의 픽셀화된 사진이라고 상상해 보세요. 얼굴의 전체적인 윤곽은 보이지만 주근깨는 보이지 않습니다. 반면 컴퓨터는 모든 미세한 세부 사항이 보이는 4K 울트라 HD 사진과 같습니다.
실험: 연구자들은 컴퓨터가 인간 게임과 마찬가지로 보통 40~90 명에게만 질문하는 것처럼 제한된 수의 표본만 보도록 강요했습니다. 그들은 컴퓨터의 고해상도 수학을 "픽셀화"하여 낮은 해상도의 인간 데이터와 일치시켰습니다.
결과: 컴퓨터의 시야가 인간 게임에 맞춰 흐려졌을 때, 더 나은 예측자가 되는 것을 멈췄습니다. 이는 컴퓨터가 인간 게임이 놓치는 미세한 뉘앙스를 구별할 수 있는 훨씬 더 높은 "해상도"를 가지고 있기 때문에 부분적으로 승리한다는 것을 시사합니다. 즉, 물을 수 있는 사람이 충분하지 않기 때문입니다.

2. "쌍둥이 형제" 테스트 (가설 2)

비유: 문장이 "그는...에 앉았다"이고 가능한 답이 "couch(소파)"와 "sofa(소파)"라고 상상해 보세요. 인간에게 이 두 단어는 쌍둥이와 같습니다. 같은 뜻이기 때문입니다. 만약 인간이 "couch"라고 추측한다면, 아마도 "sofa"도 생각했을 것입니다. 하지만 컴퓨터는 이들을 완전히 다른 낯선 사람처럼 취급하여 서로 다른 점수를 매깁니다.
실험: 연구자들은 컴퓨터에게 유사한 단어들을 그룹화하도록 지시했습니다. "couch"와 "sofa"가 같은 그룹에 속한다면, 컴퓨터는 이들에게 동일한 점수를 부여해야 했습니다.
결과: 컴퓨터가 유사한 단어들을 단일 팀으로 취급하도록 강요받았을 때, 예측 능력이 떨어졌습니다. 이는 컴퓨터의 우위가 인간에게는 동일하게 보일 수 있는 단어들 사이에서 극도로 세밀한 구분을 내릴 수 있는 능력에서 비롯된다는 것을 의미합니다.

3. "희귀 단어" 테스트 (가설 3)

비유: 다음 단어가 "flabbergasted(경악한)"인 문장을 상상해 보세요. 인간 게임에서는 아무도 그 희귀한 단어를 추측하지 못할 수 있습니다. 왜냐하면 그들이 그 단어를 자주 들어본 적이 없기 때문입니다. 하지만 인터넷 전체를 읽어본 컴퓨터는 그 희귀한 단어가 나올 확률을 정확히 알고 있습니다.
실험: 연구자들은 컴퓨터가 모든 희귀 단어를 무시하고 인간 참가자가 본 적 없는 단어를 추측하지 않는 것처럼, 흔한 단어만 추측하도록 지시했습니다.
결과: 컴퓨터가 희귀 단어를 무시하도록 강요받았을 때, 읽기 시간을 예측하는 능력이 떨어졌습니다. 이는 컴퓨터가 인간이 게임에서 단순히 생성하지 않는 희귀 단어들의 "긴 꼬리(long tail)"를 처리하는 데 더 뛰어남을 보여줍니다.

결론: 더 나은 도구에 대한 요구

이 논문은 컴퓨터가 반드시 인간처럼 "생각"하는 것은 아니라고 결론지었습니다. 다만 더 높은 해상도를 가지고 있고, 미묘한 차이를 포착할 수 있으며, 희귀 단어를 잘 처리하기 때문에 더 나은 측정 도구일 뿐입니다.

그러나 저자들은 인간 게임을 버리지 말라고 경고합니다. 그들은 인간 게임이 "저해상도"인 이유는 모든 문장에 대해 수천 개의 답변을 얻는 데 비용이 너무 많이 들고 시간이 너무 오래 걸리기 때문이라고 주장합니다.

핵심 교훈:
우리는 인간 실험을 업그레이드해야 합니다. 단순히 사람들에게 다음 단어를 한 번 추측하게 하는 대신, 컴퓨터의 수학만큼 민감하고 상세한 인간 예측을 측정할 새로운 방법들이 필요합니다. 그렇게 하기 전까지는, 컴퓨터가 인간이 어떻게 생각하는지를 예측하는 것인지, 아니면 단순히 잘못된 이유로 우리의 읽기 속도와 우연히 일치하는 매우 훌륭한 계산기인지 100% 확신할 수 없습니다.

간단히 말해: 현재 컴퓨터는 읽기 속도를 측정하는 더 나은 자입니다. 하지만 그것은 인간이 실제로 인식하지 못하는 것들을 측정하고 있을지도 모릅니다. 우리는 인간이 실제로 컴퓨터와 같은 방식으로 세상을 보는지 확인하기 위해 인간을 위한 더 나은 자를 만들어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →