← 최신 논문
💬 NLP

The JEPA Paradox in Language: The Geometry of Linguistic Alternatives

이 논문은 결정론적 결합 임베딩 예측 아키텍처(JEPA)가 텍스트의 내재적 다중 양상성이 제곱 오차 잠재 예측에 필요한 조건부 집중을 위반함으로써, 목적 함수를 여러 가능한 완성을 보존하도록 재설계하지 않는 한 표현 붕괴와 낮은 다운스트림 성능을 초래하기 때문에 언어에 대해 실패한다고 주장한다.

원저자: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보십시오. 이를 위해 과학자들은 종종 '자기 지도 학습(self-supervised learning)'이라는 기술을 사용하는데, 이는 컴퓨터가 이미 본 퍼즐의 빠진 조각을 추측하며 배우는 방식입니다. 사진과 영상의 세계에서 이 방식은 마법처럼 작동합니다. 만약 고양이 사진의 작은 부분을 가린다면, 컴퓨터는 털, 귀, 그리고 배경이 모두 매끄럽고 예측 가능한 패턴으로 연결되어 있기 때문에 그 아래에 무엇이 있을지 쉽게 추측할 수 있습니다. 고양이의 머리가 어떻게 생겼는지 안다면, 그 옆의 귀가 어떻게 생겨야 하는지도 정확히 알 수 있는 것입니다. JEPA(Joint-Embedding Predictive Architecture)라고 알려진 이 방법은 빠진 조각의 정답이 대개 하나뿐인 이미지, 영상, 오디오 분야에서 스타가 되었습니다.

하지만 과학자들이 이와 똑같은 '빠진 조각 맞추기' 기술을 언어에 적용하려 했을 때, 상황은 이상하게 흘러갔습니다. 언어는 사진과 같지 않습니다. 언어는 마치 '당신의 선택에 따라 결말이 달라지는 모험 책'과 같습니다. 만약 "고양이가 매트 위에서 ___ 했다"라는 문장에서 단어를 가려 놓는다면, 빠진 단어는 "앉았다", "누웠다", "잤다", 혹은 심지어 "놀았다"가 될 수도 있습니다. 이 모든 단어는 말이 되지만, 서로 매우 다릅니다. 이 논문이 다루는 핵심 질문은 바로 이것입니다. 왜 '빠진 조각 맞추기' 방식이 사진에는 매우 잘 작동하지만 텍스트에서는 처참하게 실패하는가? 저자들은 이 실패 뒤에 숨겨진 기하학적 이유를 찾고자 했으며, 본질적으로 게임의 규칙이 픽셀에서 단어로 바뀔 때 변하는지를 물었습니다.

"언어에서의 JEPA 역설(The JEPA Paradox in Language)"이라는 제목의 이 논문은, 문제가 컴퓨터가 충분히 똑똑하지 않아서가 아니라 게임 자체가 컴퓨터에게 불리하게 설계되었기 때문이라고 주장합니다. 저자들은 이미지 예측기를 텍스트 버전으로 만든 것(이를 T-JEPA라고 부릅니다)을 구축하고, 그것이 실시간으로 고군분투하는 모습을 관찰했습니다. 그들은 컴퓨터에게 단 하나의 '평균적인' 답을 추측하여 빠진 단어를 예측하도록 요청할 때, 컴퓨터가 혼란에 빠진다는 것을 발견했습니다. 문장을 끝내는 유효한 방법이 너무나 많기 때문에, 컴퓨터는 중간 지점을 찾으려고 시도합니다. 결국 컴퓨터는 "앉았다", "누웠다", "잤다"를 지저히 섞어놓은, 실제로는 존재하지도 않고 아무런 의미도 없는 '유령 단어'를 예측하게 됩니다.

연구진은 특정한 실패 과정을 발견했습니다. 먼저, 컴퓨터는 너무 많은 선택지가 있기 때문에 높은 확신을 가지고 단어를 예측할 수 없다는 것을 깨닫습니다. 그다음, 이러한 불확실성을 다루는 법을 배우는 대신, 컴퓨터는 모든 서로 다른 의미들을 하나의 지루한 점으로 뭉쳐버리는 방식으로 속임수를 쓰려고 합니다. 이를 '중심점 퇴화(centroid degeneracy)'라고 합니다. 무지개를 설명하려고 할 때 그 중간의 회색 점 하나를 가리키는 것과 같습니다. 그러면 모든 색채와 의미를 잃게 됩니다. 논문은 이러한 붕괴가 컴퓨터가 자신이 실패하고 있다는 것을 인지하기도 전에 일어난다는 것을 보여줍니다. 컴퓨터의 내부 지도는 언어의 차이를 구분할 수 없을 정도로 축소되며, 이는 독해력이나 검색과 같은 작업에서 최악의 성능으로 이어집니다.

이 연구는 컴퓨터에게 더 많은 훈련 시간이나 더 큰 두뇌가 필요하다는 아이디어를 명시적으로 배제합니다. 실패의 원인은 사진에 쓰이는 수학(제곱 오차 예측)은 단 하나의 날카로운 답을 요구하는 반면, 언어는 자연스럽게 수많은 가능한 답의 '구름'을 제공하기 때문입니다. 저자들은 컴퓨터가 이런 방식으로 언어를 배우려면, 그 모든 가능성을 하나의 점으로 짓눌러 버리는 것을 멈추고 대신 유효한 선택지들의 '구름'을 존중하는 법을 배워야 한다고 제안합니다. 이 논문이 AI에게 언어를 가르치는 문제를 해결했다고 주장하는 것은 아니지만, 현재의 '사진 스타일' 접근 방식이 왜 텍스트에서 벽에 부딪히는지에 대한 명확한 지도를 제공하며, 인간 언어의 아름답고 혼란스러운 모호함을 다룰 수 있는 새로운 방법론을 향한 길을 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →