← 최신 논문
🤖 AI

Give it Space! Explicit Disentangling of Positional and Semantic Representations in Encoders

본 논문은 의미 정보, 절대적 위치 정보, 상대적 위치 정보를 명시적으로 분리하여 별도의 스트림으로 처리하는 인코더 아키텍처를 제안하며, 이는 고립된 위치 부분 공간이 문서 구조를 포착하는 저차원 매니폴드를 자연스럽게 형성함을 밝히고, 이러한 접근 방식이 표준적인 결합된 위치 인코딩에 비해 언어적 표현을 현저히 향상시킨다는 것을 입증합니다.

원저자: Pierre-Antoine Lequeu, Camille Barboule, Benjamin Piwowarski

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pierre-Antoine Lequeu, Camille Barboule, Benjamin Piwowarski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 AI 텍스트 모델의 두뇌인 트랜스포머를 붐비는 고속 기차역으로 상상해 보세요. 이 역에서 기차에 실린 모든 단어 (토큰) 가 제 역할을 수행하려면 두 가지가 필요합니다:

  1. 무엇인지: 단어의 의미 (예: "개", "달리다", "파란색").
  2. 어디 있는지: 문장과 문서 내에서의 위치 (예: "첫 번째 단어", "2 단락의 중간").

문제: "지저분한 배낭"

대부분의 현재 AI 모델에서는 이 두 가지 정보가 모든 단어에 대해 동일한 "배낭"(동일한 숫자 집합) 에 쑤셔 넣습니다. 해당 논문은 이것이 지저분하다고 주장합니다.

모델이 다음 단어를 예측할 때 (이 작업을 "마스크 언어 모델링"이라고 함), 의미에 너무 집중하다 보니 실수로 위치 정보를 배낭에서 밀어내게 됩니다. 특히 네트워크의 최상위 층에서 그렇습니다. 마치 역사 시험을 공부하기 위해 지도로 가득 찬 무거운 배낭을 멘 학생이 결국 역사 노트를 위한 공간을 확보하기 위해 지도를 떨어뜨리는 것과 같습니다.

또한, 다른 단어를 볼 때만 위치를 계산하려는 최신 모델들 (상대적 위치 인코딩) 은 단락의 시작과 끝과 같은 문서의 "큰 그림" 구조를 종종 잊어버립니다.

해결책: "공간을 주자!"

저자들은 DSTG-NeoBERT라는 새로운 유형의 모델을 개발했습니다. 하나의 지저분한 배낭 대신, 모델에 세 개의 분리된 정보 흐름을 제공했습니다:

  1. 의미 흐름 (파란색): 단어의 의미를 전달합니다.
  2. 절대적 위치 흐름 (빨간색): "전체 문서 내에서 내가 어디에 있는지"에 대한 정보를 전달합니다.
  3. 상대적 위치 흐름 (초록색): "이웃에 비해 내가 어디에 있는지"에 대한 정보를 전달합니다.

중요하게도, 그들은 모델에게 이렇게 지시했습니다: "다음 단어를 추측할 때 (시험), 파란색 (의미) 흐름만 보십시오. 빨간색 (위치) 흐름은 건드리지 마십시오." 이렇게 하면 모델이 정답을 위한 공간을 확보하기 위해 실수로 위치 정보를 삭제하는 것을 방지할 수 있습니다.

그들이 발견한 것들 ("아하!" 순간들)

1. 위치 지도가 단순한 선으로 붕괴됨
그들이 "빨간색" 흐름 (절대적 위치) 을 살펴봤을 때, 복잡하고 48 차원인 지저분한 무언가를 기대했습니다. 대신 그것은 자발적으로 단순한 2 차원 지도로 조직화되었습니다.

  • 유사성: 혼란스러운 군중을 상상해 보세요. 갑자기 그들이 모두 완벽한 저주파 파동으로 줄을 섭니다. 모델은 문서 내 자신의 위치를 알기 위해 복잡한 3 차원 지도가 필요하지 않다는 것을 깨달았습니다. 단순하고 매끄러운 파동만으로도 텍스트의 전체 구조를 포착할 수 있었습니다.

2. 기차역 직원의 전문화
구형 모델에서는 모든 "어텐션 헤드"(역의 근로자) 가 모든 일을 하려고 했습니다. 새로운 모델에서는 근로자들이 두 개의 명확한 팀으로 나뉩니다:

  • 구조 팀: 이 근로자들은 오직 "빨간색" 흐름만 봅니다. 그들은 문장과 단락이 시작되고 끝나는 위치를 알고 있습니다.
  • 의미 팀: 이 근로자들은 오직 "파란색" 흐름만 봅니다. 그들은 단어를 이해합니다.
  • 결과: 그들은 서로의 발을 밟지 않게 되었습니다. "상대적 위치" 정보 (초록색) 는 의미 팀에게만 유용한 도구가 되어, 그들이 근처의 올바른 단어에 집중하도록 돕습니다.

3. "큰 그림"이 구원받음
표준 모델에서는 단어를 예측하려는 압력이 이를 덮어쓰기 때문에, 모델이 최상위 층에 도달할 때쯤에는 (긴 이야기의 두 번째 단락에 있다는 것 같은) "큰 그림" 구조가 사라집니다.

  • 해결책: 새로운 모델은 단어 추측에 사용되지 않는 분리되고 보호된 흐름에 위치 정보를 유지하기 때문에, "큰 그림" 구조는 끝까지 온전하게 남습니다.

결과

그들이 이 새로운 모델을 표준 모델과 비교하여 테스트했을 때:

  • 표준 테스트: 일반적인 언어 작업 (질문 답변이나 문장 이해 등) 에서 기존 최상위 모델만큼 잘 수행했습니다.
  • 깊은 이해: 모델이 특정 언어적 세부 사항 (문법, 논리, 담화 등) 을 얼마나 잘 이해하는지 테스트했을 때, 새로운 모델은 65 개 카테고리 중 49 개에서 승리했습니다.
  • 이유: 모델이 텍스트의 의미를 이해하기 위해 텍스트 내 위치에 대한 이해를 희생할 필요가 없었기 때문입니다.

요약

이 논문은 "위치"와 "의미"에 고속도로의 전용 차로를 제공함으로써 AI 가 추락하지 않는다는 것을 보여줍니다. 위치 정보는 단순하고 효율적인 지도로 조직화되며, 모델은 단어의 의미를 이해하는 능력을 잃지 않으면서 긴 문서의 구조를 더 잘 이해하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →