← 최신 논문
💬 NLP

Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers

이 논문은 추론 비용을 증가시키지 않으면서도 구문 이해력과 일반적인 언어 성능을 크게 향상시키기 위해 다양한 트랜스포머 위치 임베딩 계열에 의존 구문 분석 정보를 주입하는 경량화된 방법인 구문 정보 기반 위치 임베딩(SiPE)을 소개한다.

원저자: Haris Riaz, Hyungji Kim, Mihai Surdeanu

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haris Riaz, Hyungji Kim, Mihai Surdeanu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어의 GPS: 순서만으로는 부족한 이유

당신이 로봇에게 인간의 언어를 이해하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 방대한 양의 책을 주고, 단순히 읽는 것만으로 문법 규칙을 배우라고 말합니다. 이것이 현대의 "대규모 언기 모델(LLM)"이 작동하는 방식입니다. 이들은 인터넷에 있는 거의 모든 것을 읽은 매우 똑똑한 학생과 같지만, 특정한 사각지대를 가지고 있습니다. 문장 속 다음 단어를 예측하는 데는 뛰어나지만, 왜 단어들이 서로 함께 있어야 하는지 그 '이유'를 이해하는 데는 때때로 어려움을 겪습니다.

이 로봇들이 문장 속 어디에 위치해 있는지 알 수 있도록 돕기 위해, 과학자들은 "위치 임베딩(positional embeddings)"을 제공합니다. 이것을 모든 단어에 대한 GPS 좌표라고 생각하면 됩니다. 이는 모델에게 "당신은 5번째 단어입니다" 또는 "당신은 시작점에서 3단어 떨어져 있습니다"라고 알려줍니다. 오랫동안 이것으로 충분했습니다. 하지만 문제는 인간의 언어가 단순히 일직선상의 단어 배열이 아니라, 복잡한 관계의 그물망이라는 점입니다. "The keys to the cabinet are on the table(캐비닛의 열쇠가 탁자 위에 있다)"라는 문장에서, "keys"는 주어이고 "are"는 동사입니다. "keys"와 "are" 사이에는 세 개의 다른 단어("to the cabinet")가 끼어 있지만, 이들은 문법적으로 연결되어 있습니다. 단순히 거리만을 계산하는 단순한 GPS는 이러한 연결을 놓칠 수 있으며, 단어들을 춤을 추는 파트너가 아니라 그저 줄 서 있는 이웃처럼 취급할 수 있습니다. 이 논문은 질문을 던집니다. 우리가 언어 로봇에게 더 나은 지도, 즉 단어가 어디에 있는지가 아니라 어떻게 연결되어 있는지를 보여주는 지도를 줄 수 있을까?

논문의 핵심 아이디어: 로봇에게 구문론적 나침반을 부여하기

이 논문의 저자인 Haris Riaz, Hyungji Kim, Mihai Surdeanu는 **구문 정보 기반 위치 임베딩(Syntax-informed Positional Embeddings, SiPE)**이라는 영리한 업그레이드를 제안합니다. 로봇에게 단순히 "당신은 위치 5에 있습니다"라고 말하는 대신, SiPE는 비밀스러운 힌트를 속삭입니다. "당신은 위치 5에 있으며, 또한 당신 다음에 오는 단어의 '소유자'입니다."

이를 위해 그들은 "의존 구문 분석기(dependency parser)"라는 도구를 사용하는데, 이는 단어들이 어떻게 서로 얽혀 있는지 지도를 그리는 빠른 스캔 방식의 문법 검사기와 같습니다. 그들은 이 지도를 간단한 코드("Hexatags")로 변환하여 로봇의 위치 GPS에 직접 주입합니다. SiPE의 마법은 로봇의 뇌 전체를 재구축하도록 강요하지 않는다는 점에 있습니다. 기존 시스템에 아주 가볍고 작은 "구문론적 직관"의 층을 추가할 뿐입니다.

연구진은 이 힌트를 어디에 배치하느냐가 힌트의 내용보다 더 중요하다는 것을 발견했습니다. 그들은 이 정보를 주입하는 두 가지 주요 방법을 테스트했습니다:

  1. 입력 방식(The Input Method): 단어의 시작 블록에 구문 힌트를 섞는 것 (마치 빵을 굽기 전 밀가루에 향신료를 넣는 것과 같습니다).
  2. 위치 방식(The Positional Method): 단어는 그대로 두고 GPS 좌표에만 힌트를 섞는 것 (마치 자동차가 아닌 지도에 특별한 나침반을 추가하는 것과 같습니다).

연구 결과:

  • "디코더(Decoder)" 모델 (챗봇처럼 한 번에 한 단어씩 이야기를 써 내려가는 종류)의 경우, 위치 방식이 승자였습니다. 구문 힌트를 거리 계산과 곱함으로써, 모델은 멀리 떨어져 있더라도 문법적으로 연결된 단어들에 더 집중하는 법을 배웠습니다. 이는 전문적인 테스트인 SyntaxGym에서 복잡한 문법 이해도를 10.3% 높였으며, 동시에 다음 단어를 예측하는 능력(퍼플렉시티/perplexitiy 감소)을 9.0% 개선했습니다.
  • "인코더(Encoder)" 모델 (검색 엔진처럼 문장 전체를 한꺼번에 읽고 이해하는 종류)의 경우, 입력 방식이 가장 효과적이었습니다. 단어의 시작 블록에 구문 힌트를 단순히 더하는 것만으로도 이해도를 높이기에 충분했습니다.

이 논문은 이 접근 방식이 주요 트레이드오프(trade-off)를 해결하기 때문에 게임 체인저가 될 수 있다고 제안합니다. 이전의 방법들은 구문을 완전히 무시하거나(빠르지만 멍청함), 말을 할 때마다 전체 문법 트리를 매번 다시 계산하려고 시도했습니다(매우 똑똑하지만 지나치게 느림). SiPE는 그 중간의 최적점을 찾았습니다. 모델을 안내하기 위해 단 하나의 빠른 문법 지도를 사용하여, 두 세계의 장점을 모두 제공합니다.

결과: 더 커지는 것이 아니라, 더 똑똑해지는 것

연구진은 RoBERTa, DeBERTa, ModernBERT를 포함한 여러 유형의 AI 모델을 대상으로 아이디어를 테스트했습니다. 결과는 놀라울 정도로 일관적이었습니다. SiPE로 학습된 모델들은 단순히 문법 테스트에서만 좋아진 것이 아니라, 실제 작업에서도 성능이 향 향상되었습니다. 일반적인 언어 이해 테스트인 GLUE 벤치마크에서 모델들은 최대 **8.2%**까지 개선되었습니다.

아마도 가장 흥激로운 발견은 이러한 개선이 속도나 효율성을 희생하며 얻어진 것이 아니라는 점입니다. 모델이 얻은 추가적인 "구문 뇌"는 믿을 수 없을 정도로 가벼웠으며, 모델이 이미 보유한 수백만 개의 파라미터 중 극히 일부인 약 5,000에서 7,000개의 파라미터만을 추가했습니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법 지팡이는 아니라고 주의를 기울였습니다. 그들은 "디코더" 모델의 경우, 네트워크의 첫 번째 레이어에서부터 바로 시스템에 들어오는 초기 단계에서 구문 힌트가 가장 잘 작동한다는 것을 발견했습니다. 모델이 이미 문장을 처리하기 시작한 후에 힌트를 추가하면 그 효과가 사라집니다. 또한, 단순히 더 복잡한 문법 세부 사항(예: 특정 관계 이름)을 추가하는 것은 큰 도움이 되지 않았으며, 단순한 "방향" 힌트만으로도 충분하다는 것을 발견했습니다.

이것이 중요한 이유

이 논문은 AI가 인간의 언어를 더 잘 이해하게 만들기 위해 아키텍처를 완전히 개조할 필요는 없다는 점을 시사합니다. 우리는 그저 조금 더 나은 지도를 주면 됩니다. 모델에게 단어들을 연결하는 보이지 않는 실을 보는 법을 가르침으로써, 우리는 모델을 더 정확하고, 논리적이며, 길고 복잡한 문장에도 혼란에 빠지지 않게 만들 수 있습니다. 이는 때때로 기계를 더 똑똑하게 만드는 최선의 방법이 더 많은 데이터를 주는 것이 아니라, 이미 가지고 있는 데이터를 바라보는 법을 가르치는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →