← 최신 논문
🤖 machine learning

Laplacian Heads Improve Transformers by Smoothing Token Representations

본 논문은 그래프 확산을 통한 제어된 평활화를 도입하기 위해 트랜스포머의 표준 어텐션 헤드의 일부 라플라시안 헤드로 대체하는 것을 제안하며, 이는 토큰 표현 기하학을 강화하고 과평활화가 본질적으로 해롭다는 관념에 도전함으로써 감독 학습, 언어 모델링, 자기지도 학습 태스크 전반에 걸쳐 성능을 향상시킨다는 것을 입증한다.

원저자: Yuchong Zhang, Vardan Papyan

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuchong Zhang, Vardan Papyan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거의 모든 현대 챗봇과 이미지 인식기의 기반이 되는 AI 모델인 트랜스포머를 하나의 이야기를나 이미지를 이해하기 위해 함께 일하는 12 명의 탐정 팀으로 상상해 보세요. 각 탐정 (주목 헤드라고 함) 은 전체 장면을 바라보며 다른 모든 탐정에게 요약 내용을 속삭여 그들의 이해를 업데이트하도록 돕습니다.

표준 트랜스포머에서는 12 명의 탐정 모두가 요약 내용을 속삭일 뿐입니다. 그들은 장면의 "평균" 의미에 동의하려고 노력합니다. 때로는 이것이 매우 잘 작동합니다. 하지만 때로는 팀이 너무 동의하는 데만 급급해지거나, 개별 세부 사항 사이의 미묘한 차이를 놓치기도 합니다.

이 논문의 저자 장유충 (Yuchong Zhang) 과 바르단 파파얀 (Vardan Papyan) 은 간단한 조정을 제안했습니다: 만약 일부 탐정들이 동의하려 노력하는 것을 멈추고 대신 차이점에 집중한다면 어떨까요?

아래는 그들의 아이디어, 작동 방식, 그리고 발견한 바를 간단한 비유를 통해 정리한 내용입니다.

핵심 아이디어: "부드러움 (Smoothing)" 대 "확산 (Diffusion)"

표준 설정에서는 모든 탐정이 "다른 사람들이 무엇을 생각하는지"라고 말하며 그룹을 업데이트합니다. 이는 합의점을 찾으려 노력하는 친구들의 모임과 같습니다.

저자들은 이러한 탐정 중 일부를 "라플라시안 헤드 (Laplacian Heads)" 로 대체했습니다. 평균 의견을 공유하는 것 대신, 라플라시안 헤드는 다른 일을 수행합니다: 특정 토큰 (단어 또는 픽셀) 이 무엇인지와 그룹 평균이 무엇인지 사이의 차이를 계산합니다.

비유: 열 확산
토큰 (데이터 조각) 을 지도 위의 도시들처럼 그래프의 노드로 상상해 보세요.

  • 표준 어텐션: 지역 평균 온도와 자신의 온도를 맞추려 노력하는 도시 위원회 회의와 같습니다.
  • 라플라시안 헤드: 열 확산 과정과 같습니다. 만약 한 도시가 이웃 도시들에 비해 너무 뜨겁다면, 라플라시안 헤드는 그 열을 퍼뜨려 "냉각"시킴으로써 도움을 줍니다. 이는 거친 가장자리를 매끄럽게 만듭니다.

저자들은 모두가 "부드러움 (모든 것을 너무 비슷하게 만드는 것)"이 AI 에게 나쁘다고 생각했지만, 제어된 부드러움은 실제로 초능력이라고 주장합니다.

시도했을 때 어떤 일이 일어났을까요?

저자들은 이 새로운 "라플라시안 헤드" 설정을 세 가지 다른 유형의 AI 작업에서 테스트했습니다. 모든 경우에서 이러한 헤드를 추가하면 AI 가 더 똑똑해졌습니다.

1. 이미지 분류 (사진 인식)

  • 문제: AI 가 고양이의 사진을 볼 때, 그 고양이를 나타내는 많은 토큰 (픽셀) 을 갖게 됩니다. 때로는 AI 가 어떤 픽셀이 고양이이고 어떤 픽셀이 배경인지 혼동합니다.
  • 해결: 라플라시안 헤드는 접착제처럼 작용했습니다. 같은 객체에 속하는 토큰들을 부드럽게 만들어 서로 단단히 붙어 있게 했습니다.
  • 결과: AI 는 "고양이"와 "배경"을 구분하는 능력이 훨씬 향상되었습니다. 고양이 관련 토큰들은 단단하고 깔끔한 군집을 형성한 반면, 배경 토큰들은 멀리 떨어져 있었습니다. 마치 AI 가 마침내 흩어진 픽셀 뭉치가 아니라 "고양이 전체"를 보게 된 것과 같습니다.

2. 언어 모델링 (다음 단어 예측)

  • 문제: "The cat sat on the..."와 같은 문장에서 AI 는 "mat"을 예측해야 합니다. 하지만 다른 문장들은 "hat"이나 "bat"로 끝날 수도 있습니다. AI 는 "mat"으로 이어지는 단어들을 다른 문장에 등장하더라도 그룹화하여 유지해야 합니다.
  • 해결: 라플라시안 헤드는 같은 미래(다음 단어) 를 공유하는 단어들의 표현을 부드럽게 만들었습니다.
  • 결과: AI 는 수학 문제와 논리 퍼즐 (GSM8K 및 ARC 벤치마크 등) 에서 더 좋은 성과를 거두었습니다. 의미상 "함께 속하는" 단어들을 그룹화하는 법을 배워 예측 정확도를 높였습니다. 마치 책 제목이 아니라 책 속의 이야기에 따라 도서관을 정리하는 것과 같습니다.

3. 자기지도 학습 (레이블 없이 학습)

  • 문제: 이 모드에서 AI 는 무엇이 무엇인지 알려지지 않은 이미지를 보며 학습하려 합니다. 한 객체가 어디서 끝나고 다른 객체가 시작되는지 (분할) 파악해야 합니다.
  • 해결: 라플라시안 헤드는 AI 가 객체의 "형태"를 더 명확하게 보도록 도왔습니다.
  • 결과: AI 가 헬멧이나 등번호와 같은 객체 주위에 경계를 그릴 때, 선들이 훨씬 더 날카롭고 정확하게 되었습니다. "부드러움"은 노이즈를 무시하고 객체의 진정한 구조에 집중하도록 도와주었습니다.

왜 이것이 놀라운가요?

오랫동안 연구자들은 "과도한 부드러움 (oversmoothing)"이 적이라고 믿었습니다. 데이터를 너무 많이 부드럽게 만들면 모든 것이 똑같이 보일 것이며, AI 는 사물을 구별하는 능력을 잃을 것이라고 생각했습니다 (예: 고양이를 개와 혼동함).

이 논문은 그 시나리오를 뒤집습니다.
저자들은 부드러움이 본질적으로 나쁜 것이 아님을 보여줍니다. 이는 소음 제거 헤드폰과 같습니다. 너무 높게 설정하면 아무것도 들리지 않지만, 적절히 조절하면 배경 소음 (분산) 을 제거하고 음악 (진짜 신호) 을 훨씬 더 명확하게 들을 수 있게 해줍니다.

라플라시안 헤드를 사용하여 AI 는 다음과 같은 것을 학습합니다:

  1. 단일 시퀀스 내의 노이즈를 축소합니다 (문장이나 이미지의 부분을 일관되게 만듦).
  2. 서로 다른 클래스를 분리합니다 (고양이가 개처럼 보이지 않도록 함).

결론

이 논문은 트랜스포머 아키텍처에 간단하고 무료인 업그레이드를 제시합니다: "동의" 헤드를 일부 "차이" 헤드로 교체하세요.

  • 없을 때: AI 는 모든 것을 평균내려 시도하다가 때때로 혼란에 빠집니다.
  • 있을 때: AI 는 그룹 내의 노이즈를 부드럽게 만들면서도 그룹들은 구별되도록 학습합니다.

그 결과는 무엇일까요? 단순히 이해 방식을 올바르게 "부드럽게" 만드는 법을 배웠기 때문에 이전보다 이미지를 인식하고, 코드를 작성하며, 논리 퍼즐을 더 잘 해결할 수 있는 더 똑똑하고 정확한 AI 입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →