← 최신 논문
💬 NLP

Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models

이 논문은 대규모 언어 모델의 사실성을 향상시키기 위해 내부 자기 주의 메커니즘을 활용하는 세 가지 어텐션 유도 레이어 선택 전략(Attention-JSD, Attention-Entropy-Max, Attention-Entropy-Min)을 제안하며, TruthfulQA 벤치마크에서 기존 DoLa 방식보다 일관된 성능 향상을 입증한다.

원저자: Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 인터넷에 있는 거의 모든 책을 읽은, 아주 똑똑한 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 시를 쓰고, 수학 문제를 풀고, 농담도 할 수 있습니다. 하지만 가끔 이 로봇은 너무 자신만만해져서 엉뚱한 말을 지어내기도 합니다. 달이 초록색 치즈로 만들어졌다고 말하거나, 유명한 역사적 인물이 스마트폰을 발명했다고 말할 수도 있죠. 인공지능의 세계에서 이것을 "환각(hallucination)"이라고 부릅니다. 이는 큰 문제인데, 왜냐하면 우리가 의료 질문에 답하거나 뉴스를 쓰는 것과 같은 현실 세계의 과업에 이 로봇들을 사용하고 싶다면, 그들이 단순히 창의적인 것이 아니라 진실되어야 하기 때문입니다.

이를 해결하기 위해, 과학자들은 로봇이 생각하는 동안 스스로의 작업을 검토하는 법을 가르치기 위해 노력해 왔습니다. 한 가지 인기 있는 방법은 "대조적 디코딩(Contrastive Decoding)"이라고 불립니다. 이것은 로봇이 내부적으로 토론을 하는 것과 같습니다. 로봇 안에는 팬케이크를 쌓아 올린 것처럼 여러 층의 "생각"이 있습니다. 어떤 층은 "미성숙"하며(빠르고 얕게 생각합니다), 어떤 층은 "성숙"합니다(깊고 신중하게 생각합니다). 작업물을 확인하는 기존 방식은 얕은 층이 말하는 것과 깊은 층이 말하는 것을 비교하는 것이었습니다. 만약 얕은 층이 틀린 답에 대해 너무 확신한다면, 로봇은 그 답변을 무시했습니다. 하지만 이 논문은 새로운 질문을 던집니다. 로봇이 진실을 말하고 있는지 알기 위해 로봇이 고려하고 있는 "단어"를 보는 것이 유일한 방법일까요? 아니면 로봇이 자신의 생각에 어떻게 "주의(attention)"를 기울이는지를 관찰함으로써 진실을 찾을 수 있을까요?

"대규모 언 언어 모델의 대조적 디코딩을 위한 어텐션 가이드 레이어 선택(Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models)"이라는 제목의 이 논문은, 로봇이 진실을 말하도록 돕는 영리한 새로운 방법을 제안합니다. 저자들(일본 고급과학기술대학원대학교 소속)은 단순히 로봇이 말하고자 하는 최종 단어를 비교하는 대신, 로봇의 "어텐션(attention)"을 살펴보아야 한다고 제안합니다. 어텐션을 로봇이 자신의 기억 속 서로 다른 부분들에 비추는 "스포트라이트"라고 상상해 보세요. 연구진은 이 스포트라이트가 움직이는 방식을 관찰함으로써, 사실 관계를 확인하기 위해 사용할 최적의 "생각 층(thinking layer)"을 선택할 수 있다는 것을 발견했습니다.

그들은 세 가지 새로운 전략을 테스트했습니다:

  1. Attention-JSD: 로봇의 "스포트라이트"가 최종적인 성숙한 생각과 가장 크게 달라지는 층을 찾습니다. 이는 마치 문제가 완전히 다른 각도에서 바라보고 있는 층을 찾는 것과 같습니다.
  2. Attention-Entropy-Max: 스포트라이트가 매우 넓게 퍼져서 한 번에 많은 것들을 보고 있는 층을 선택합니다.
  3. Attention-Entropy-Min: 스포트라이트가 매우 집중되어 있어서 단 몇 개의 구체적인 증거에만 타이트하게 줌인(zoom-in)하고 있는 층을 선택합니다.

연구진이 흔한 신화나 오해로 로봇을 속이도록 설계된 유명한 퀴즈인 TruthfulQA에서 이 아이디어들을 테스트했을 때, 결과는 흥미로웠습니다. 새로운 방법들, 특히 주의력이 얼마나 집중되어 있는지 혹은 퍼져 있는지를 살펴본 방법들이 기존 방식보다 더 좋은 성능을 보였습니다. 이들은 특히 단 하나의 정답이 아닌 '다중 정답'을 찾아내는 데 뛰어났습니다. 예를 들어, LLaMA-7B 모델에서 "Attention-Entropy-Min" 전략(매우 집중된 스포트라이트)은 다중 응답 테스트에서 62.8%의 점수를 기록하며, 이전 최고 점수인 56.5%를 앞질렀습니다.

저자들은 왜 이런 결과가 나왔는지 알아내기 위해 로봇의 뇌 내부를 들여다보았습니다. 그들은 로봇의 모든 어텐션이 동일하게 작용하는 것은 아니라는 사실을 발견했습니다. 특정 "어텐션 헤드(attention heads)"(로봇 내부의 작은 하위 프로세서)들이 진실성에 대한 더 강한 신호를 전달하는 것처럼 보입니다. 실제로, 특정 하나의 어텐션 헤드(Head 6)만을 사용하는 것이 모든 헤드를 함께 사용하는 것보다 때때로 로봇을 더 똑똑하게 만들 수 있다는 것을 발견했습니다. 이는 로봇의 내부 "스포트라이트" 패턴이 사실 확인을 위한 매우 민감한 신호이며, 어쩌면 다음에 나올 단어 목록을 보는 것보다 더 효과적일 수 있음을 시사합니다.

하지만 이 논문은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 연구진은 이러한 방법들이 다지선다형 문제에는 잘 작동하지만, 로봇이 처음부터 긴 이야기나 에세이를 생성해야 하는 자유 형식의 글쓰기에서는 어떻게 작동할지 여전히 확인이 필요하다고 제안합니다. 또한 그들은 서로 다른 크기의 로봇에 대해 어떤 레이어를 사용할지 결정하기 위해 추가적인 테스트가 여전히 필요하며, 왜 특정 어텐션 헤드들이 사실을 포착하는 데 그렇게 뛰어난지에 대해서도 아직 완전히 이해하지 못하고 있다고 지적합니다. 그러나 현재로서는, 이 연구는 만약 우리가 AI를 더 정직하게 만들고 싶다면, 단순히 그것이 말하는 내용에 귀를 기울이는 것이 아니라 그것이 어떻게 주의를 기울이는지를 관찰해야 한다는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →