← 최신 논문
🤖 machine learning

Learning What Matters: Supervising Sparse Attention Routing with Causal Evidence Sets

이 논문은 마스킹 실험에서 유도된 인과적 증거 세트(causal evidence sets)를 바탕으로 희소 어텐션 선택기(sparse attention selectors)를 학습시키는 것이 밀집 모델(dense teachers)의 어텐션 패턴에 의존하는 것보다 훨씬 더 효과적인데, 이는 어텐션이 모델이 정답을 도출하기 위해 실제로 의존하는 문맥을 종종 잘못 식별하기 때문이다.

원저자: Jim Allchin

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Jim Allchin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 직소 퍼즐을 맞추려 한다고 상상해 보세요. 하지만 테이블 위에는 수백만 개의 조각이 깔려 있고, 당신은 아주 적은 양의 조각만 살펴볼 시간이 있습니다. 이것이 현대 AI 모델, 특히 '트랜스포머(transformer)'라고 불리는 유형가 매우 긴 문서를 읽으려고 할 때 겪는 일상의 사투입니다. 이야기나 보고서를 이해하기 위해, 이 모델들은 **어텐션(attention)**이라는 메커니즘을 사용합니다. 어텐션을 스포트라이트라고 생각해보세요. 모델이 새로운 단어를 읽을 때마다, 현재의 문장을 이해하는 데 어떤 단어가 중요한지 결정하기 위해 이전의 모든 단어에 빛을 비춥니다. 빛이 밝을수록 모델은 그 단어를 더 "중요하게" 여깁니다.

하지만 긴 책의 모든 페이지에 빛을 비추는 것은 엄청나게 비용이 많이 들고 느린 작업입니다. 마치 모든 페이지를 동시에 비추는 손전등을 들고 소설을 읽는 것과 같습니다. 이를 해결하기 위해 엔지니어들은 스포트라이트를 "희소하게(sparse)" 만들고자 합니다. 즉, 실제로 중요한 몇 개의 페이지에만 빛을 비추도록 하는 것입니다. 여기서 큰 질문은 다음과 같습니다. 모델은 어느 페이지에 빛을 비춰야 할지 어떻게 알까요? 표준적인 답변은 모델 자신의 스포트라이트를 믿는 것이었습니다. 모델이 어떤 단어를 보고 있다면, 그것이 중요하기 때문이라는 논리입니다. 하지만 만약 모델이 엉뚱한 것을 보고 있다면 어떨까요? 만약 스포트라이트가 붉은 청어(red herring, 미끼)를 비추고 있고, 진짜 단서는 어둠 속에 놓여 있다면 어떨까요? 이 논문은 컴퓨터 과학의 이 구석진 영역으로 들어가, 모델의 "시선"이 정말로 정답을 얻기 위해 필요한 것과 일치하는지를 테스트합니다.


거대한 불일치: 모델이 보는 곳 vs. 모델이 필요로 하는 것

이 연구에서 연구자 짐 얼친(Jim Allchin)은 AI에 대한 흔한 가정, 즉 모델이 어떤 정보에 주의를 기울이면 그 정보가 정답의 핵심이라는 가정을 테스트하기 위해 일련의 영리한 퍼즐을 설계했습니다. 이를 테스트하기 위해 그는 합성 태스크(synthetic tasks)—즉, 규칙이 완벽하게 알려진 가상의 게임—를 사용하여 AI 모델을 위한 "훈련 체육관"을 구축했습니다. 이러한 게임에서 "증거"(문제를 해결하는 데 필요한 특정 사실)는 연구자에 의해 정확하게 파악됩니다. 이는 무엇이 중요한지 추측해야 하는 실제 세상의 독서와는 다릅니다.

이 논문의 주요 발견은 놀라운 반전입니다. 모델의 어텐션은 종종 무엇이 실제로 필요한지에 대한 형편없는 가이드가 된다는 것입니다.

당신이 사건을 해결하려는 탐정이라고 상상해 보세요. 당신에게는 단서가 가득 담긴 수첩이 있습니다. 똑똑한 탐정 봇을 만드는 표준적인 방법은 인간 탐정이 수첩의 어디를 보는지 관찰하고, 봇에게도 똑같은 페이지를 보도록 가르치는 것입니다. 이 논문은 그 방법이 결함이 있다고 주장합니다. 때때로 인간 탐정(또는 AI "교사" 모델)은 그 페이지가 현재의 단서이기 때문이 아니라, 익숙하거나 무시하는 법을 배웠기 때문에 그 페이지를 봅니다. 논문은 AI의 "스포트라이트"가 이미 무시하도록 학습된 오래된 사실이나 무관한 세부 사항을 비추는 동안, 논리적 사슬의 결정적인 중간 단계들을 완전히 놓치는 경우가 많다는 것을 보여줍니다.

"멀티홉(Multi-hop)"의 미스터리

가장 극적인 증거는 "멀티홉 검색(Multi-hop Retrieval)"이라 불리는 게임에서 나옵니다. 보물 찾기를 한다고 상상해 보세요. 당신은 단서의 사슬을 따라가야 합니다:

  1. 단서 A는 다음과 같습니다: "단서 B로 가시오."
  2. 단서 B는 다음과 같습니다: "단서 C로 가시오."
  3. 단서 C는 다음과 같습니다: "보물은 여기에 있다!"

보물을 찾으려면 모델은 이 세 가지 단서를 모두 읽어야 합니다. 그러나 연구 결과, 모델이 마침내 정답을 낼 때, 모델의 어텐션 스포트라이트는 종종 단서 B를 그대로 건너뛰는 것으로 나타났습니다. 모델은 시작(단서 A)과 끝(단서 C)은 보지만, 내부적인 처리 과정에서 이미 연결 고리를 파악했기 때문에 중간 단계는 무시해 버립니다.

여기서 핵심은 이것입니다. 연구자들이 교사 모델의 어텐션을 복제하여 "라우터(router, 어떤 단서를 유지할지 결정하는 작은 도우미)"를 훈련시켰을 때, 라우터는 처참하게 실패했습니다. 라우터는 시작과 끝은 유지했지만 중간은 버렸습니다. 그 결과는 어땠을까요? 라우터는 정답의 **41%**만을 맞혔습니다.

하지만 연구자들이 인과적 증거 집합(Causal Evidence Sets)—"이 단서를 숨기면 정답이 바뀌는가?"라고 묻는 방식—을 사용하여 라우터를 훈련시켰을 때, 라우터는 중간 단서를 유지하는 법을 배웠습니다. 이 새로운 훈련법을 통해 라우터의 정확도는 **99%**로 치솟으며 완벽한 교사 모델과 일치했습니다. 이는 모델의 "시선(attention)"은 어디를 읽는지를 보여주지만, 반드시 어디에서 답을 *계산(compute)*하는지는 보여주지 않는다는 것을 증м합니다.

"오래된 사실" 문제

논문은 또한 어떤 사실이 기록된 후 나중에 업데이트되는 게임을 살펴보았습니다. 예를 들어: "코드는 1234이다." 그 후, 텍스트의 뒷부분에서: "사실, 코드는 5678이다."라고 나옵니다. 오직 두 번째 숫자만이 정답입니다.

모델이 정답(5678)을 맞힐 때조차도, 모델의 어텐션 스포트라이트는 종종 첫 번째 숫자(1234)를 더 밝게 비춥니다. 이는 학생이 정답이 B라는 것을 알면서도, 처음에 쓰여 있었다는 이유로 틀린 답 A를 계속 쳐다보고 있는 것과 같습니다. 연구자들이 상위 10%의 "어텐션된" 단서만을 유지하는 시스템을 구축하려고 했을 때, 시스템은 잘못된, 오래된 사실을 유지하여 실패했습니다. 하지만 "인과적 증거" 방식(무엇이 깨지는지 보기 위해 단서를 숨기는 방식)을 사용했을 때, 시스템은 마지막 노트만이 중요하다는 것을 정확히 식별해 냈습니다.

Qwen2.5 및 Gemma와 같은 실제 사전 학습된 AI 모델을 대상으로 한 테스트에서도 이 패턴은 유효했습니다. 모델들이 정답을 맞힐 때조차도, 그들은 올바른 현재 정보보다 잘못된, 오래된 정보에 더 많이 "응시"하고 있었습니다.

이것이 왜 중요한가: "개입(Intervention)" 기법

그렇다면 스포트파를 믿을 수 없다면 어떻게 해결해야 할까요? 논문은 주석(annotation)이 필요 없는 영리한 트릭을 제안합니다. 모델에게 "무엇을 보고 있니?"라고 묻는 대신, "이것을 가리면 어떻게 되니?"라고 묻는 것입니다.

텍스트의 일부를 일시적으로 마스킹(숨김) 처리하고 정답이 변하는지 확인함으로써, 시스템은 인과적 증거 집합—문제를 해결하는 데 필요한 정확하고 최소한의 사실 집합—을 자동으로 찾아낼 수 있습니다. 이 방법은 인간의 레이블링을 필요로 하지 않습니다. 이는 어떤 단서가 중요한지 추측하는 대신, 각 단서를 하나씩 숨겨보며 어떤 단서가 사건을 해결 불가능하게 만드는지 테스트하는 탐정과 같습니다.

결과는 놀랍습니다. 이러한 "개입" 레이블로 훈련된 라우터들은 어텐션 기반 훈련보다 일관되게 우수한 성능을 보였습니다.

  • "멀티홉" 체인 태스크에서 어텐션 기반 훈련은 **41%**의 정확도를 보였으나, 인과적 증거 훈련은 **99%**를 기록했습니다.
  • 훈련 시보다 4배 더 긴 문맥을 가진 태스크에서도 인과적 라우터는 강력한 성능을 유지한 반면, 어텐션 기반 라우터는 비틀거렸습니다.
  • SQuAD와 같은 실제 데이터에서도 인과적 방식은 모델이 방해 요소들을 무시하고 올바른 문장에 집중하도록 도왔지만, 어텐션 방식은 무관한 텍스트에 혼란을 겪었습니다.

결론

이 논문은 단순히 어텐션이 불완전하다고 제안하는 데 그치지 않고, 어텐션이 희소 시스템을 훈련하기 위한 나쁜 타겟이라는 명확한 증거를 제시합니다. 모델의 어텐션은 교과서의 엉뚱한 페이지를 쳐다보는 산만한 학생과 같습니다. 만약 우리가 모델이 보는 것에 기반하여 AI 도구를 만든다면, 우리는 모델의 실수를 그대로 물려받게 됩니다.

대신, 논문은 우리의 시스템을 인과적 의존성(causal dependence), 즉 모델이 정답을 만들어내는 데 실제로 필요한 것에 기반하여 훈련시켜야 한다고 주장합니다. "숨기기-찾기" 테스트(개입)를 통해 진정한 증거를 찾아냄으로써, 우리는 더 빠를 뿐만 아니라(무관한 텍스트를 무시함으로써) 더 똑똑하고 신뢰할 수 있는 AI를 구축할 수 있습니다. 이 연구는 어텐션이 모델의 눈이 어디에 있는지를 보여준다면, 인과적 증거는 모델의 뇌가 실제로 어디에서 작동하고 있는지를 보여준다고 결론짓습니다. 그리고 더 나은 AI를 만들기 위해서는 눈이 아니라 뇌를 따라가야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →