← 최신 논문
🤖 machine learning

Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

이 논문은 로짓 기여도 점수화(LOCOS)를 소개하는데, 이는 출력 값 회로의 정답 토큰에 대한 기여도를 측정함으로써 대규모 언어 모델 내의 비리터럴(non-literal) 검색 헤드를 식별하는 새로운 방법으로, 이러한 특정 헤드들을 제거했을 때 다른 능력들은 보존하면서도 긴 문맥 합성 성능은 유의미하게 저하시킨다는 것을 입증한다.

원저자: Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 언어 모델(LLM)을 인터넷 전체를 읽은 아주 똑똑하고 과로한 사서라고 상상해 보세요. 당신이 질문을 던지면, 이 사서는 자신이 암기한 무작위한 사실을 외치는 것이 아니라, 답을 담고 있는 특정 책이나 페이지를 찾기 위해 거대한 도서관(즉, "컨텍스트")을 훑습니다.

오랫동안 연구자들은 이 사서가 어떻게 답을 찾아내는지 정확히 알고 있다고 믿었습니다. 그들은 사서가 답과 일치하는 단어를 정확히 가리키고 그것을 그대로 베껴 쓴다고 생각했습니다. 이것을 **직설적 검색(literal retrieval)**이라고 부릅니다.

하지만 이 논문의 저자들은 사서가 실제로는 훨씬 더 똑똑하다는 것을 발견했습니다. 종종 답은 책에 적힌 단어를 직접 복사한 것이 아닙니다. 대신, 사서는 문장을 읽고 그 의미를 이해한 다음, 그 이해를 바탕으로 새로운 답을 작성합니다. 이것이 **비직설적 검색(non-literal retrieval)**입니다.

문제점: 잘못된 탐정

이 논문은 모델의 어느 부분(이를 "어텐션 헤드"라고 부름)이 작업을 수행하는지 알아내는 기존 방식이, 사서가 어디를 가리키는지(where)만 보고 무엇을 썼는지(what)는 보지 못하는 탐정과 같다고 주장합니다.

  • 기존 방식 (어텐션 기반): 탐정이 사서를 관찰한다고 상상해 봅시다. 만약 사서가 "파리는 어디인가요?"라는 질문에 답하기 위해 "에펠 탑"이라는 단어를 가리킨다면, 탐정은 "좋아, 저 헤드가 일을 하고 있군"이라고 말합니다.
  • 현실: 때때로 사서는 "에펠 탑"을 가리키지만, 정작 쓰는 내용은 "유키"(텍스트에 유키가 에펠 탑 근처에 산다고 적혀 있었기 때문)가 될 수 있습니다. 기존의 탐정은 이 차이를 놓칩니다. 왜냐하면 손가락질(어텐션)과 쓰기(답)가 일치하지 않기 때문입니다. 기존 방식은 사서가 이해하는 것이 아니라 단순히 복사하고 있다고 생각하게 됩니다.

해결책: LOCOS ("쓰기 인지형" 탐정)

저자들은 LOCOS(Logit-Contribution Scoring)라고 불리는 새로운 방법을 소개합니다. LOCOS를, 가리키는 것과 쓰는 것을 모두 지켜보는 탐정이라고 생각해 보세요.

LOCOS는 다음과 같이 묻습니다: "이 특정 뇌 부위가 실제로 정답을 쓰는 데 도움이 되었는가?"

  • 그것은 출력-값(Output-Value, OV) 회로를 살펴봅니다. 이것은 사서가 읽은 정보를 최종적인 답으로 변환하는 메커니즘입니다.
  • 만약 어떤 헤드가 "에펠 탑"을 가리켰는데, 그 헤드의 "쓰기 기계"(OV 회로)가 성공적으로 답지에 "유키"라는 단어를 써 내려갔다면, LOCOS는 그 헤드에 높은 점수를 줍니다.
  • 만약 어떤 헤드가 "에펠 탑"을 가리켰지만, 그 쓰기 기계가 무작위 단어나 아무것도 쓰지 못했다면, LOCOS는 그 헤드의 가리킴이 강했더라도 무시합니다.

실험: "침묵" 테스트

자신들의 이론을 증명하기 위해, 연구진은 여러 다른 AI 모델(Qwen, Gemma, OLMo 등)을 대상으로 "침묵 테스트"를 실시했습니다.

  1. 설정: 그들은 LOCOS가 식별한 상위 50개의 헤드를 가져와서 AI의 뇌에서 "끄기"(절제/ablation)를 수행했습니다.
  2. 결과:
    • LOCOS 헤드를 껐을 때, AI의 비직설적 질문 답변 능력은 폭락했습니다. 한 테스트에서는 점수가 건강한 0.40에서 0.00(완전한 실패)으로 떨어졌습니다.
    • 기존 방식으로 식별된 헤드들을 껐을 때는, AI가 여전히 준수한 성능(약 0.29)을 유지하며 답변할 수 있었습니다.
    • 비유: 이것은 자동차를 운전하는 것과 같습니다. 엔진(LOCOS 헤드)을 제거하면 자동차는 멈춰버립니다. 하지만 사이드 미러(기존 방식의 헤드)를 제거하면, 자동차는 조금 서툴 뿐 여전히 달릴 수 있습니다.

이것이 왜 중요한가 (논문에 따르면)

이 논문은 LOCOS가 기존 방식이 완전히 놓쳤던 숨겨진 "검색 헤드(retrieval heads)" 그룹을 찾아냈다고 주장합니다. 이들은 단순히 텍스트를 복사하는 것이 아니라, 의미를 합성하는 중대한 역할을 하는 특정 부분들입니다.

  • 특이성: 이 헤드들을 껐을 때, AI는 컨텍스트 관련 질문에는 답하지 못했지만, 수학 문제나 일반적인 사실(예: "파리는 프랑스에 있다")은 여전히 기억해 냈습니다. 이는 이 헤드들이 일반적인 지능이 아닌, 텍스트로부터 정보를 검색하는 데 특화되어 있음을 증명합니다.
  • "비직설적" 격차: 기존 방식은 오직 복사-붙여넣기를 하는 헤드만을 찾아냈습니다 습니다. 반면 LOCOS는 텍스트를 바탕으로 새로운 답을 구성하기 위해 실제로 생각하는 헤드를 찾아냈습니다.

요약

요약하자면, 이 논문은 다음과 같이 말합니다: "우리는 AI가 긴 텍스트로부터 정보를 이해하고 합성하는 부분을 찾아내는 더 나은 방법을 발견했습니다. 기존 방식은 오직 복사-붙여넣기를 하는 부분만을 보았습니다. 우리가 찾아낸 이 새로운 '스마트한' 부분들을 꺼버림으로써, AI는 컨텍스트에 기반한 답변 능력을 완전히 상실했으며, 이는 이 부분들이 장기 컨텍스트 이해의 진정한 엔진임을 입증합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →