← 최신 논문
🤖 AI

Emergent Semantic Role Understanding in Language Models

이 논문은 선형 프로브를 통해 증명된 바와 같이, 의미 역할 이해가 프리트레이닝 중 고정된 디코더 전용 트랜스포머에서 부분적으로 나타남을 보여주지만, 완전한 성능을 위해서는 파인튜닝이 필요하며 이러한 역할의 내부 표현은 모델 규모가 커질수록 점점 더 분산된다는 것을 보여줍니다.

원저자: Carla Griffiths, Mirco Musolesi

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Carla Griffiths, Mirco Musolesi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어린아이가 이야기를 이해하는 법을 가르친다고 상상해 보세요. 두 가지 선택지가 있습니다:

  1. "읽고 배우기" 방법: 아이가 스스로 수천 권의 책을 읽게 하여, 누가 누구에게 무엇을 했는지 자연스럽게 파악하기를 기대하는 것입니다.
  2. "연습" 방법: 아이가 읽은 후, 그들을 앉혀놓고 명시적으로 가르치는 것입니다. "이 문장에서 개가 행동을 한 주체이고, 공은 차인 대상이다"라고요.

이 논문은 다음과 같은 큰 질문을 던집니다: 대규모 언어 모델 (즉, '아이들') 은 텍스트를 읽기만 해서 (사전 학습) '누가 누구에게 무엇을 했는지'라는 논리를 스스로 파악할까요, 아니면 이를 배우기 위해 명시적인 연습 (미세 조정) 이 필요할까요?

칼라 그리피스와 미르코 무솔레스이 연구자들은 이 문제를 규명하기 위해 실험을 설계했습니다. 그들이 어떻게 실험을 진행했고 무엇을 발견했는지, 간단히 설명해 드리겠습니다.

실험: "얼어붙은 뇌" 테스트

모델이 이 논리를 스스로 학습했는지 확인하기 위해 연구자들은 기발한 트릭을 사용했습니다. 훈련 데이터를 읽기 (사전 학습) 를 마친 모델의 뇌를 얼려버린 것입니다. 즉, 뇌가 변하거나 새로운 것을 학습하지 못하도록 허용하지 않았습니다.

그런 다음, 아주 간단하고 작은 "프로브" (기본적인 질문 - 답변 도구와 유사) 를 얼어붙은 뇌에 연결하고 문장 내 역할을 식별하도록 요청했습니다 (예: "누가 산책을 갔을까?").

  • 얼어붙은 뇌가 잘 답변했다면: 모델이 읽기만 해서 논리를 학습했다는 뜻입니다.
  • 얼어붙은 뇌가 실패했다면: 모델은 나중에 특정 작업으로 "연습" (미세 조정) 을 받았을 때만 논리를 학습했다는 뜻입니다.

이 테스트는 0.4 백만 개의 매개변수를 가진 작은 '강아지'부터 57 백만 개의 매개변수를 가진 '중형견'까지, 네 가지 다른 크기의 모델에서 수행되었습니다.

발견 결과: 무엇을 발견했을까요?

1. 논리는 이미 존재하지만 (완벽하지는 않음)

연구자들은 얼어붙은 뇌조차도 무작위 추측보다 훨씬 잘 답변할 수 있음을 발견했습니다.

  • 비유: 도서관의 책들을 모두 읽었지만 시험을 본 적은 없는 학생을 상상해 보세요. 간단한 퀴즈를 내주면, 그들은 읽기만 해서 정답의 약 60% 를 맞힙니다. 그들은 선생님이 규칙을 설명해 줄 필요가 없었습니다. 규칙은 이미 그들의 머릿속에 있었던 것입니다.
  • 결과: 의미적 역할 이해 ('누가 무엇을 했는지'를 아는 것) 는 사전 학습 단계에서 이미 나타납니다. 이는 특정 학습 후에만 나타나는 것이 아닙니다.

2. 더 큰 뇌는 더 많은 "연습"이 필요합니다

여기서 반전이 있습니다. 모델이 커질수록 "얼어붙은 뇌"와 "완전히 훈련된 뇌" 사이의 격차는 오히려 약간 벌어졌습니다.

  • 비유: 작은 모델을 규칙을 읽기만 해서 완벽하게 암기한 학생이라고 생각하세요. 큰 모델은 도서관을 읽었지만, 뇌가 너무 복잡하고 다른 정보로 가득 차 있어 시험을 위해 그 지식을 효율적으로 조직화하기 위해 약간의 구체적인 코칭이 필요한 천재 학생과 같습니다.
  • 결과: 큰 모델들도 정보를 보유하고 있었지만, 이를 완전히 활용하려면 미세 조정이 필요했습니다. "연습"은 그들이 방대한 지식 기반을 더 잘 조직화하도록 도와주었습니다.

3. "누가 무엇을 했는지"를 담당하는 뉴런들

연구자들은 모델 내부로 들어가 이 정보가 어떻게 저장되었는지 살펴보았습니다. 그들은 전문가처럼 행동하는 특정 뉴런 그룹 (작은 처리 단위) 을 발견했습니다.

  • "시간" 전문가들: 일부 뉴런은 전담 시간 관리자와 같았습니다. 모델이 커짐에 따라 변하지 않았으며, 이러한 뉴런들은 사건이 언제 일어났는지 이해하는 데 항상 중요했습니다.
  • "행동 주체 (Agent)" 전문가들: 이것이 가장 놀라운 부분입니다.
    • 작은 모델에서는 특정 뉴런이 '행동 주체' 전문가였습니다. 이를 끄면 모델은 누가 무엇을 했는지 잊어버렸습니다.
    • 큰 모델에서는 이러한 동일한 '행동 주체' 뉴런이 오히려 방해가 되기 시작했습니다! 큰 모델에서 이를 끄면, 모델은 오히려 더 잘 수행했습니다.
  • 비유: 작은 팀에서는 한 명의 특정 인물이 '팀 리더'가 되어야 합니다. 그 사람을 해고하면 팀이 무너집니다. 하지만 거대한 기업에서는 한 사람이 유일한 리더가 되려고 하면 병목 현상이 발생합니다. 리더십이 여러 사람에게 분산될 때 거대 기업은 더 잘 작동합니다. 큰 모델들은 단일 '행동 주체' 뉴런을 가진 상태에서, 업무가 공유되는 분산 네트워크로 전환되었습니다.

결론

이 논문은 언어 모델이 특정 지시 없이 텍스트를 읽기만 해서도 '누가 누구에게 무엇을 했는지'의 기본 구조를 학습한다는 것을 증명합니다. 이 지식은 사전 학습 중에 '구워져' 내재됩니다.

그러나 모델이 커질수록 단순히 '더 똑똑해지는' 것은 아닙니다. 그들은 이 지식을 저장하는 방식을 바꿉니다. 몇몇 특정 '전문가' 뉴런에 의존하는 상태에서 복잡하고 분산된 네트워크를 사용하는 방식으로 전환합니다. 이는 작은 모델에 작동하는 것 (예: 특정 뉴런 하나에 의존하는 것) 이 반드시 거대 모델에도 적용되는 것은 아니라는 뜻입니다. 거대 모델은 방대한 크기를 처리하기 위해 내부 논리를 재구성했기 때문입니다.

간단히 말해: 모델들은 게임이 진행되는 것을 지켜보기만 해서 (사전 학습) 게임 규칙을 배웠지만, 성장함에 따라 승리하기 위해 플레이 스타일을 바꿔야 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →