← 최신 논문
💬 NLP

Exemplars in Disguise: Pure Exemplar Models Mimic Abstraction-First Learning

이 논문은 순수 암기 모델이 입력 분포에 따라 그러한 학습 패턴을 모방할 수 있음을 입증함으로써, 대규모 언어 모델이 항목별 세부 사항보다 추상적 지식을 먼저 학습한다는 주장에 이의를 제기하며, 이는 분산 표현에 대해 항목별 지식과 추상적 지식의 구분이 불분명할 수 있음을 시사한다.

원저자: Zachary Nicholas Houghton, Vsevolod Kapatsinski

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Zachary Nicholas Houghton, Vsevolod Kapatsinski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 말하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 어떻게 학습하는지에 대해 두 가지 커다란 이론을 가지고 있습니다. 첫 번째 이론은 "규칙집 이론(Rulebook Theory)"으로, 로봇이 특정 단어를 암기하기 전에 — 예를 들어 '주다'라는 의미를 가진 모든 동사가 어떻게 함께 작동하는지와 같은 — 크고 추상적인 언어 규칙을 먼저 파악한다는 것입니다. 두 번째 이론은 "기억 책 이론(Memory Book Theory)"으로, 로봇이 들리는 모든 문장을 하나하나 통째로 암기한 다음, 나중에 그 방대한 기억 더미를 비교하며 패턴을 발견한다는 것입니다.

오랫동안 과학자들은 둘 중 무엇이 맞는지 논쟁해 왔습니다. 하지만 최근 한 연구는 거대 AI 모델(에세이를 쓰거나 당신과 대화하는 것과 같은)을 조사하여, "규칙집 이론"이 옳다는 증거를 발견했다고 주장했습니다. 그들은 이 AI들이 특정 단어의 미묘한 차이를 배우기 전에 큰 규칙을 먼저 배운다고 말했습니다. 그러나 이 논문은 마치 탐정이 되어 이렇게 말하며 개입합니다. "잠깐만요. 단서들을 더 자세히 살펴봅시다." 저자들은 이 증거가 정말로 로봇이 규칙을 생각하고 있다는 증거인지, 아니면 로봇이 새로운 정보에 주의를 기울이는 방식 때문에 나타나는 결과인지를 확인하기 위해 단순한 컴퓨터 시뮬레이션을 사용하여 자체 실험을 수행했습니다.

위대한 강탈: 규칙인가 기억인가

언어 학습의 세계에는 고전적인 줄다리기기가 있습니다. 한쪽에는 **추상화(Abstraction)**가 있습니다. 이것은 '과일'이라는 개념을 배우는 것과 같습니다. 일단 무엇이 과일인지 알게 되면, 한 번도 본 적 없는 이상하게 생긴 물건을 보더라도 그것을 맛본 적이 없어도 아마 과일일 것이라고 추측할 수 있습니다. 반대편에는 **예시(Exemplars, 또는 구체적인 기억)**가 있습니다. 이것은 당신이 먹어본 모든 사과, 바나나, 오렌지를 하나하나 기억하는 것과 같습니다. 당신은 '과일'에 대한 규칙이 필요하지 않습니다. 그저 당신의 머릿속에 있는 사과와 오렌지 더미와 새로운 것을 비교할 뿐입니다. 만약 그것이 사과처럼 생겼다면, 당신은 그것을 과일이라고 부릅니다.

핵적인 질문은 이것입니다: 무엇이 먼저 오는가? 우리는 일반적인 규칙을 먼저 배우는가, 아니면 구체적인 기억을 먼저 쌓아가는가?

최근 연구자들은 유명한 AI 모델(GPT-2)을 관찰하며 흥ًا로운 점을 발견했습니다. 그들은 AI가 시간에 따라 학습하는 과정을 지켜보았습니다. 그들은 AI가 '주다(give)'와 '팔다(sell)'처럼 유사한 동사들을 함께 묶는 것을 — 이 단어들의 미묘한 차이(예를 들어 '주다'가 '팔다'와 어떻게 약간 다르게 쓰이는지)를 알아차리기 — 전부터 먼저 수행한다는 것을 관찰했습니다. 그들은 이를 "추상화 우선(Abstraction-First)" 학습이라고 불렀습니다. 마치 AI가 기억 책을 채우기 전에 규칙집을 먼저 구축하는 것처럼 보였습니다.

반전: "민감도" 스위치

이 논문의 저자인 재커리 니콜라스 호튼(Zachary Nicholas Houghton)과 세볼로드 카파친스키(Vsevolod Kapatsinski)는 이 "추상화 우선" 패턴이 진짜 규칙집의 신호인지, 아니면 단순히 AI가 주의를 기울이는 방식에 따른 부수적인 효과인지를 테스트하기로 했습니다.

이를 위해 그들은 컴퓨터 시뮬레이션 속에 두 가지 단순하고 가짜인 학습자를 만들었습니다. 이들은 숨겨진 규칙집을 가진 화려한 AI가 아닙니다. 이들은 순수한 암기 모델입니다. 이들은 추상적인 규칙을 만드는 능력이 없으며, 오직 본 것을 기억할 수 있을 뿐입니다.

  1. "제로 민감도(Zero-Sensitivity)" 학습자: 이 학습자는 매우 매끄럽고 차분한 로봇이라고 상상해 보세요. 새로운 단어를 볼 때, 이 로봇는 흥분하거나 안절부절못하지 않습니다. 이 로봇는 새로운 정보를 아주 천천히, 완벽하게 자신의 기억 속으로 녹여내며, 일회성 실수 같은 이상한 점들은 무시합니다. 이는 마치 색을 섞을 때 색을 튀기지 않고 캔버스 위에 부드럽게 블렌딩하는 차분한 화가와 같습니다.

  2. "가변 민감도(Variable-Sensitivity)" 학습자: 이 학습자는 다소 안절부절못합니다. 이 학습자는 보는 모든 새로운 단어에 강하게 반응합니다. 만약 초기에 이상한 단어를 본다면, 매우 흥분하게 됩니다. 이 학습자가 얼마나 안절부절못하는지는 k라고 불리는 설정값에 달려 있습니다(이를 "지터 노브(jitter knob, 떨림 조절기)"라고 생각하세요). 만약 k가 낮으면, 이 학습자는 아주 작은 디테일에도 매우 민감합니다. 만 만약 k가 높으면, 이 학습자는 매우 차분하며 작은 디테일들을 무시하고 이를 매끄럽게 처리합니다.

거대한 발견

이 논문이 밝혀낸 마법 같은 트릭은 이것입니다: 이 학습자들이 "학습"하는 순서는 규칙을 가지고 있는지 여부가 아니라, 전적으로 그들이 얼마나 안절부절못하느냐(jittery)에 달려 있습니다.

  • 학습자가 안절부절못할 때 (낮은 k): "기억 책"이 승리합니다. 학습자는 초기에 보는 몇몇 이상한 단어들에 의해 주의가 분산됩니다. 이 학습자는 큰 그룹에 속한다는 것을 알아차리기 전에 특정 단어들 사이의 차이점을 먼저 알아차리기 시작합니다. 이것은 "예시 우선(Exemplar-First)" 학습처럼 보입니다.
  • 학습자가 차분할 때 (높은 k): "규칙집"이 승리합니다. 학습자는 초기의 노이즈 섞인 디테일들을 무시하고 패턴이 나타나기를 기다리기 때문에, 미묘한 차이를 알아차리기 전에 단어들을 먼저 그룹화하기 시작합니다. 이것은 정확히 "추상화 우선(Abstraction-First)" 학습처럼 보입니다.

이 논문은 이러한 학습자들이 추상적 규칙을 만드는 능력이 전혀 없는 순수한 암기 모델임에도 불구하고, 충분히 차분하기만 하면(높은 k) 마치 규칙을 먼저 배우는 것처럼 보일 수 있다는 것을 보여줍니다.

이것이 AI에 의미하는 바

저자들은 AI가 규칙을 먼저 배운다고 주장했던 이전의 연구가 이 요인에 의해 영향을 받았을 수 있다고 주장합니다. 그들은 분석 대상이었던 AI 모델(GPT-2)이 아마도 "차분한 암기자(high k learner)"처럼 행동했을 것이라고 제안합니다. 즉, AI가 반드시 비밀스러운 규칙집을 구축한 것이 아니라, 초기 훈련 데이터의 노이즈를 너무 잘 매끄럽게 처리한 나머지 마치 큰 패턴을 먼저 배우는 것처럼 보였을 뿐이라는 것입니다.

사실, 이 논문은 이러한 종류의 분산 시스템에서 "특정 단어를 기억하는 것"과 "일반적인 규칙을 아는 것" 사이의 경계가 매우 모호할 수 있음을 시사합니다. "규칙"은 아마도 모든 기억의 평균일 것이고, "기억"은 그 평균의 특정 지점일 수도 있습니다. 이 둘을 실제로 분리할 수는 없습니다.

판결

그렇다면 이 논문이 AI가 규칙을 먼저 배운다는 것을 증명했나요? 아니요. 오히려 이 논문은 "그것이 증명되었다"고 사용된 특정 테스트가 신뢰할 만한 테스트가 아님을 시사합니다. 순수한 암기 모델이라도 충분히 차분하기만 하다면 그 테스트를 통과할 수 있기 때문입니다. 저자들은 트랜스포머 모델이 진정으로 추상화 우선 학습자인지는 여전히 열린 문제라고 말합니다. 다만, 이를 답하기 위해서는 단순히 발생 순서(order of onset)를 살펴보는 것 이상의 새로운 방법이 필요하다고 결론짓습니다. 그때까지 "규칙집 대 기억 책"의 논쟁은 여전히 열려 있으며, 우리가 증거라고 믿었던 것은 어쩌면 데이터가 처리되는 방식의 결과물일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →