In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification
본 논문은 컨텍스트 내 학습 모델이 기계적으로 제시된 토큰을 포괄적인 어휘로 취급하도록 제약받기 때문에 라벨 슬롯이 동질적이거나 심지어 의미상 유효한 토큰으로 채워질 때 정확도가 붕괴되며, 이는 의미 이해를 형식 주도 토큰 검색으로 대체하는 특정 신경 회로에 국한된 현상임을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 약간 문자 그대로의 사고방식을 가진 로봇에게 추측 게임을 가르친다고 상상해 보세요. 게임이 어떻게 작동하는지 몇 가지 예시(시연)를 보여준 후, 새로운 상황에 대한 답을 추측하도록 요청합니다. 이를 '맥락 학습(In-Context Learning)'이라고 합니다.
보통 우리는 로봇이 예시에서 게임의 규칙을 학습한다고 생각합니다. 하지만 이 논문은 이상한 버그를 발견했습니다: 로봇은 실제로 규칙을 학습하는 것이 아니라, 당신이 준 답 목록을 단순히 복사할 뿐입니다.
연구자들이 발견한 내용을 간단한 비유로 정리해 보겠습니다.
1. "답 목록" 함정
로봇에게 동물을 식별하는 방법을 보여준다고 상상해 보세요.
- 일반적인 시나리오: 개 사진 4 장과 고양이 사진 4 장을 보여줍니다. 로봇은 "아, 답은 보통 '개'나 '고양이'구나"라고 학습합니다.
- 버그 (동일한 레이블): 고양이 사진 8 장을 보여주고 모두 답이 '고양이'라고 알려줍니다. 그다음 개 사진을 보여주고 "이건 뭐야?"라고 묻습니다.
- 당신의 기대: 로봇은 개를 보고 "그건 개야"라고 말합니다.
- 실제 발생: 로봇은 당신이 준 8 개의 '고양이' 답 목록을 보고, 게임에서 허용된 유일한 단어가 '고양이'라고 결정하고, 비록 틀렸더라도 여전히 "고양이"라고 말합니다.
연구자들은 로봇에게 모두 동일한 답 목록을 주면 정확도가 거의 0% 로 떨어지는 (때로는 12% 미만) 것을 발견했습니다. 로봇은 사진을 생각하기보다 "방금 준 목록에서 단어를 골라야 해"라고 생각하기 시작합니다.
2. "말도 안 되는 단어" 실험
로봇이 단순히 '고양이'라는 단어에 혼란을 느낀 것만은 아님을 증명하기 위해, 연구자들은 더 기이한 시도를 했습니다. 'foo', 'bar', 'vex', 'nit', 'orb' 같은 말도 안 되는 단어들을 답으로 주는 예시들을 로봇에게 제공했습니다.
- 설정: 로봇에게 이러한 말도 안 되는 단어들이 포함된 8 개의 예시를 보여준 후, 실제 개 사진을 보여주고 답을 요청했습니다.
- 결과: 'foo'와 'bar'가 개에게는 전혀 말이 되지 않음에도 불구하고, 로봇은 "개"라고 말하기를 거부했습니다. 대신, 당신이 준 목록에서 말도 안 되는 단어 중 하나를 42% 에서 67% 사이의 빈도로 선택했습니다.
- 교훈: 로봇은 당신이 준 단어 목록을 닫힌 메뉴로 취급합니다. 만약 '개'가 제공된 메뉴에 없다면, 로봇은 메뉴 밖에서 주문하기보다 굶어 죽을 것입니다. 메뉴 항목이 말도 안 되는 것이 중요하지 않습니다. 로봇은 그저 그중 하나를 집어냅니다.
3. "이중 사고" 메커니즘 (내부 작동 방식)
연구자들은 로봇의 뇌 내부 (기계적 해석성이라는 기법을 사용) 를 들여다보아 이것이 어떻게 일어나는지 확인했습니다. 그들이 발견한 것은 **"인코딩 후 재정의 (Encode-then-Override)"**라고 부르는 두 단계 과정입니다.
작가가 이야기를 초안하는 것처럼 생각해 보세요:
- 1 단계 (똑똑한 부분): 로봇의 하위 뇌 층이 개 사진을 읽고 올바르게 "이건 개야"라고 생각합니다. 올바른 답을 준비해 둡니다.
- 2 단계 (버그): 로봇의 상위 뇌 층이 당신이 준 예시 목록을 봅니다. 목록이 '고양이'(또는 'foo') 라고 말하고 있는 것을 봅니다. 그들은 "아니, 이 특정 대화의 규칙에 따르면 우리는 그 목록에서 온 단어만 사용할 수 있다"고 결정합니다.
- 재정의: 상위 층은 올바른 답 ("개") 을 지우고, 대신 목록에서 단어를 출력하도록 로봇을 강제로 바꿉니다.
수학 문제가 2+2=4 임을 아는 학생이지만, 선생님이 "이 수업에서는 5, 6, 7 숫자만 사용한다"고 말하는 것과 같습니다. 학생은 진실을 알고 있지만, "수업 규칙"(예시) 이 대신 "5"라고 쓰도록 강요합니다.
4. 큰 로봇에게도 발생합니다
"아마도 이건 작고 멍청한 로봇에게만 발생하는 것일 거야"라고 생각할 수 있습니다. 연구자들은 매우 작은 모델부터 80 억 개의 파라미터에 이르는 꽤 큰 모델까지 다양한 모델을 테스트했습니다.
- 발견: 이 버그는 모든 모델에게 발생합니다. 테스트 그룹에서 가장 똑똑한 로봇들조차도 이 함정에 빠졌습니다. 사실, 더 큰 로봇들은 때때로 함정에 더 깊이 빠져, 예시가 오해의 소지가 있을 때 정확도가 86% 에서 0% 로 떨어지기도 했습니다.
5. "마지막 단어" 규칙
연구자들은 로봇이 언제 귀를 기울이는지에 대한 이상한 특징도 발견했습니다.
- 만약 7 개의 '고양이' 예시와 맨 끝에 1 개의 '개' 예시를 주면, 로봇은 앞의 7 개를 무시하고 마지막 하나만 듣습니다.
- 만약 '개' 예시를 맨 앞에 두면, 로봇은 그것을 완전히 무시합니다.
- 비유: 로봇은 매우 짧은 주의 집중 시간을 가집니다. 로봇은 가장 최근에 본 답 목록에만 관심을 가지며, 그 목록을 현재 질문을 위한 절대적인 법으로 취급합니다.
요약
이 논문은 이러한 AI 모델이 항상 작업의 개념을 "학습"하지 않는다고 결론지었습니다. 대신, 그들은 종종 당신이 보여준 답 목록을 단순히 검색하여 그 목록에서 선택하고, 질문의 실제 의미를 무시합니다. 만약 그들에게 말도 안 되는 목록을 주면, 그들은 말도 안 되는 답으로 응답할 것입니다. 만약 그들에게 모두 '고양이'인 목록을 주면, 그들은 개를 '고양이'라고 부를 것입니다.
왜 이것이 중요한지 (논문에 따르면):
이러한 모델을 이메일 분류나 데이터베이스 기반 질문 답변과 같은 작업에 사용할 때, 당신이 가져온 예시들이 우연히 모두 동일한 레이블을 갖게 되면 (실수일지라도), 모델은 생각하기를 멈추고 단순히 그 레이블을 복사하여 막대한 오류를 초래합니다. 해결책은 무엇일까요? 로봇에게 보여주는 예시들이 다양하도록 하고, 아마도 목록의 맨 끝에 올바른 예시를 넣어 로봇의 뇌를 "재설정"해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.