← 최신 논문
💬 NLP

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

이 논문은 거대 언어 모델에서 인컨텍스트 예시를 선택하기 위해 MLP 활성화 기반 신호를 사용하는 것의 잠재력을 조사하지만, 이러한 방법들이 작업 성능과의 상관관계 부족으로 인해 효과적이지 않다는 결론을 내리며, 향후 연구가 중첩(superposition)의 근본적인 문제를 해결하기 위해 희소 오토인코더(Sparse Autoencoders)와 같은 기술을 탐구해야 함을 시사한다.

원저자: Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 이제 막 배우기 시작한 학생(대규모 언어 모델)에게 특정 유형의 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 긴 교과서를 공부하게 하는 대신, 시험 직전에 몇 가지 예시를 보여주는 것입니다. 이것을 **인컨텍스트 러닝(In-Context Learning)**이라고 부릅니다.

여기서 연구자들이 던지는 핵심적인 질문은 다음과 같습니다. "어떤 예시를 골라야 하는가?" 만약 우리가 "최상의" 예시를 고른다면 학생은 더 좋은 성적을 받을 것입니다. 반대로 나쁜 예시를 고른다면 학생은 혼란에 빠질 수도 있습니다.

핵심 아이디어: 학생의 뇌파에 귀 기울이기

이 논문의 저자들은 기발한 가설을 세웠습니다. 그들은 이렇게 생각했습니다. "학생이 예시를 보고 있는 동안 학생의 뇌 활동을 관찰하면, 그것이 좋은 예시인지 알 수 있지 않을까?"

컴퓨터 용어로, 이 "뇌파"는 **활성화(activations)**라고 불립니다. 모델이 예시를 처리할 때, 내부 기계 장치의 특정 부분(특히 모델의 기억 저장소와 같은 역할을 하는 MLP 레이어)이 밝게 빛납니다. 연구자들은 이 빛이 얼마나 밝게 번쩍이는지를 측정하고자 했습니다. 그들의 생각은 다음과 같았습니다:

  • 더 밝은 빛 = 더 중요하고 품질이 높은 예시.
  • 더 어두운 빛 = 지루하고 쓸모없는 예시.

그들은 이 "뇌파 측정값"을 사용하여 학생에게 가장 적합한 예시를 자동으로 선택하려고 시도했습니다. 심지어 학생이 예시를 보는 방식(예: 페이지 전체를 한꺼번에 읽게 하는 것 vs 한 줄씩 읽게 하는 것)을 다르게 하여 뇌파 패턴이 변하는지도 확인했습니다.

실험: 이론 검증하기

연구팀은 대규모 실험을 진행했습니다. 그들은 두 가지 인기 있는 AI 모델(Llama와 Qwen)을 사용하였고, 네 가지 다른 유형의 작업에 대해 테스트했습니다:

  1. 참/거짓 문제 (BoolQ)
  2. 객관식 과학 문제 (ARC-Challenge, OpenBookQA)
  3. 수학 문장제 문제 (GSM8K)

각 작업에 대해 1,000개의 잠재적 예시를 준비했습니다. 그들은 다양한 수학적 도구(평균 밝기, 빛의 확산 정도, 또는 가장 큰 단일 번쩍임 등을 확인하는 방식)를 사용하여 각 예시에 대한 "뇌파"(활성화)를 측정했습니다. 그런 다음, 모델이 실제로 얼마나 잘 수행하는지 확인하기 위해 해당 예시들로 테스트를 진행했습니다.

마지막으로, 그들은 뇌파 점수실제 테스트 점수와 비교했습니다. 그들이 찾고자 했던 것은 강력한 연결 고리였습니다. 즉, 뇌파가 가장 밝았던 예시들이 실제로 모델의 성적을 높이는 데 도움이 되었는가? 하는 점이었습니다.

결과: "부정적인" 발견

결론은 이렇습니다. 작동하지 않았습니다.

연구자들은 뇌파 패턴과 모델의 성능 사이에 거의 아무런 연결 고리도 없다는 것을 발견했습니다.

  • 상관관계는 매우 낮았습니다 (최고치가 1.0 만점에 0.33에 불과했는데, 이는 관계가 거의 없다는 뜻입니다).
  • 때로는 "가장 밝은" 뇌파를 가진 예시들이 무작위로 예시를 골랐을 때보다 오히려 모델의 성능을 떨어뜨리기도 했습니다.
  • 텍스트의 일부를 가려서(masking) 모델이 읽는 방식을 바꾸려고 시도했을 때도 결과는 마찬가지였습니다. 뇌파는 성공을 예측하지 못했습니다.

왜 실패했을까? "중첩(Superposition)" 비유

저자들은 이 현상을 설명하기 위해 **중첩(Superposition)**이라는 개념을 사용하여 이론을 제시합니다.

모두가 동시에 말을 하려고 애쓰는 붐비는 방을 상상해 보세요. 일반적인 방이라면 누군가의 목소리를 듣기 위해 그 사람의 목소리에 집중하면 됩니다. 하지만 이 AI 모델의 "방"(내부 차원)에는 들을 수 있는 사람보다 더 많은 대화가 동시에 일어나고 있습니다.

이 모든 대화를 제한된 공간에 집어넣기 위해, 모델은 그것들을 서로 뒤섞어 버립니다. 뇌 속의 단일한 "빛"은 단순히 하나의 특정 사실만을 의미하는 것이 아니라, 여러 가지 사실과 아이디어가 복잡하게 얽힌 혼합물입니다. 신호가 너무 뒤섞여 있고 엉켜 있기 때문에, 단순히 "밝기"만 관찰해서는 특정 예시가 좋은지 나쁜지 알 수 없습니다. 그것은 마치 스무디 전체의 색깔만 보고 특정 재료의 품질을 판단하려는 것과 같습니다. 색깔이 너무 섞여 있어서 그 안에 무엇이 들어있는지 알 수 없는 것입니다.

시사점

이 논문은 AI의 순수한 뇌파 측정값(MLP 활성화)을 사용하여 좋은 예시를 고르는 것은 불가능하다고 결론짓습니다. 이는 이 특정 방식에 있어서는 막다른 길입니다.

하지만 저자들은 앞으로 나아갈 길을 제시합니다. 신호가 너무 뒤섞여 있기 때문에, 먼저 그것들을 "분리"할 수 있는 특별한 도구가 필요할 것입니다. 그들은 엉킨 대화들을 분리하여 개별적인 목소리를 실제로 들을 수 있게 해주는 정교한 필터 역할을 하는 **희소 오토인코더(Sparse Autoencoders, SAEs)**를 사용할 것을 제안합니다. 그 필터를 갖추기 전까지는, 이러한 활성화 신호에 의존하여 예시를 선택해서는 안 됩니다.

요약하자면: AI의 내부 "빛"을 사용하여 예시를 고르겠다는 아이디어는 훌륭한 이론이었지만, 실험 결과 AI의 내부 신호가 너무 무질서하여 직접 해석하기에는 부적합하다는 것이 밝혀졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →