← 최신 논문
🤖 machine learning

When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning

본 논문은 올바른 시연이 항상 인-컨텍스트 학습을 돕는다는 가정을 도전하며, 작업 보존적 교란이 '맥락적 증거 이동'을 통해 성능을 저하시킬 수 있음을 밝히고, 예시의 유용성은 단순한 정확성이 아니라 예시가 맥락 추론에 어떻게 영향을 미치는지에 달려 있음을 입증합니다.

원저자: Chenghao Qiu, Chunli Peng, Yufeng Yang, Kuan-Hao Huang, Yi Zhou

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chenghao Qiu, Chunli Peng, Yufeng Yang, Kuan-Hao Huang, Yi Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"올바른 예시가 해가 될 수 있다"는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어보겠습니다.

큰 그림: "옳음"이 항상 "도움"은 아닙니다

로봇에게 빨래를 분류하는 법을 가르치려 한다고 상상해 보세요. 몇 가지 예를 보여줍니다.

  • 예시 1: 빨간 양말은 "빨간색" 더미에 넣습니다.
  • 예시 2: 파란 셔츠는 "파란색" 더미에 넣습니다.

로봇은 빠르게 배웁니다. 이를 **문맥 학습 (In-Context Learning, ICL)**이라고 합니다. 로봇은 당신이 제공하는 예시 (즉, "시연") 를 보고, 방금 건네준 새로운 항목을 어떻게 처리할지 추측합니다.

기존의 일반적인 믿음은 다음과 같았습니다: "내가 로봇에게 보여주는 예시들이 사실적으로 정확하기만 한다면, 로봇은 더 잘 배울 것이다."

이 논문은 그 믿음이 틀렸음을 증명합니다.

저자들은 기이한 현상을 발견했습니다. 로봇에게 100% 사실적으로 정확한 예시를 주더라도, 그 예시들이 어떻게 보이거나 들리는지 방식을 바꾸면 로봇은 혼란을 겪어 아예 예시를 주지 않았을 때보다 더 나쁜 성능을 보일 수 있다는 것입니다.

실험: "작업 유지" 트릭

이를 테스트하기 위해 연구자들은 로봇을 잘못된 답으로 속이지 않았습니다. 대신 "같은 작업, 다른 이야기"라는 게임을 펼쳤습니다. 이를 **작업 유지 교란 (Task-Preserving Perturbation)**이라고 부릅니다.

누군가에게 운전하는 법을 가르치는 것과 비슷합니다.

  • 표준적인 방법: 빨간 불에서 차가 멈추는 비디오를 보여줍니다. (올바른 예시)
  • "교란된" 방법: 빨간 불에서 멈추는 다른 차의 비디오를 보여주지만, 이번에는 그 차가 밝은 노란색 컨버터블이고 날씨는 화창하며 운전자는 모자를 쓰고 있습니다. 행동 (빨간 불에서 멈추기) 은 여전히 올바릅니다. 규칙은 변하지 않았습니다.

하지만 연구자들은 "다르게 보이지만 올바른" 예시를 너무 많이 보여주면 로봇이 실제 규칙이 무엇인지 혼란을 겪기 시작한다는 사실을 발견했습니다. 로봇은 "아, 아마도 규칙은 화창한 날씨의 노란색 컨버터블에 관한 것일지도 몰라"라고 생각하기 시작하고, "빨간 불에서 멈추라"는 본질적인 규칙을 잊어버리게 됩니다.

핵심 개념: "문맥 증거 이동"

이 혼란을 설명하기 위해 논문은 **문맥 증거 이동 (Contextual Evidence Shift)**이라는 전문 용어를 도입했습니다.

로봇이 미스터리를 해결하려는 형사라고 상상해 보세요. 당신이 주는 예시들은 "단서"입니다.

  • 깔끔한 단서: 모든 단서가 비슷하게 생겼고 같은 용의자를 명확히 가리킵니다.
  • 교란된 단서: 단서들은 기술적으로 여전히 진실이지만, 서로 매우 다르게 생겼습니다. 어떤 것은 빨간 잉크로 쓰였고 어떤 것은 파란 잉크로 쓰였으며, 어떤 것은 긴 이야기이고 어떤 것은 짧은 메모입니다.

모든 단서가 진실임에도 불구하고, 단서들의 혼합이 변합니다. 형사 (로봇) 는 주요 범죄가 아닌 잘못된 세부 사항 (예: 잉크의 색상) 에 집중하기 시작합니다. 사실은 변하지 않았음에도 불구하고, 로봇이 결정을 내리는 데 사용하는 "증거"가 이동한 것입니다.

그들이 발견한 것

연구자들은 세 가지 유형의 작업에서 이를 테스트했습니다.

  1. 감정 분석: 영화 리뷰가 긍정적인지 부정적인지 판단하기.
  2. 논리적 추론: "A 가 참이고 A 가 B 를 함축한다면, B 는 참인가?"와 같은 퍼즐 풀기.
  3. 수학 단어 문제: 간단한 수학 이야기 풀기.

결과:

  • 작은 로봇이 더 큰 타격을 입음: 70 억 개 파라미터 모델과 같은 작고 덜 강력한 모델들은 예시들이 다르게 보일 때 매우 혼란을 겪었습니다. 정확도가 크게 떨어졌습니다.
  • 큰 로봇은 더 튼튼함: 700 억 개 파라미터 모델과 같은 크고 똑똑한 모델들은 "노이즈"를 무시하고 실제 규칙에 집중하는 데 훨씬 능했습니다. 그들은 그렇게 혼란을 겪지 않았습니다.
  • 혼란이 커질수록 결과가 나빠짐: "다르게 보이는" 예시를 더 많이 추가할수록 작은 로봇들의 성능은 더 나빠졌습니다. 어떤 경우에는 아예 예시를 주지 않았을 때보다 이 "올바른" 예시들을 주었을 때 로봇이 더 나쁜 결과를 냈습니다.

간단한 비유: 음악 플레이리스트

DJ 에게 "신나는 팝" 음악을 연주하는 법을 가르치려 한다고 상상해 보세요.

  • 표준 예시: 10 곡의 신나는 팝 노래 플레이리스트를 줍니다. 그들은 분위기를 완벽하게 배웁니다.
  • 교란된 예시: 여전히 신나는 팝이지만, 커버 아트, 앨범 이름, 트랙 순서를 바꾼 10 곡을 줍니다. 음악 장르는 같지만 "포장"이 기이합니다.

표준적인 곡과 기이하게 포장된 곡이 섞인 플레이리스트를 DJ 에게 주면, 초보 DJ 는 기이한 앨범 커버에 집중하다 보니 비트를 놓치고 느린 재즈를 틀기 시작할 수 있습니다. 반면, 전문가 DJ(큰 모델) 는 커버를 무시하고 올바른 음악을 연주할 것입니다.

결론

이 논문은 우리가 예시를 이용해 AI 모델을 가르칠 때, 단순히 *"이 예시가 올바른가?"*라고만 물어서는 안 된다고 결론 내립니다.

우리는 또한 *"이 예시가 다른 예시들의 패턴과 잘 어울리는가?"*라고 물어봐야 합니다.

예시들이 모두 "올바르다" 하더라도 서로 너무 다르게 보인다면, 실제로는 AI 의 학습 능력을 해칠 수 있습니다. AI 는 사실적으로 진실하지만 스타일적으로 혼란스러운 데이터의 더미가 아니라, 규칙을 파악할 수 있는 일관된 "분위기"나 "문맥"이 필요합니다.

간단히 말해: 정확성은 필요하지만 충분하지는 않습니다. 올바른 정보를 전달하는 방식이 정보 자체만큼이나 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →