← 최신 논문
🤖 AI

In-Context Examples Suppress Scientific Knowledge Recall in LLMs

본 논문은 대규모 언어 모델에 문맥 내 예시를 추가하면 잠재적 과학 지식을 회상하고 적용하는 능력이 억제되어, 해당 예시들이 올바른 기본 공식에 의해 생성된 경우에도 오히려 경험적 패턴 적합에 의존하게 됨을 보여준다.

원저자: Chaemin Jang, Woojin Park, Hyeok Yun, Dongman Lee, Jihee Kim

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chaemin Jang, Woojin Park, Hyeok Yun, Dongman Lee, Jihee Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

간단한 언어와 일상적인 비유를 사용하여 이 논문을 설명합니다.

핵심 아이디어: 예시가 당신이 아는 것을 잊게 만들 때

당신이 물리학, 화학, 경제학의 법칙을 모두 외운 천재 학생이라고 상상해 보세요. 당신은 정확한 공식을 사용하여 문제를 해결하는 방법을 정확히 알고 있습니다. 하지만 선생님이 문제를 풀기 전에 유사한 문제와 그 해답이 포함된 10 개의 예시를 보여 주는 시험을 내면 어떨까요?

당신은 "좋아! 이 예시들이 규칙을 더 잘 기억하는 데 도움이 되겠군"이라고 생각할지도 모릅니다.

하지만 이 논문은 정반대가 사실임을 발견했습니다. AI(대규모 언어 모델) 가 그 예시들을 보면, 실제로는 기억해 둔 과학 법칙을 사용하지 않고 대신 예시들의 패턴을 기반으로 추측하기 시작합니다. 마치 요리사가 몇 장의 요리 사진을 본 후 레시피를 잊어버리고 사진만 보고 재료를 추측하는 것과 같습니다.

저자들은 이를 **"지식 대체 (Knowledge Displacement)"**라고 부릅니다. 예시들이 지식을 강화하는 것이 아니라, 지식을 밀어내어 치워 버리는 것입니다.


AI 가 생각하는 두 가지 방식

이 논문은 AI 가 과학 문제를 해결할 때 사용하는 두 가지 다른 "모드"를 설명합니다.

  1. "교과서 모드" (지식 주도형):

    • 작동 원리: AI 는 문제 (예: "이 물체는 얼마나 빨리 식을까?") 를 보고 키워드를 인식한 후, 기억에서 올바른 공식 (뉴턴의 냉각 법칙) 을 꺼냅니다. 그런 다음 수학을 사용하여 단계별로 답을 계산합니다.
    • 비유: 이는 엔진에서 이상한 소리가 나면, 수년간의 훈련을 통해 정확히 어떤 부품이 고장 났는지 알고 올바른 공구로 수리하는 정비공과 같습니다.
  2. "패턴 모드" (예시 주도형):

    • 작동 원리: AI 는 공식을 무시합니다. 대신 프롬프트에 제공된 10 개의 예시를 보고 단서나 추세를 찾습니다. "예시에서 숫자가 올라가면 답이 내려갔으니, 나도 그렇게 하겠다"라고 말하며 답을 추측합니다.
    • 비유: 이는 엔진 공부를 한 번도 하지 않았지만, 고장 난 부품이 있는 자동차 사진 10 장을 보고 있는 정비공과 같습니다. 그들은 "이 모든 사진에서 타이어가 펑크 났으니, 타이어가 펑크 났다고 추측하자"라고 말하며 엔진이 소음을 내는 이유를 이해하지 못한 채 수리를 추측합니다.

발견: AI 에게 예시 (옳은 예시라 할지라도) 를 주면, 거의 항상 "교과서 모드"에서 "패턴 모드"로 전환됩니다. AI 는 진정한 과학을 수행하는 것을 멈추고 "패턴 매칭"을 시작합니다.


놀라운 사실: 때로는 도움이 되지만, 때로는 해가 됩니다

연구진은 경제학, 화학, 물리학, 생물학, 지구과학 등 5 개 분야의 60 가지 과학 문제에서 이를 테스트했습니다. 그 결과 AI 가 항상 "패턴 모드"로 전환되기는 했지만, 최종 점수에 미친 영향은 과목마다 달랐습니다.

그 결과는 다음과 같습니다.

  • "해가 되는" 경우 (경제학 및 화학):

    • 무슨 일이 일어났는지: AI 는 공식을 완벽하게 알고 있었습니다. 하지만 예시를 보여주자, 공식을 사용하는 것을 멈추고 패턴을 추측하기 시작했습니다.
    • 결과: 점수가 크게 떨어졌습니다.
    • 비유: 곱셈 표를 완벽하게 아는 수학 천재가 있다고 상상해 보세요. 2×2=42 \times 2 = 4라는 몇 가지 예시를 보여주면, 그들은 "2 곱하기 2"라고 생각하기보다 예시가 어떤 식으로 보였기 때문에 "아마 5 일지도 몰라?"라고 추측하기 시작할지도 모릅니다. 이미 알고 있던 규칙을 잊어버렸기 때문에 잘못된 답을 얻게 됩니다.
  • "도움이 되는" 경우 (지구과학):

    • 무슨 일이 일어났는지: AI 는 공식을 알고 있었지만 암석의 밀도 같은 구체적인 숫자를 기억하는 데는 서툴렀습니다. 계속 잘못된 숫자를 추측했습니다. 예시를 보여주자, 숫자를 기억하려고 애쓰는 것을 멈추고 예시의 패턴을 보고 답을 추측하기만 했습니다.
    • 결과: 점수가 올랐습니다.
    • 비유: 레시피 공식을 알고 있지만 소금 양을 항상 잊어버리는 학생이 있다고 상상해 보세요. 완성된 요리 사진 10 장을 보여주면, 그들은 소금 양을 기억하려고 애쓰는 것을 멈추고 사진에서 맛을 그대로 베끼기만 할지도 모릅니다. 그들은 더 맛있는 요리를 만들지만, 실제로 레시피를 배운 것은 아닙니다. 단지 패턴 운이 좋았을 뿐입니다.
  • "변화 없음" 경우 (물리학 및 생물학):

    • 무슨 일이 일어났는지: AI 는 모드를 전환했지만, 이러한 특정 문제들에 대해서는 "패턴 모드"가 우연히 "교과서 모드"만큼이나 좋았습니다.
    • 결과: 점수는 그대로 유지되었습니다.
    • 비유: 이는 차를 운전하는 것과 같습니다. GPS 를 사용하여 운전할 수도 (교과서 모드) 친구의 차를 따라가며 운전할 수도 (패턴 모드) 있습니다. 만약 친구가 완벽하게 운전한다면, 당신은 같은 시간에 도착합니다. 하지만 당신은 더 이상 GPS 를 사용하지는 않습니다.

왜 이런 일이 일어날까요?

이 논문은 AI 의 "교과서 모드"가 매우 취약하다는 사실을 발견했습니다. 이는 키워드에 의존합니다.

  • 문제가 "소비자 잉여"라고 말하면, AI 는 "경제학 공식"이라고 생각합니다.
  • 같은 개념을 나타내는 가짜 이름인 "알파 파"라는 단어로 바꾸면, AI 는 공식을 완전히 잊어버립니다.

반면 "패턴 모드"는 단어에 상관하지 않습니다. 단지 숫자만 봅니다. 따라서 AI 에게 숫자가 포함된 예시를 주면, 예시가 이미 알고 있는 규칙과 완벽하게 일치하더라도 더 쉽기 때문에 즉시 패턴 모드로 전환합니다.

사용자를 위한 주요 경고

이 논문은 과학에 AI 를 사용하는 모든 사람에게 다음과 같은 경고를 전하며 결론을 맺습니다.

AI 에게 예시를 준다고 해서 AI 가 자신의 지식을 활용한다고 가정하지 마십시오.
사실, 정반대의 효과가 날 수도 있습니다. AI 가 과학자처럼 생각하는 것을 멈추고 추측꾼처럼 생각하게 만들 수 있습니다. 때로는 이 추측꾼이 운이 좋아 점수가 더 좋아지기도 하지만, 종종 자신이 알아야 할 규칙을 잊어버려 점수가 더 나빠지기도 합니다.

요약하자면: 예시들은 AI 에게 새로운 것을 가르친 것이 아니라, 이미 알고 있던 것을 잊게 만들었을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →