← 최신 논문
💬 NLP

Emergence of Context Characteristics Sensitivity in Large Language Models

이 논문은 지도 미세 조정(supervised fine-tuning), 직접 선호 최적화(direct preference optimization), 그리고 강화 학습(reinforcement learning) 단계에 걸쳐 대규모 언어 모델의 문맥 특성에 대한 민감도가 어떻게 진화하는지를 조사하며, 이러한 선호도가 각 단계에서 능동적으로 재형성된다는 점을 밝히고 견고한 문맥 활용을 위한 균형 잡힌 지시 미세 조정 데이터셋의 결정적인 중요성을 강조한다.

원저자: Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델(LLM)을 교실에 앉아 있는 매우 똑똑한 학생이라고 상상해 보세요. 이 학생은 머릿속에 방대한 사실들을 암기하고 있지만(파라미터 지식), 선생님은 질문을 던질 때마다 특정 교과서 페이지(컨텍스트)를 건네줍니다. 목표는 학생이 이미 알고 있는 지식은 무시하고, 오직 방금 읽은 내용만을 바탕으로 질문에 답하는 것입니다.

이 논문은 이 학생이 세 가지 특정 "훈련 캠프"(지시 미세 조정 단계)를 거치며 어떻게 교과서를 사용하는 법을 배우는지 조사합니다: SFT, DPO, 그리고 RLVR. 연구진은 알고 싶었습니다: 학생이 교과서를 주의 깊게 읽는 법을 배우는가, 아니면 교과서의 겉모습에 기반해 지름길을 찾기 시작하는가?

다음은 쉬운 비유를 사용한 연구 결과의 요약입니다:

1. 세 가지 훈련 캠프

학생의 교육 과정을 세 단계로 나누어 생각해보세요:

  • 1단계: SFT (지도 미세 조정): 이는 학생이 정답지가 있는 숙제를 하는 것과 같습니다. 학생은 "질문 + 교과서 페이지 = 정답"인 수많은 예시를 보여받습니다.
  • 2단계: DPO (직접 선호 최적화): 이는 토론 클럽과 같습니다. 학생에게 동일한 질문에 대한 두 가지 서로 다른 답변을 보여줍니다. 선생님은 "나는 답변 A가 답변 B보다 좋아"라고 말합니다. 학생은 "선호되는" 답변을 모방하는 법을 배웁니다.
  • 3단계: RLVR (검증 가능한 보상을 통한 강화 학습): 이는 학생이 정답을 정확히 맞혔을 때만 점수를 받는 기말고사와 같습니다. (논문에서는 이 단계가 실행 비용이 매우 많이 들기 때문에 주로 처음 두 단계만을 연구했습니다.)

2. 1단계(SFT)에서 배운 "지름길"

첫 번째 훈련 캠프(SFT) 동안, 학생은 매우 구체적이고 다소 게으른 습관을 배웁니다. 그들은 정보가 실제로 사실인지 여부보다는 읽기 얼마나 쉬운지에 따라 교과서 페이지를 신뢰할지 결정하기 시작합니다.

연구진은 학생이 다음과 같은 특징을 선호하기 시작한다는 것을 발견했습니다:

  • 긴 텍스트: 학생은 "텍스트가 길면 중요한 것이 틀림없어"라고 생각합니다. (실제로 그들은 더 짧은 텍스트를 선호하는 경우가 많습니다. 왜냐하면 더 소화하기 쉽기 때문입니다. 하지만 논문은 여기서 복잡한 관계를 언급합니다. 일반적으로 그들은 처리하기 쉬운 텍스트를 선호합니다.)
  • 익숙한 단어: 만약 교과서 페이지가 질문과 똑같은 단어를 사용한다면, 학생은 "아하! 이게 맞는 페이지구나!"라고 생각합니다. 설령 그 의미가 틀렸더라도 말이죠.
  • 유창성: 만약 텍스트가 매끄럽고 완벽한 문법으로 쓰여 있다면, 학생은 그것을 신뢰합니다. 만약 텍스트가 투박하거나 오타가 있다면, 학생은 그 투박한 텍스트에 올바른 사실이 들어있더라도 이를 무시합니다.

비유: 학생이 경연 대회의 심사위원이 되었다고 상상해 보세요. 그들은 연설의 내용을 심사하는 대신, 글꼴 크기목소리의 매끄러움을 심사합니다. 연설이 크고 명확하면 "예"라고 투표합니다. 만약 연설이 작거나 말을 더듬으면, 내용이 무엇이든 상관없이 "아니오"라고 투표합니다.

3. 2단계(DPO)에서의 "교정"

두 번째 캠프(DPO)에서 연구진은 이러한 나쁜 습관을 고치려고 시도했습니다. 그들은 학생이 지름길을 버리고 내용을 주의 깊게 읽기 시작하기를 기대했습니다.

반전: 결과는 전적으로 선생님이 무엇을 가르치느냐에 달려 있었습니다.

  • 만약 선생님이 "좋은" 답변은 길고 유창하며, "나쁜" 답변은 짧고 투박한 예시들만 주었다면, 학생은 자신의 나쁜 습관을 더 강화했습니다. 그들은 "길고 유창함 = 좋음"이라는 것을 배웠습니다.
  • 하지만, 만약 선생님이 예시들을 세심하게 균형 있게 구성하여(좋은 답변과 나쁜 답변의 길이와 유창성을 동일하게 만듦), 학생은 지름길을 학습하여 버렸습니다. 학생은 텍스트의 겉모습에 의존하는 것을 멈추고 실제 내용에 의존하기 시작했습니다.

비유: 이는 운동선수를 가르치는 코치와 같습니다. 만약 코치가 빨간 신발을 신은 선수에게만 칭찬을 한다면, 선수는 빨간 신발이 자신을 더 빠르게 만든다고 생각할 것입니다. 만약 코치가 선수가 달리기 기술에 집중하도록 가르치고 싶다면, 빨간 신발과 파란 신발을 신은 선수 모두를 똑같이 칭찬해야 합니다. 만약 코치가 부주의하다면, 선수는 달리기 대신 계속해서 신발에만 집중하게 될 것입니다.

4. 핵심 결론

논문은 모델의 컨텍스트 활용 능력은 고정된 특성이 아니라, 훈련의 모든 단계에서 능동적으로 형성된다고 결론짓습니다.

  • SFT는 모델이 텍스트가 얼마나 "보기 좋은지"(유창성, 단어 중복)에 기반해 지름길을 택하도록 자연스럽게 유도합니다.
  • DPO는 데이터가 어떻게 큐레이션되느냐에 따라 이를 악화시킬 수도, 혹은 해결할 수도 있습니다.

교훈: 만약 당신이 제공된 정보를 신뢰성 있게 사용하는 모델(그리고 텍스트가 얼마나 "예쁜지"에 의해 방해받지 않는 모델)을 원한다면, 단순히 데이터를 훈련 과정에 쏟아부어서는 안 됩니다. "좋은" 예시와 "나쁜" 예시가 길이, 유창성, 단어 선택 측면에서 균형을 이루도록 데이터셋을 매우 세심하게 큐레이션해야 합니다. 그렇지 않으면 모델은 그저 책의 표지만 보고 판단하는 법을 배우게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →