← 최신 논문
💬 NLP

CoRect: Context-Aware Logit Contrast for Hidden State Rectification to Resolve Knowledge Conflicts

이 논문은 RAG(검색 증강 생성) 과정에서 모델의 내부 지식이 검색된 정보보다 우선시되어 발생하는 지식 충돌 문제를 해결하기 위해, 레이어별 로짓 대비(Logit Contrast)를 통해 파라미터 편향이 높은 층을 식별하고 은닉 상태(Hidden State)를 교정하여 답변의 충실도를 높이는 **CoRect** 방법론을 제안합니다.

원저자: Xuhua Ma, Richong Zhang, Zhijie Nie

게시일 2026-02-10
📖 2 분 읽기☕ 가벼운 읽기

원저자: Xuhua Ma, Richong Zhang, Zhijie Nie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제 상황: "고집불통 천재 학생" (Knowledge Conflict)

상상해 보세요. 아주 똑똑하지만 고집이 엄청 센 학생이 있습니다. 이 학생은 책을 엄청나게 많이 읽어서 머릿속에 지식이 가득합니다.

그런데 이 학생에게 새로운 시험지를 줬어요. 시험지에는 **"올해 축구 우승팀은 A팀이다"**라고 적혀 있습니다. 하지만 이 학생의 머릿속에는 예전에 읽은 책 내용인 **"축구 우승팀은 B팀이다"**라는 정보가 아주 강하게 박혀 있습니다.

결과가 어떻게 될까요? 학생은 시험지에 적힌 내용을 읽고 있으면서도, 정작 답을 쓸 때는 자기 머릿속에 있는 고집(기존 지식)을 부리며 **"B팀"**이라고 답해버립니다. 이것을 논문에서는 **'지식 충돌(Knowledge Conflict)'**이라고 부릅니다.

2. 기존 방식의 한계: "입만 막는 처방전" (Decoding-time Intervention)

기존에는 이 문제를 해결하려고 학생이 답을 다 쓰고 난 뒤에, 선생님이 옆에서 **"야, B라고 쓰지 말고 A라고 써!"**라고 답안지를 강제로 수정하는 방식을 썼습니다.

하지만 이 방식은 두 가지 문제가 있습니다.

  1. 부자연스러움: 억지로 답을 바꾸다 보니 문장이 어색해지거나 말이 안 되는 경우가 생깁니다. (예: "B팀이 우승했다"를 억지로 "A팀이 우승했다"로 바꾸면 문법이 꼬일 수 있음)
  2. 근본 원인 방치: 학생의 머릿속에서 왜 그런 잘못된 생각이 일어나는지는 전혀 고치지 못합니다.

3. CoRect의 해결책: "생각의 흐름을 바로잡는 가이드" (Hidden State Rectification)

이 논문에서 제안하는 CoRect는 방식이 완전히 다릅니다. 선생님이 답안지를 고치는 게 아니라, 학생이 **생각을 하는 과정(뇌의 회로)**에 개입합니다.

논문 저자들은 학생의 뇌(모델의 내부 층)를 관찰했더니, 중간 단계까지는 "아, 시험지에 A라고 적혀 있네?"라고 잘 이해하다가, 마지막 단계에서 갑자기 자기 고집(기존 지식)이 튀어나와 생각을 덮어버리는 현상을 발견했습니다. 이를 **'파라메트릭 억제(Parametric Suppression)'**라고 부릅니다.

CoRect의 작동 단계:

  1. "진짜 정답 후보 찾기" (Token Selection): 학생이 멍하니 있지 않도록, 시험지(컨텍스트)를 다시 한번 꼼꼼히 보게 해서 "아, 정답은 A일 확률이 높겠구나!"라는 힌트를 먼저 찾아냅니다.
  2. "고집 부리는 회로 차단하기" (Hidden State Rectification): 학생이 생각을 이어가다가 갑자기 "아니야, 내 기억엔 B야!"라고 고집을 부리려는 **특정 뇌 회로(FFN 레이어)**를 찾아냅니다. 그리고 그 회로가 내뱉는 '고집스러운 신호'만 살짝 약화시켜서, 시험지의 내용이 자연스럽게 흘러나올 수 있도록 길을 터줍니다.

요약하자면?

  • 기존 방식: "답이 틀렸으니 억지로 고쳐 써!" (결과만 수정 \rightarrow 어색함)
  • CoRect 방식: "네 머릿속 고집이 지금 방해하고 있어. 그 생각만 잠시 접어두고 시험지에 적힌 대로 자연스럽게 말해봐." (생각 과정을 교정 \rightarrow 자연스럽고 정확함)

결론적으로, CoRect는 AI가 눈앞의 근거(데이터)를 무시하고 자기 고집(학습된 데이터)을 부리는 '환각(Hallucination)' 현상을, AI의 내부 사고 과정을 미세하게 조정함으로써 훨씬 더 똑똑하고 정직하게 만드는 기술입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →