← 최신 논문
💬 NLP

Learning When to Trust via Selective Context Preference Optimization

이 논문은 선택적 신뢰를 위한 벤치마크인 MIST를 소개하고, 단순히 모든 외부 신호를 무시하는 것의 한계를 해결하기 위해, 모델이 유용한 정보나 무관한 정보를 올바르게 활용하는 능력은 보존하면서도 오도하는 문맥에 저항하도록 최적화하는 학습 방법인 SCOPE를 제안한다.

원저자: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 테이블 위의 단서만 보고도 모든 미스터리를 풀 수 있는 천재 탐정이라고 상상해 보십시오. 당신은 논리력이 매우 뛰어나서 머릿속으로 즉시 수수께끼의 답을 찾아낼 수 있습니다. 하지만 그때, 누군가 당신의 귀에 힌트를 속삭입니다. 때때로 이 힌트는 도움이 되어 올바른 해결책을 가리키기도 하지만, 다른 때에는 당신의 마음을 돌려 틀린 답을 고르게 하려고 설계된, 매우 설득력 있고 그럴싸한 거짓말입니다.

이것이 바로 현대의 "대규모 언어 모델(LLM)"의 세계입니다. 우리와 대화하고, 코드를 작성하며, 수학 문제를 푸는 초지능형 AI 두뇌들 말입니다. 이 모델들은 우리의 탐정과 같습니다. 매우 강력하지만, 아주 까다로운 습관이 하나 있습니다. 만약 당신이 질문을 던진 뒤, 도움이 되는 힌트처럼 보이지만 실제로는 틀린 문장을 덧붙인다면, 그들은 이전에는 정답을 알고 있었음에도 불구하고 혼란에 빠져 틀린 답을 내놓곤 합니다. 과학자들은 이를 "취약성(susceptibility)"이라고 부릅니다. 큰 문제는 이 AI 탐정들에게 어떻게 하면 거짓말쟁이는 무시하면서도 진실을 말하는 이의 말은 계속 듣도록 가르칠 것인가 하는 점입니다. 만약 우리가 그들에게 그냥 모두를 무시하라고 가르친다면, 그들은 좋은 힌트조차 듣지 않게 되어 쓸모없는 존재가 될 것입니다.

이 논문은 이 문제를 단순히 "어떻게 고집스러워질 것인가"가 아니라 "어떻게 선택적으로 반응할 것인가"의 문제로 다루며, 이를 테스트하고 훈련하는 새로운 방법을 소개합니다. 연구진은 MIST(Misleading Signal Testbed, 오도된 신호 테스트베드)라는 특별한 놀이터를 만들었습니다. MIST를 거대한 게임 쇼라고 생각해보십시오. 여기서 모든 참가자(AI)는 동일한 수수께끼에 네 번 직면합니다. 첫 번째 라운드에는 추가 힌트가 없습니다. 두 번째에는 교활한 거짓말쟁이가 틀린 답을 속삭입니다. 세 번째에는 도움이 되는 친구가 정답을 속삭입니다. 네 번째에는 수다쟁이가 전혀 상관없는 이야기를 늘어놓습니다. 이 네 가지 시나리오에 대한 AI의 반응을 관찰함으로써, 연구진은 누가 거짓말쟁이를 간파하면서도 친구의 말은 무시하지 않는 똑똑한 존재인지 알아낼 수 있었습니다.

그들은 놀라운 사실을 발견했습니다. 가장 거대한 초지능형 모델부터 작은 오픈 소스 모델에 이르기까지, 테스트한 거의 모든 AI 모델이 함정에 빠졌습니다. 그럴싸하지만 틀린 힌트가 추가되었을 때, 그들의 정확도는 현저히 떨어졌습니다. 심지어 "가장 똑똑한" 모델들조차 속아 넘어갔습니다. 이는 이 문제가 보편적이라는 것을 증명합니다. AI가 단순히 부주의한 것이 아니라, 도움이 되는 신호와 오도하는 신호를 구별하는 데 진정으로 어려움을 겪고 있다는 것입니다.

논문은 이 문제를 해결하는 기존 방식, 즉 AI를 "저항력" 있게 만들거나 모든 외부 힌트를 무시하도록 훈련시키는 방식이 잘못되었다고 주장합니다. 그것은 마치 탐정에게 거짓말쟁이를 피하기 위해 정직한 목격자까지 포함한 모든 목격자를 무시하라고 가르치는 것과 같습니다. 그 결과, 거짓말에는 안전하지만 사건을 해결하는 데는 무용지물이 된 탐정이 탄생하게 됩니다.

대신, 저자들은 SCOPE(Selective Context Preference Optimization, 선택적 문맥 선호 최적화)라는 새로운 훈련 방법을 제안합니다. 당신이 강아지를 훈련시킨다고 상상해 보십시오. 만약 나쁜 명령을 들었을 때만 벌을 준다면, 강아지는 아무의 말도 듣지 않게 될 수도 있습니다. 하지만 좋은 명령을 따랐을 때, 나쁜 명령을 무시했을 때, 그리고 날씨 이야기를 할 때 침착함을 유지했을 때 보상을 해준다면, 강아지는 누구의 말을 들어야 할지 똑똑하게 배우게 됩니다. SCOPE는 AI를 위해 똑같은 일을 수행합니다. AI의 실수(거짓말쟁이에게 속았을 때)를 가져와서, 그것을 AI가 정답을 맞혔던 순간(거짓말쟁이를 무시했거나 조력자의 말을 들었을 때)과 짝을 지어줍니다. 그런 다음 AI가 네 가지 상황 모두에서 "똑똑한" 선택을 선호하도록 가르칩니다.

결과는 유망합니다. SCOPE를 사용하여 몇몇 인기 있는 AI 모델을 훈련했을 때, 모델들은 거짓말쟁이를 식별하는 능력이 훨씬 좋아졌습니다. 그들은 틀린 힌트에 속는 것을 멈췄지만, 올바른 힌트를 사용하거나 지루한 잡담을 무시하는 능력은 잃지 않았습니다. 실제로 모델들은 원래의 수수께ź를 푸는 능력도 향상되었습니다. 연구진은 AI가 한 번도 본 적 없는 다른 퍼즐들로 테스트를 진행했고, "선택적 신뢰" 기술은 그대로 유지되었습니다. AI는 단순히 모든 것을 불신하는 법이 아니라, 언제 믿어야 하는지를 배웠습니다.

요컨대, 이 논문은 신뢰할 수 있는 AI의 미래가 모든 정보를 차단하는 벽을 쌓는 데 있지 않다고 제안합니다. 그것은 AI에게 비판적 사고를 가르치는 것입니다. 즉, 진실에는 귀를 기울이고, 거짓은 무시하며, 소음이 커질 때도 집중력을 유지하는 법을 가르치는 것입니다. 연구진이 문제를 완벽하게 해결한 것은 아닙니다(여전히 까다로운 거짓말은 AI를 속입니다). 하지만 그들은 명확한 방향을 제시했습니다. AI를 고집스럽게 만드는 대신, 지혜로워지도록 가르치십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →