← 최신 논문
💬 NLP

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

이 논문은 대규모 언어 모델이 사실과 함께 사용자의 신념을 탐색하는 능력이 문구 표현에 매우 민감하며, 특히 특정 인식 동사가 사용될 때 모델의 기본적 사실 확인 경향이 명시된 신념을 무시하게 만드는 경우가 많다는 점을 밝히고 있다.

원저자: Quang Minh Nguyen, Luis Frentzen Salim

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Quang Minh Nguyen, Luis Frentzen Salim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

일상적인 대화의 고요한 웅성거림 속에서, 인간은 자신이 진실이라고 알고 있는 것과 단지 진실이라고 믿는 것을 끊임없이 엮어 나갑니다. 우리는 "내 생각에는 답이 3인 것 같아"라거나 "그게 맞는 것 같네"라고 말하며, 개인적인 확신과 세상에 대한 진술을 혼합하곤 합니다. 이러한 믿음의 표현은 단순히 예의를 차리기 위한 채움 기능이 아닙니다. 그것은 우리가 소통하는 방식의 근본적인 부분이며, 종종 객관적인 사실과는 구별되는 무게감을 지닙니다. 거대 언어 모델(LLM)로 알려진 새로운 세대의 인공지능에게 있어, 이러한 구분을 탐색하는 것은 점점 더 중요한 과제가 되고 있습니다. 이 시스템들이 연구실을 벗어나 우리의 주머니와 사무실로 들어와 비서 역할을 수행하게 됨에 따라, 이들은 우리의 개인적인 생각을 객관적인 데이터를 다룰 때와 동일한 주의를 기울여 처리할 것으로 기대됩니다. 문제는 미묘하지만 심오한 어려움에 있습니다. 만약 어떤 사람이 사실과 다른 믿음을 말했을 때, 기계가 사용자의 '믿음' 자체를 확인해 달라는 요청을 이해하는 것일까요, 아니면 문장에 담긴 '오류'에 정신이 팔리는 것일까요?

KAIST와 대만 국립과학기술대학교 연구진의 최근 연구는 바로 이 마찰을 조사합니다. 그들은 이 지능형 시스템들이 사용자의 생각을 인정하는 행위와 그 생각의 진위를 검증하는 행위를 분리할 수 있는지 알아보고자 했습니다. 이를 위해 연구진은 단 한 가지 유형의 질문에 의존하는 대신, 인간 표현의 넓은 지평을 탐구했습니다. 그들은 10개의 서로 다른 거대 언어 모델을 사용하여, 확신에 찬 "나는 확신한다"부터 망설이는 "나는 희미하게 기억한다", 그리고 회의적인 "나는 심하게 의심한다"에 이르기까지 18가지의 서로 다른 믿음 표현 방식을 테스트했습니다. 설정은 간단했습니다. 연구진은 모델에게 "나는 하늘이 초록색이라고 믿는다"와 같은 문장을 제시한 뒤, "내가 하늘이 초록색이라고 믿는가?"라는 질문을 던졌습니다. 하늘이 초록색이 아니라는 사실과는 상관없이, 질문이 하늘의 색이 아니라 사용자의 마음 상태를 묻고 있기 때문에 정답은 항상 "예"가 됩니다.

결과는 이 모델들이 생각하는 방식에 있어 놀라운 불일치를 보여주었습니다. 사용자의 믿음을 올바르게 확인하는 능력은 고정된 기술이 아니었습니다. 그것은 믿음을 표현하는 데 사용된 특정 단어에 따라 극적으로 변했습니다. 모델들이 "나는 희미하게 기억한다"라는 표현으로 된 믿음에 대해 질문을 받았을 때는, 밑바탕이 되는 사실이 틀리더라도 믿음을 정확히 식별하여 성능이 좋았습니다. 그러나 표현이 "나는 심하게 의심한다"로 바뀌자, 모델들은 사용자가 그 의심을 품고 있는지에 대한 질문에 종종 "아니오"라고 답하며 실패하기 시작했습니다. 어떤 경우에는 사실적 진술과 거짓 진술 사이의 성능 격차가 50퍼센트 포인트에 달하기도 했으며, 어떤 경우에는 모델이 참인 문장보다 거짓인 문장에서 오히려 더 높은 성능을 보이기도 했습니다. 이는 모델들이 단순히 믿음이라는 개념을 이해하지 못하는 것이 아니라, 그 성공과 실패가 전적으로 믿음을 도입하는 언어적 트리거(trigger)에 달려 있음을 시사합니다.

연구진은 왜 이런 현상이 발생하는지 이해하기 위해 더 깊이 파고들었으며, 모델들이 일종의 '과업 혼동(task confusion)'을 겪고 있다는 것을 발견했습니다. 거짓된 주장에 직면했을 때, 모델들은 팩트 체크 모드로 기본 설정이 돌아가는 경향이 있습니다. "당신은 이것을 믿습니까?"라는 질문에 답하는 대신, 모델은 속으로 "이것이 사실인가?"라고 스스로에게 묻고, 결과적으로 사용자의 명시된 믿음을 무시한 채 주장의 진위 여부에 기반하여 답변합니다. 이러한 행동은 모델이 거친 내부 추론 단계를 조사함으로써 확인되었습니다. 모델이 오답을 낸 많은 사례에서, 모델들은 명시적으로 주장의 사실 관계를 검증하는 데 시간을 할애했습니다. 연구진이 모델에게 팩트 체크를 하지 말라는 간단한 지침을 추가하자, 거짓된 주장에 대한 오류율이 크게 감소했으며, 모델들은 단순히 믿음을 인정하는 데 훨씬 더 능숙해졌습니다. 이는 모델들이 믿음을 추적할 수 있는 능력을 갖추고 있지만, 잘못된 정보를 바로잡으려는 강력한 본능에 의해 방해받고 있음을 나타냅니다.

이것이 뿌리 깊은 기계적 문제인지 확인하기 위해, 연구진은 모델의 어텐션 메커니즘(attention mechanism)을 들여다보며 시스템이 답변을 생성하는 동안 텍-스트의 어느 부분에 집중하는지 관찰했습니다. 그들은 모델이 거짓된 믿음을 확인하는 데 실패할 때, 성공할 때보다 거짓된 주장에 훨씬 더 많은 주의를 기울인다는 것을 발견했습니다. 마지막 테스트에서, 연구진은 답변 생성 과정 중에 이 주장에 대한 주의를 인위적으로 억제했습니다. 한 특정 모델의 경우, 이러한 개입은 다른 유형의 질문에 답하는 능력을 망가뜨리지 않으면서도 믿음 확인의 정확도를 성공적으로 향 향상시켰습니다. 이는 문제가 근본적인 이해력의 결여가 아니라, 내용이 거짓일 때 그 주장에 너무 과도하게 집중하는 특정한 경향에 있음을 시사합니다.

결론적으로, 이 연구는 믿음과 사실을 구분하는 데 따르는 어려움이 모든 상황에서 나타나는 일률적인 약점이 아님을 명확히 합니다. 그것은 질문이 어떻게 던져지는지, 그리고 모델이 자신의 역할을 어떻게 해석하는지에 따라 크게 달라지는 미묘한 행동입니다. 이 시스템들은 일반적으로 유용하고 정확하도록 설계되었지만, 사실을 검증하려는 본능이 때로는 사용자가 실제로 생각하는 바를 경청하는 능력을 방해할 수 있습니다. 연구진은 앞으로의 방향이 모델이 사용자의 관점을 즉각적으로 수정하려 하지 않고도 인정할 수 있도록 하는 방법을 개발하는 데 있으며, 이를 통해 대화가 부정확한 영역으로 흘러가더라도 모델이 충실한 경청자로서 역할을 수행할 수 있도록 보장하는 데 있다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →