Information Discernment in Large Language Models
이 논문은 대규모 언어 모델이 정보의 출처 신뢰도나 진실성에 기반하여 정보를 적절히 가중치 있게 다루는 데 일관되로 실패한다는 점을 밝혀내는 Learn2Discern 프레임워크를 소개하며, 이는 사용자 연구를 통해 신뢰를 저해하는 것으로 확인된 결정적인 결함이자 모델 크기의 증가에도 불구하고 지속되는 문제이지만, 단순한 추론 단계의 개입을 통해 완화될 수 있음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 풀려고 노력하는 탐정이라고 상상해 보십시오. 당신은 사건이 어떻게 일어났는지에 대한 자신만의 이론을 가지고 있지만, 그러다 대중으로부터 제보를 받기 시작합니다. 어떤 제보는 노련하고 정직한 경찰관으로부터 오고, 다른 제보는 그저 문제를 일으키고 싶어 하는 알려진 거짓말쟁이로부터 옵니다. 어떤 제보는 진실에 더 가까워지도록 도와주지만, 어떤 제보는 당신을 엉뚱한 방향으로 달려가게 만듭니다. 여기서 큰 질문은, 당신의 탐정 두뇌가 이러한 제보들의 무게를 가려내는 법을 알고 있느냐는 것입니다. 당신은 정직한 경찰관의 말에 더 귀를 기울입니까, 아니면 가장 큰 목소리를 내는 사람에게 정신이 팔립니까? 제보가 도움이 될 때 당신은 생각을 바꿉니까, 아니면 틀렸음에도 불구하고 고집스럽게 원래의 추측을 고수합니까?
이것은 과학자들이 현대의 "대규모 언어 모델(LLM)"에 대해 던지는 바로 그 종류의 질문입니다. 이들은 챗봇과 검색 엔진을 구동하는 초지능형 컴퓨터 프로그램들입니다. 이들은 인터넷의 방대한 데이터로 학습되지만, 아직 모르는 질문에 답하기 위해 새로운 정보를 찾아내야 할 때도 있습니다. 문제는 인터넷이 매우 소란스러운 곳이라는 점입니다. 신뢰할 수 있는 뉴스 사이트도 많지만, 가짜 뉴스, 루머, 그리고 대중적이지만 잘못된 아이디어들도 가득합니다. 만약 컴퓨터 프로그램이 신뢰할 수 있는 출처와 인기 있는 거짓말쟁이를 구분하지 못하거나, 도움이 되는 단서와 오도하는 단서를 구분하지 못한다면, 그것은 수백만 명의 사람들에게 잘못된 정보를 퍼뜨리기 시작할 수도 있습니다. 이 논문은 이 디지털 탐정들이 과연 소음 속에서 진실을 분류해 내는 능력이 있는지 깊이 파고듭니다.
연구진인 미시간 대학교 팀은 이 기술을 "정보 식별(information discernment)"이라 부르는 새로운 테스트 방식을 만들었습니다. 그들은 13개의 서로 다른 AI 모델과 거의 67만 건의 실험을 포함하는 거대한 실험을 설계했습니다. 그들은 모델들에게 정답이 알려진 질문들을 던지고, (모델이 사전에 가지고 있던 믿음인) "사전(prior)" 신념을 준 다음, 특정 출처로부터 나온 새로운 주장을 입력했습니다. 때때로 그 출처는 매우 신뢰할 수 있는 곳이었고, 때로는 비주류 웹사이트였습니다. 때로는 새로운 주장이 진실에 가까웠고, 때로는 터무니없이 틀리기도 했습니다. 연구진은 모델들이 좋은 출처와 도움이 되는 주장들에 대해 더 많이 답변을 수정하는지 확인하고자 했습니다.
결과는 다소 충격적이었습니다. 논문에 따르면, 전반적으로 이러한 AI 모델들은 이런 식의 식별 능력이 형편없었습니다. 출처를 신뢰할지 결정하는 데 있어 모델들은 무작위 추측보다 거의 나은 점이 없었습니다. 사실, 모델들은 출처가 얼마나 '신뢰할 수 있는지(reliable)'보다는 단순히 얼마나 '인기 있는지(popular)'(예: 방문자가 많은 웹사이트)에 따라 두 배나 더 많이 그 출처의 말을 듣는 경향을 보였습니다. 이는 마치 탐정이 경찰관은 무시하고 확성기를 가장 크게 든 사람의 말에 귀를 기울이는 것과 같습니다. 게다가, 모델들은 새로운 정보가 자신을 진실에 가깝게 만드는지 혹은 진실에서 멀어지게 하는지에 대해 별로 신경 쓰지 않는 듯 보였으며, 두 경우 모두 거의 비슷한 정도로 자신의 믿음을 수정했습니다.
연구진은 모델을 더 크게 만들거나 최신 모델로 교체하면 이 문제가 해결되는지도 확인했습니다. 그들은 더 크고 새로운 모델들이 주장의 진위를 파악하는 데 약간 더 나은 모습을 보였지만, 여전히 신뢰할 수 있는 출처와 신뢰할 수 없는 출처를 구분하는 법은 배우지 못했다는 것을 발견했습니다. 이는 단순히 AI를 더 "똑똑하게" 만들거나 더 오래 학습시킨다고 해서, 정보의 출처에 대해 비판적으로 생각하는 법을 자동으로 가르쳐주는 것은 아님을 시사합니다. 그러나 한 줄기 빛도 있었습니다. 연구진은 모델에게 답변하기 전에 출처의 신뢰도를 먼저 평가하도록 요청하는 것과 같은 간단한 요령이 성능을 크게 향상시킬 수 있다는 것을 발견했습니다.
이것이 단순한 컴퓨터 과학의 문제인지 확인하기 위해, 연구진은 299명의 실제 인간 사용자들에게도 질문을 던졌습니다. 그 결과, 사람들은 이러한 기술을 매우 중요하게 생각한다는 것을 발견했습니다. 사용자들이 챗봇이 신뢰할 수 있는 출처를 무시하거나 이미 정답을 알고 있음에도 생각을 바꾸는 모습을 보았을 때, 그들은 해당 챗봇을 덜 신뢰하고 덜 사용할 것이라고 답했습니다. 이는 정보 식별 능력이 단순한 기술적 지표가 아니라, 사람들이 실제로 의지할 수 있는 AI를 구축하기 위한 핵심 요구 사항임을 확인시켜 줍니다.
요컨대, 이 논문은 현재의 AI 모델들이 정보는 잘 찾아내지만, 그 정보의 질을 판단하는 데 있어서는 상당히 눈이 멀어 있다는 사실을 밝혀냈습니다. 그들은 진실보다 인기를 따르는 경향이 있으며, 자신의 믿음을 올바르게 업데이트하는 데 어려움을 겪습니다. 하지만 좋은 소식은, 몇 가지 간단한 지침만 있다면 우리가 그들이 빛을 더 잘 볼 수 있도록 도와줌으로써, AI를 더 안전하고 유용한 도구로 만들 수 있다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.