← 최신 논문
💬 NLP

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

이 논문은 거대 언어 모델이 의미를 보존하는 패러프레이징(의미를 유지한 채 문장을 바꾸는 것)에 직면했을 때 답변에서 상당한 불안정성을 보이는 경우가 많다는 것을 밝히며, 이는 표준 정확도 지표가 신뢰성 문제를 은폐할 수 있음을 입증하고 자기 패러프레이징 전략이 잠재된 지식을 회복하여 성능을 향상시키는 데 효과적일 수 있음을 보여준다.

원저자: Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 로봇이라는 환상

당신이 거의 모든 책을 읽은 매우 똑똑한 로봇 친구와 대화하고 있다고 상상해 보세요. 당신이 간단한 질문을 던지자, 로봇은 아주 훌륭하고 정답인 답변을 내놓습니다. 당신은 확신이 생기죠, 그렇죠? 하지만 만약 당신이 단어를 약간만 바꿔서 똑같은 질문을 다시 한다면 어떻게 될까요? 로봇은 여전히 같은 답을 할까요? 이것이 메릴랜드 대학교의 컴퓨터 과학자들이 발표한 새로운 연구 뒤에 숨겨진 핵심 질문입니다. 이들은 챗봇과 같은 도구들의 뒤에 있는 초지능적인 AI 두뇌인 '대규모 언어 모델(LLM)'을 살펴보고 있습니다. 이 모델들은 테스트에서 정확한 것으로 유명하지만, 이 연구는 까다로운 질문을 던집니다. 이들이 실제로 신뢰할 수 있는 것인가, 아니면 그저 질문이 어떻게 표현되느냐에 따라 답을 잘 추측하는 것뿐인가? 이것을 연습 문제를 토씨 하나 틀리지 않고 외운 학생에 비유해 보세요. 만약 질문의 문구가 아주 조금만 바뀌어도, 그 학생은 여전히 답을 알고 있을까요, 아니면 혼란에 빠질까요? 연구진은 이 AI 모델들이 세상을 진정으로 이해하고 있는 것인지, 아니면 그저 '단어 맞추기' 게임을 하고 있는 것인지 알아내고자 했습니다.

같은 질문, 틀린 답

연구진은 소규모 오픈 소스 모델부터 거대 기술 기업들이 사용하는 거대하고 강력한 모델에 이르기까지 13개의 서로 다른 AI 모델을 대상으로 게임을 진행하기로 했습니다. 그들은 실제 세상의 사실에 관한 질문(예: "안데르센은 1864년에 체스 경기에서 몇 번 졌는가?")과 수학 문제를 가져온 뒤, 이를 수십 가지의 다양한 방식으로 다시 써서 모델들에게 똑같은 질문을 던졌습니다. 그들은 새로운 질문들이 "어떻게 지내?"와 "무슨 일이야?" 또는 "잘 지내?"처럼 의미는 같지만 표현 방식만 다른 것처럼, 원래의 의미를 정확히 유지하도록 만들었습니다.

여기서 그들이 발견한 놀라운 반전이 있습니다: AI 모델들은 종로히 일관성이 없었습니다. 질문의 의미는 동일함에도 불구하고, 모델들은 처음에는 답을 맞혔다가 질문이 재구성되었을 때 틀리기도 했습니다. 실제로 많은 질문에서 모델들은 질문의 표현 방식에 따라 정답과 오답 사이를 오갔습니다. 연구에 따라 모델이 같은 질문에 대해 다른 답을 내놓는 '불일치율(mismatch rates)'은 23% 이상에 달할 수 있었습니다. 이는 만약 당신이 모델에게 같은 질문을 다른 방식으로 100번 던진다면, 모델이 이미 정답을 알고 있음에도 불구하고 거의 4번 중 1번꼴로 다른 (그리고 틀린) 답을 내놓을 수 있다는 것을 의미합니다!

"숨겨진 지식"의 격차

이 이야기가 AI가 실제로 무엇을 "알고 있는지"에 대해 말해주는 가장 매혹적인 부분입니다. 연구진은 모델들이 종종 올바른 답을 내면에 숨기고 있다는 사실을 발견했습니다. 질문을 충분히 다양한 방식으로 던지면, 모델은 결국 적어도 한 번은 정답을 맞혔습니다. 이는 지식은 존재하지만, 모델이 그것을 인출(retrieving)하는 능력이 불안정하다는 것을 시사합니다.

이를 시각화하기 위해, 한 학생이 시험을 치르는 상황을 상상해 보세요.

  • 표준 정확도: 학생이 첫 시도에서 80%를 맞힙니다.
  • 신뢰할 수 있는 능력: 당신이 질문을 어떤 방식으로 던지더라도 매번 80%를 맞힙니다.
  • 잠재적 능력: 질문을 10가지 방식으로 던지면 적어도 한 번은 정답을 맞힙니다.

연구는 "신뢰할 수 있는 능력"과 "잠재적 능력" 사이에 거대한 격차가 있음을 발견했습니다. 모델들은 답을 알고 있었지만(잠재적), 그것을 일관되게 보여주는 데는 실패했습니다(신뢰할 수 있는). 어떤 경우에는 질문을 다른 방식으로 던지기만 해도 추가로 **30%**의 질문을 더 맞힐 수 있었음에도 불구하고, 표준 테스트에서는 그러지 못했습니다. 이는 우리가 보는 표준 "정확도" 점수가 많은 불안정성을 숨기고 있을 수 있음을 의미합니다. 모델들이 반드시 멍청한 것은 아닙니다. 그들은 그저 취약할 뿐입니다. 그들은 깊고 견고한 이해보다는 특정 단어 패턴에 의존하고 있습니다.

"뒤집힘"과 "해결책"

연구진은 또한 "플립 레이트(flip rates, 뒤집힘 비율)"라고 불리는 현상도 살펴보았습니다. 이것은 모델이 처음에는 질문에 맞았지만, 질문을 재구성했을 때 틀리는 경우를 말합니다. 혹은 더 혼란스럽게도, 처음에는 틀렸다가 질문을 재구성했을 때 맞히는 경우를 뜻하기도 합니다. 이러한 "갈팡질팡하는(flip-flopping)" 행동은 모델의 두뇌가 흔들리고 있음을 보여줍니다. 이것은 마치 나침반을 한 방향으로 들고 있을 때는 북쪽을 가리키다가, 살짝 기울이면 동쪽을 가리키는 것과 같습니다.

하지만 희망의 빛도 있었습니다. 연구진은 **자기 재구성(Self-Paraphrasing)**이라는 간단한 기술을 시도했습니다. 모델에게 질문을 하나만 던지는 대신, 모델에게 질문을 자신의 언어로 먼저 다시 쓰게 한 뒤, 그 새로운 버전을 바탕으로 답하게 했습니다. 이것은 학생에게 "답하기 전에 머릿속으로 질문을 다시 읽어보렴"이라고 말하는 것과 같습니다. 이 간단한 단계는 모델이 그 숨겨진 잠재적 지식에 접근하도록 도움으로써 성능을 개선하고 격차를 줄이는 데 도움이 되었습니다.

이것이 미래에 의미하는 바

이 논문의 주요 시사점은 표준 정확도 점수가 오해를 불러일으킬 수 있다는 것입니다. 모델이 테스트에서 높은 점수를 받았다고 해서 그것이 실제 세상에서 진정으로 신뢰할 수 있다는 뜻은 아닙니다. 현실 세계에서 사람들은 온갖 기상천외한 방식으로 질문을 던지며, 만약 AI가 이를 처리하지 못한다면 실전에 투입될 준비가 되지 않은 것입니다. 이 연구는 우리가 단순히 "얼마나 많은 질문을 맞혔는가?"를 보는 것을 넘어, "얼마나 일관적인가?"를 묻기 시작해야 한다고 제안합니다.

저자들은 AI가 진정으로 신뢰받기 위해서는 다양한 표현 방식에 걸쳐 얼마나 일관성을 유지할 수 있는지에 대한 테스트를 거쳐야 한다고 주장합니다. 그때까지 우리는 이 로봇들이 정말로 얼마나 똑똑한지 과대평가하고 있을지도 모릅니 다. 그들은 대본을 암기하는 데는 탁월할지 모르지만, 여전히 흐름을 놓치지 않고 즉흥적으로 대처하는 법을 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →