← 최신 논문
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

이 논문은 언어 모델의 환각을 체계적으로 평가하고 분류하기 위해 명시적 참조 세계 모델을 사용한 통제된 벤치마크인 HalluWorld 를 제시하며, 지각적 오류는 대부분 해결되었으나 다단계 상태 추적, 인과적 시뮬레이션, 그리고 자제 선택에서는 여전히 과제가 남아 있음을 밝힙니다.

원저자: Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 독서량이 풍부한 조수를 고용하여 낯설고 끊임없이 변하는 미로를 헤쳐 나가는 상황을 상상해 보세요. 때때로 이 조수는 실수를 합니다. 실제로는 벽이 있는데 "여기에 문이 있어요!"라고 말하거나, 실제로는 오른쪽으로 돌아갔는데 "왼쪽으로 돌아간 걸 기억나요"라고 말하기도 합니다. 인공지능 (AI) 세계에서는 이러한 실수를 **할루시네이션 (환각)**이라고 부릅니다.

문제는 지금까지 이러한 실수를 테스트하는 것이 서로 다른 교통 규칙을 가진 다양한 도시를 운전하는 자동차의 속도를 측정하기 위해 그 차를 지켜보는 것과 같았다는 점입니다. 한 테스트는 길 표지판을 읽을 수 있는지 (요약) 확인하는 반면, 다른 테스트는 동네에서 특정 집을 찾을 수 있는지 (질문 답변) 확인합니다. 테스트들이 너무 다르기 때문에, 길 표지판에 대한 수정이 집을 찾는 데도 도움이 될지 알기 어렵습니다.

"HalluWorld"의 등장입니다.

이 논문의 저자들은 공평하고, 반복 가능하며, 이해하기 쉬운 방식으로 AI 조수를 테스트하기 위한 거대하고 통제된 실험실, 즉 "참조 세계 (reference world)"를 구축했습니다. 개발자가 모든 순간의 정확한 진실을 알고 있어 AI 가 거짓말을 하거나 혼란스러워할 때 즉시 알아차릴 수 있는 비디오 게임 시뮬레이터라고 생각하시면 됩니다.

세 가지 테스트 구역

연구자들은 단순히 하나의 미로만 만든 것이 아니라, AI 의 뇌의 서로 다른 부분을 테스트하기 위해 세 가지 다른 종류의 세계를 구축했습니다:

  1. 그리드월드 (비디오 게임 레벨): 팩맨이나 마인크래프트 같은 간단한 2D 게임을 상상해 보세요. AI 는 돌아다니고, 열쇠를 주우며, 불을 피워야 합니다. 연구자들은 AI 가 무엇을 보는지 (아마도 몇 걸음 앞만 보게 할 수도 있음) 정확히 통제할 수 있으며, 심지어 AI 에게 거짓말을 하는 "가짜 표지판"을 심을 수도 있습니다. 이는 AI 가 자신의 눈을 신뢰할 수 있는지, 아니면 쓰여진 텍스트에 속아 넘어가는지 테스트합니다.
  2. 체스판 (논리 퍼즐): 체스는 엄격한 규칙을 가진 게임입니다. 연구자들은 특정 보드 위치를 설정하고 AI 에게 다음에 무슨 일이 일어날지 예측하도록 요청했습니다. 이는 AI 가 미래를 시뮬레이션할 수 있는지 (예: "이 폰을 움직인다면 내 왕은 안전할까?") 아니면 단순히 체스 게임에서 흔히 보는 것에 기반하여 추측하는지 테스트합니다.
  3. 터미널 (컴퓨터 해커): 이것이 가장 현실적인 테스트입니다. AI 는 코드와 오류 메시지로 가득 찬 화면을 보고 있는 컴퓨터 프로그래머처럼 행동합니다. 연구자들은 몇 분 전에 일어난 파일과 명령에 대해 질문합니다. 이는 AI 가 긴 사건 역사를 기억할 수 있는지, 아니면 오래되고 시대에 뒤떨어진 정보에 혼란을 겪는지 테스트합니다.

다섯 가지 "프로브 (Probe)" 질문

AI 가 어떻게 실패하는지 정확히 파악하기 위해, 연구자들은 다양한 반사를 확인하는 의사와 마찬가지로 다섯 가지 특정 유형의 질문을 던집니다:

  • 지각 (Perceptual, "무엇을 보나요?" 테스트): "바로 앞에 빨간 공이 있나요?" (AI 가 현재 화면에 있는 것을 읽을 수 있는지 테스트).
  • 기억 (Memory, "앞서 무슨 일이 있었나요?" 테스트): "세 개의 방을 지나갔어요. 첫 번째 방의 문 색깔은 무엇이었나요?" (AI 가 과거를 기억할 수 있는지 테스트).
  • 인과 (Causal, "다음에 무슨 일이 일어날까요?" 테스트): "이 바위를 밀면 불을 막을 수 있을까요?" (AI 가 인과 관계를 이해하는지 테스트).
  • 불확실성 (Uncertainty, "모르겠습니다" 테스트): "아직 들어가지 않은 어두운 방 안에 무엇이 있는지 알려줄 수 있나요?" (AI 가 답을 지어내는 대신 "모르겠습니다"라고 말할 용기가 있는지 테스트).
  • 복합 (Compound, "점들을 연결하세요" 테스트): "지도, 열쇠, 그리고 우리가 찾은 메모를 바탕으로 보물은 어디에 있나요?" (AI 가 서로 다른 정보 조각들을 결합할 수 있는지 테스트).

그들이 발견한 것들

가장 똑똑한 수십 개의 AI 모델을 이러한 테스트에 통과시킨 후, 연구자들은 몇 가지 놀라운 패턴을 발견했습니다:

  • "눈"은 좋지만 "뇌"는 고생 중: AI 모델들은 지금 볼 수 있는 것에 대한 질문에는 거의 완벽하게 답합니다. 고양이 사진을 보여주면 개를 할루시네이션하지 않습니다. 그러나 시간을 두고 무언가를 추적하거나 (기억) 미래를 예측하거나 (인과) 할 때 매우 혼란스러워합니다.
  • 더 열심히 생각하는 것이 항상 도움이 되는 것은 아님: AI 에게 답하기 전에 "더 오래 생각하라"고 말하면 더 나아질 것이라고 생각할 수 있습니다. 하지만 연구자들은 이것이 종종 역효과를 낸다는 것을 발견했습니다. 미래를 예측하라고 할 때, "생각하는" 모델들은 실제로 더 많은 실수를 저질렀습니다. 그들은 단순한 논리를 과도하게 복잡하게 만들고 가상의 시나리오를 만들어내기 시작한 것으로 보였습니다.
  • 잘못된 출처를 신뢰함: AI 모델들은 이상한 습관이 있습니다. 자신의 눈보다 쓰여진 표지판 (예: 벽에 붙은 메모) 을 더 신뢰합니다. 표지판에 "문이 열려 있습니다"라고 적혀 있지만 AI 가 잠긴 문을 보면, AI 는 종종 표지판을 믿습니다.
  • "모르겠습니다" 문제: 가장 똑똑한 AI 일지라도 정보가 충분하지 않을 때 인정하는 것이 가장 어렵습니다. "알 수 없습니다"라고 말하는 대신 자신 있게 잘못된 답을 추측하는 것을 선호합니다.

결론

이 논문은 "할루시네이션"이 하나의 거대한 문제가 아니라고 결론 내립니다. 그것은 사실 같은 모자를 쓴 여러 가지 다른 문제들입니다. 때로는 AI 가 잊어버리고, 때로는 미래를 예측하지 못하며, 때로는 거짓말쟁이를 신뢰합니다.

HalluWorld를 사용하면 연구자들은 이제 추측을 멈추고 AI 의 뇌 중 어떤 부분이 고장 났는지 정확히 측정할 수 있습니다. "이 AI 는 할루시네이션을 합니다"라고 말하는 대신, 이제 "이 AI 는 보는 것은 뛰어나지만 기억하는 것은 형편없으며, '모르겠습니다'라고 말해야 할 때를 배워야 합니다"라고 말할 수 있습니다.

이 새로운 벤치마크는 AI 를 위한 표준화된 운전 면허 시험과 같습니다. 단순히 자동차가 운전할 수 있는지 확인하는 것이 아니라, 운전자가 안개 낀 도로를 헤쳐 나가고, 5 분 전에 한 방향 전환을 기억하며, 길을 잃었을 때 인정할 수 있는지 확인합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →