A Unified Definition of Hallucination: It's The World Model, Stupid!
이 논문은 환각을 사용자에게 관찰 가능한 부정확한 내부 세계 모델링으로 정의하는 통합된 개념을 제안하며, 이 프레임워크가 기존의 정의들을 포괄하고, 참조 세계를 명시함으로써 평가 기준을 명확히 하며, 환각을 다른 유형의 오류와 구별하여 더 나은 벤치마킹 및 완화 전략을 용이하게 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하지만 약간 혼란스러워하는 로봇과 함께 '전화기 놀이(Telephone)'를 하고 있다고 상상해 보세요. 당신은 로봇에게 이야기, 그림, 또는 일련의 규칙을 주고 그것이 무엇인지 말해달라고 요청합니다. 가끔 로봇은 매우 자신감 있고 유창하게 말하지만, 사실은 완전히 지어낸 이야기를 합니다. 기술 세계에서는 이것을 **환각(hallucination)**이라고 부릅니다.
하지만 문제는, 무엇을 정확히 환각이라고 부를 것인가를 두고 모두가 논쟁한다는 점입니다.
- 만약 로봇이 뉴스 기사를 요약하다가 사실을 틀리게 말했다면, 그것은 환각일까요?
- 만약 로봇이 기억 속의 상식 퀴즈에 답하다가 틀렸다면, 그것은 환각일까요?
- 만약 로봇이 웹사이트에 존재하지 않는 버튼을 클릭하려고 시도한다면, 그것은 환각일까요?
어떤 연구자들은 이 모든 것에 대해 "예"라고 말합니다. 다른 이들은 "아니, 그건 그냥 실수일 뿐이야"라고 말합니다. 이러한 혼란은 문제를 해결하기 어렵게 만듭니다.
이 논문은 우리가 정의에 대해 논쟁하는 것을 멈추고, 근본 원인을 바라봐야 한다고 주장합니다. 저자들은 단순하고 통일된 아이디어를 제안합니다: 환각은 단지 고장 난 "세계 모델(World Model)"일 뿐이다.
핵심 아이디어: 로봇의 내부 지도
로봇을 도시를 탐험하려는 탐험가라고 생각해 보세요. 이를 위해 로봇은 지도(세계 모델)가 필요합니다.
- 참조 세계(The Reference World): 이것은 실제 지도입니다. 그것은 진실(ground truth)입니다. 그것은 당신이 준 뉴스 기사일 수도 있고, 체스의 실제 규칙일 수도 있으며, 회사의 실제 데이터베이스나 웹사이트의 실제 코드일 수도 있습니다.
- 로봇의 시야(The Robot's View): 이것은 로봇이 실제로 볼 수 있는 범위입니다. 로봇은 기사 전체를 볼 수도 있고, 아주 작은 부분만을 볼 수도 있습니다.
- 충돌 규칙(The Conflict Rule): 이것은 심판입니다. 만약 로봇의 기억은 "하늘은 초록색이다"라고 말하는데 기사는 "하늘은 파란색이다"라고 한다면, 누가 이길까요? 보통은 기사(참조 세계)가 이깁니다.
논문의 정의:
환각은 로봇의 출력이 충돌 규칙에 따라 참조 세계와 모순될 때 오직 발생합니다.
만약 로봇이 "하늘은 초록색이다"라고 말하는데, 참조 세계(기사)가 "하늘은 파란색이다"라고 한다면, 로봇은 고장 난 지도를 가지고 있는 것입니다. 이것이 환각입니다.
이것이 어떻게 모든 것을 통합하는가
저자들은 사람들이 말하는 모든 다양한 유형의 "환각"이 사실 서로 다른 방에서 일어나고 있는 동일한 현상임을 보여줍니다:
- 요약(Summarization): "참조 세계"는 원본 문서입니다. 만약 요약이 문서와 모순된다면, 그 문서를 바라보는 로봇의 지도가 잘못된 것입니다.
- 상식 퀴즈(Open QA): "참조 세계"는 우주의 실제 사실들(예: 누가 노벨상을 받았는가)입니다. 만약 로봇이 자신의 학습 내용에 근거해 잘못 추측한다면, 현실에 대한 로봇의 내부 지도가 잘못된 것입니다.
- 웹 브라우징(Agents): "참조 세계"는 실제 웹사이트 코드(DOM)입니다. 만약 로봇이 "제출 버튼을 클릭했다"라고 말했지만 코드상에 그런 버튼이 존재하지 않는다면, 로봇은 존재하지 않는 객체를 환각하고 있는 것입니다.
"바보 같은" 부분: 로봇이 아니라 지도 문제다
논문의 제목은 유명한 정치적 슬로건을 패러디한 "그것은 세계 모델, 바보야!(It's The World Model, Stupid!)"입니다. 저자들은 이렇게 말하고 있습니다: 로봇이 "혼란스러워한다"고 비난하는 것을 멈추세요. 문제는 로봇의 내부 지도가 부정확하다는 것입니다.
때때로 로봇은 "거짓말"을 하는 것이 아닙니다. 단지 잘못된 지도를 보고 있을 뿐입니다.
- 계획 오류(Planning Error): 로봇은 지도가 맞다는 것을 알지만, 나쁜 경로를 선택합니다. (환각이 아닙니다).
- 환각(Hallucination): 로봇은 지도가 "여기에 다리가 있음"이라고 말한다고 생각하지만, 실제 지도는 "절벽"이라고 적혀 있습니다. (이것이 환각입니다).
어떻게 해결할 것인가 (논문에 따르면)
이 논문은 우리가 "완벽한 로봇"을 만드는 데 집중하는 대신, 더 나은 테스트 환경을 구축해야 한다고 제안합니다.
그들은 로봇을 테스트하기 위해 합성 세계(synthetic worlds)(예: 비디오 게임이나 체스)를 사용하는 것을 제안합니다.
- 체스 비유: 체스 게임을 상상해 보세요. 규칙은 100% 명확하고 보드 상태는 100% 알려져 있습니다. 우리는 로봇에게 "흰색 나이트가 이 칸으로 점프할 수 있습니까?"라고 물을 수 있습니다.
- 만약 로봇이 "예"라고 답했는데 규칙이 "아니오"라면, 우리는 로봇의 체스판에 대한 내부 지도가 고장 났다는 것을 정확히 알 수 있습니다.
- "참조 세계"(체스 규칙)가 컴퓨터에 의해 완벽하게 정의되어 있기 때문에, 우리는 인간이 로봇이 거짓말을 하는지 추측할 필요가 없습니다. 컴퓨터는 즉시 알 수 있습니다.
이것이 왜 중요한가
이 정의에 합의함으로써, 연구자들은 마침내 다음을 할 수 있습니다:
- 동일한 기준으로 비교하기: 새로운 기술이 실제로 환각을 줄이는 것인지, 아니면 단순히 게임의 규칙을 바꾼 것인지 구분할 수 있습니다.
- 무엇을 고칠지 알기: 만약 로봇이 문서를 전체적으로 보지 못해서 환각을 일으키는 것이라면, 우리는 "시야(View)"를 수정합니다. 만약 로봇이 자신의 기억을 우선시하여 문서를 무시하기 때문에 환각을 일으키는 것이라면, 우리는 "충돌 규칙(Conflict Rule)"을 수정합니다.
- 더 큰 테스트 구축하기: 우리는 매번 인간이 채점할 필요 없이, 정답을 100% 확신할 수 있는 수천 개의 테스트 시나리오(수백만 개의 체스 퍼즐 같은)를 만들 수 있습니다.
요약하자면: 이 논문은 "환각이 무엇인지에 대해 논쟁하는 것을 멈추자"고 말합니다. 환각은 단순히 로봇의 이야기가 우리가 테스트하기로 합의한 현실과 일치하지 않는 상태를 의미합니다. 로봇의 고장 난 나침반을 고칠 수 있도록 더 나은 지도와 더 나은 테스트를 만듭시다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.