← 최신 논문
🤖 AI

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

본 논문은 대규모 언어 모델이 암기된 실세계 패턴에 독립적으로 견고한 논리적 추론 능력을 갖췄는지 평가하기 위해 실세계 시나리오를 논리적으로 일관되지만 부조리한 맥락으로 체계적으로 변형하는 벤치마킹 프레임워크인 'Absurd World'를 소개합니다.

원저자: Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 인터넷에 있는 거의 모든 책, 기사, 웹사이트를 읽은 매우 똑똑한 로봇 비서가 있다고 가정해 봅시다. 여러분이 간단한 질문을 합니다: "사과 3 개를 가지고 있는데 1 개를 먹으면 몇 개가 남나요?" 로봇은 즉시 "2 개"라고 답합니다. 완벽해 보입니다.

하지만 여러분이 로봇에게 "이 마법 세계에서는 사과를 먹으면 실제로 사과를 하나 더 얻는다"고 말한다면 어떨까요? 인간은 즉시 새로운 규칙을 이해하고 "알겠습니다, 그럼 저는 사과 4 개를 가지고 있네요"라고 말할 것입니다. 하지만 이 논문은 현재의 많은 AI 비서들이 혼란에 빠질 수 있다고 제안합니다. 그들은 새로운 규칙을 무시하고 "현실 세계"에서 기대하는 대로 단순히 "2 개"라고 말할지도 모릅니다.

이 논문은 AI 가 실제로 여러분의 규칙을 따를 수 있는지, 아니면 단순히 현실 세계가 일반적으로 어떻게 작동하는지에 대한 자신의 기억을 맹목적으로 따르는지 확인하기 위한 새로운 테스트 장인 **부조리 세계 (Absurd World)**를 소개합니다.

핵심 아이디어: "마법 축구" 게임

연구자들은 페널티 킥을 기반으로 한 간단한 게임을 만들었습니다. 일반적인 게임에서는 공을 네트 안으로 차면 점수를 얻고, 놓치면 아무것도 얻지 못합니다.

부조리 세계에서는 이 익숙한 게임을 가져와 규칙을 조금 비틀어, 인간에게는 여전히 이해하기 쉽지만 AI 에게는 기이한 "부조리" 버전을 만들었습니다:

  • "놓침" 규칙: 이 버전에서는 네트를 놓치면 점수를 얻고, 네트에 맞으면 0 점입니다.
  • "최소" 규칙: 가장 낮은 점수를 가진 팀이 승리합니다.
  • "아이스크림" 규칙: 점수 대신 팀은 아이스크림 콘을 얻습니다.
  • "교환" 규칙: 팀들은 공을 향해 네트를 쏩니다 (사물의 역할을 바꿈).

목표는 수학을 어렵게 만드는 것이 아니었습니다. 수학은 여전히 단순한 셈에 불과했습니다. 목표는 AI 가 현실 세계의 훈련을 무시하고 프롬프트에 제공된 기이하고 새로운 지시를 엄격히 따를 수 있는지 확인하는 것이었습니다.

테스트 방법

그들은 미친 과학자처럼 행동하여 표준 축구 게임을 구성 요소로 분해했습니다:

  1. 기호: 선수들, 공, 네트.
  2. 행동: 맞추거나 놓치는 것.
  3. 규칙: 점수가 어떻게 매겨지고 누가 승리하는지.

그런 다음 이 블록들을 교환하여 수백 개의 "부조리" 시나리오를 만들었습니다. 그리고 다양한 AI 모델에게 경기의 짧은 이야기를 읽고 승자를 선언하도록 요청했습니다.

놀라운 결과

이 논문은 이러한 AI 들이 얼마나 "똑똑한지"에 대해 다시 생각하게 만들 수 있는 세 가지 주요 사실을 발견했습니다:

1. "비싼" 모델이 실제로는 더 나빴습니다
가장 비싸고 강력한 AI 모델이 새로운 규칙을 따르는 데 가장 뛰어나다고 생각할 수 있습니다. 놀랍게도 "저렴한" 모델이 종종 "비싼" 비추론 모델보다 더 잘 수행했습니다. 비싼 모델들은 자신의 머릿속에 갇힌 듯, 프롬프트에 실제로 적힌 내용보다는 실제 축구 경기에서 일어날 것이라고 생각한 내용에 지나치게 의존하는 듯했습니다.

2. "추론" 모델이 챔피언이었습니다
"생각"하도록 특별히 설계된 모델들 (일반적으로 추론 모델이라고 함) 이 완벽한 점수를 받은 유일한 모델들이었습니다. 그들은 부조리한 규칙 ("놓치면 점수를 얻는다") 을 보고 "알겠습니다, 저는 현실 세계의 지식을 무시하고 이 새로운 규칙을 따르겠습니다"라고 말할 수 있었습니다. 그들은 마법에 혼란을 느끼지 않았습니다.

3. 예시를 주는 것이 역효과를 냈습니다
보통 AI 에게 무언가를 가르치고 싶을 때, 먼저 몇 가지 예시를 제공합니다 (이를 "퓨샷 프롬팅"이라고 합니다). "이것이 게임을 하는 방법의 예시입니다, 이제 여러분이 해보세요"라고 말할 수 있습니다.

  • 반전: 이 연구에서는 AI 에게 예시를 주는 것이 실제로는 성능을 악화시켰습니다. "옛날" 방식의 예시를 보는 것이 AI 가 "부조리" 규칙으로 전환하려 할 때 혼란을 준 것으로 보입니다. 마치 고양이 사진을 보여준 후 개를 그리게 하면, 그들은 계속해서 고양이 특징을 그리게 되는 것과 같습니다.

결론

이 논문은 AI 를 어렵고 복잡한 퍼즐로만 테스트하는 것을 멈춰야 한다고 주장합니다. 대신 기이한 규칙이 있는 단순한 작업으로 테스트해야 합니다.

만약 AI 가 "골을 놓쳐야 이긴다"는 간단한 규칙을 따를 수 없다면, 훈련 데이터에서 배운 것과 다른 규칙이 적용되는 더 복잡한 업무에 그것을 신뢰하는 것은 안전하지 않을 수 있습니다. 부조리 세계는 AI 가 진정으로 여러분을 듣고 있는지, 아니면 여러분이 들어야 한다고 생각하는 내용을 반복하고 있는지 확인하는 도구입니다.

간단히 말해: AI 가 현실 세계에 대해 모든 것을 안다고 해서 마법 세계에서는 여러분의 규칙에 따라 플레이할 수 있다는 뜻은 아닙니다. 이 논문은 어떤 AI 가 실제로 기어를 전환할 수 있고 어떤 AI 가 중립 기어에 갇혀 있는지 알아내기 위한 놀이터를 구축했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →