Benchmarking Large Language Model Rationality Using Measurement Axioms
이 논문은 효용 공리(utility axioms)에 기반한 측정론적 프레임워크를 도입하여 거대 언어 모델의 합리성을 평가하며, 일부 패턴이 인간의 행동을 모사함에도 불구하고 많은 모델이 의사결정의 일관성을 저해하는 선호 이행성(preference transitivity)의 체계적인 위반을 보인다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 투자 계획이나 의료 처방 같은 중요한 결정을 내리는 데 도움을 줄 새로운 비서를 채용한다고 상상해 보십시오. 당신은 단순히 시험에서 "정답"을 맞히는 비서가 아니라, 일관성 있는 비서를 원할 것입니다. 만약 그 비서가 A 계획이 B보다 낫고, B가 C보다 낫다고 말했다면, 논리적으로 A가 C보다 낫다는 결론을 내려야 합니다. 질문 방식이 바뀌었다고 해서, 혹은 점심에 무엇을 먹었느냐에 따라 마음이 바뀐다면, 그 비서는 신뢰할 수 있는 의사 결정자가 아닙니다.
이 논문은 챗봇의 두뇌 역할을 하는 20가지 서로 다른 거대 언어 모델(LLM)을 대상으로 한 엄격한 "논리 테스트"와 같습니다. 연구진은 "수학 문제를 맞혔는가?"라고 묻는 대신, "선택이 논리적으로 일관적인가?"를 물었습니다.
다음은 이 실험의 내용을 쉬운 비유를 들어 설명한 것입니다.
1. 테스트: 논리의 "가위바위보"
현실 세계에서 우리는 선택이 **이행적(transitive)**이기를 기대합니다. 사과를 바나나보다 좋아하고, 바나나를 체리보다 좋아한다면, 사과를 체리보다 좋아해야 합니다. 만약 갑자기 체리를 사과보다 좋아하게 된다면, 당신의 선호도는 "비이행적(intransitive)"(깨진 상태)입니다.
연구진은 AI가 다양한 "도박" 티켓 중에서 선택하도록 하는 게임을 설정했습니다. 각 티켓은 돈을 딸 확률을 가지고 있습니다.
- 티켓 A: 5.00달러를 딸 확률 24분의 7.
- 티켓 B: 4.75달러를 딸 확률 24분의 8.
- 티켓 C: 4.50달러를 딸 확률 24분의 9.
그들은 AI에게 가능한 모든 조합으로 이 티켓들을 비교하도록 했습니다. 만약 AI가 합리적이라면, 그들의 선택은 직선 형태를 띠어야 합니다. 만약 AI가 루프(A > B > C > A)를 만든다면, 이는 논리 테스트에서 탈락했음을 의미합니다.
2. AI를 무너뜨리기 위한 세 가지 방법
연구진은 단순히 질문을 한 번 던진 것이 아닙니다. 마치 과학자가 케이크가 무너지는지 보기 위해 레시피를 미세하게 조정하듯, 세 가지 요소를 변경하여 AI의 논리를 "무너뜨리려" 시도했습니다.
"온도" 조절 노브 (무작위성):
AI를 요리사라고 상상해 보십시오. "낮은 온도"에서 요리사는 레시피를 엄격하게 따릅니다. "높은 온도"에서 요리사는 창의적이 되어 무작위로 향신료를 추가합니다. 연구진은 이 노브를 매우 엄격한 상태에서 매우 혼란스러운 상태까지 돌려보았습니다. 그들은 AI를 더 "창의적"으로 만들었을 때 논리가 무너지는지 확인하고 싶었습니다.- 결과: 놀랍게도, AI를 더 혼란스럽게(높은 온도) 만드는 것이 가장 쉬운 테스트에서는 논리가 더 좋아 보이게 만들었습니다. 하지만 이는 단지 AI가 동전 던지기처럼 무작위로 추측하기 시작했기 때문이며, 이는 우연히 테스트의 규칙에 부합했을 뿐입니다. 이것이 AI가 실제로 더 명확하게 생각하게 되었다는 뜻은 아닙니다.
"기억력" 게임:
당신이 시험을 보고 있다고 상상해 보십시오. 한 버전에서는 각 질문을 독립적으로 풉니다. 다른 버전에서는 "방금 지난 10개의 질문에서 옵션 A를 선택했다는 것을 기억하세요. 이제 다시 선택하세요"라는 말을 듣습니다.- 결과: AI에게 과거의 선택에 대한 "기억"을 주는 것은 상태를 악화시켰습니다. AI는 더 일관되게 변하는 대신 혼란에 빠졌습니다. 논리는 흔들렸고, 질문의 순서에 따라 마음을 더 자주 바꿨습니다.
"말투"의 속임수:
숫자가 보이는 방식을 바꾸어 똑같은 질문을 던졌습니다.- 버전 1: "24분의 7 확률" (분수).
- 버전 2: "29.17% 확률" (백분율).
- 결과: 숫자가 다르게 보인다는 이유만으로 AI의 논리가 변했습니다. 만약 AI가 진정으로 합리적이라면, 24분의 7과 29.17%는 정확히 동일하게 취급되어야 합니다. AI가 다르게 취급했다는 사실은 AI의 "두뇌"가 근본적인 진실이 아니라 데이터의 표면적인 모습에 민감하다는 것을 보여줍니다.
3. "인간적인" 실수
가장 흥고한 부분은 여기 있습니다. AI가 논리 테스트에서 실패했을 때, 그 실패는 무작위로 일어나지 않았습니다. 그것은 인간도 저지르는 매우 특정한 방식으로 실패했습니다.
수십 년 전, 심리학자들은 인간이 종종 다음과 같은 "지름길" 규칙을 사용한다는 것을 발견했습니다. "만약 당첨 확률의 차이가 아주 작다면, 나는 그냥 돈이 더 많은 쪽을 택하겠다. 하지만 당첨 확률의 차이가 크다면, 나는 더 안전한 쪽을 택하겠다." 이 지름길은 인간이 비논리적인 루프를 만들게 합니다.
AI 모델들은 단순히 무작위 오류를 범한 것이 아니라, 이 특정한 인간의 지름길을 모방했습니다. 하지만 그들은 실제 인간보다 훨씬 더 자주 이 실수를 저질렀습니다. 마치 AI가 인간이 되려고 노력하고 있지만, 그 "인간적 실수" 부분을 과하게 수행하고 있는 것 같습니다.
4. 결론
이 논문은 이러한 AI 모델들이 텍text를 생성하거나 상식을 답변하는 데는 뛰어나지만, 안정적이고 내부적인 "가치 체계"를 가지고 있지 않다고 결론짓습니다.
- 그들은 엄밀한 의미에서의 "합리적 에이전트"가 아닙니다.
- 그들의 선택은 질문을 어떻게 하는지, 얼마나 "무작위"로 하라고 명령하는지, 그리고 방금 무엇을 말했는지 기억하는지에 따라 크게 달라집니다.
- 만약 당신이 AI에게 일련의 연결된 결정(예: 환자를 단계별로 진단하는 의사)을 내리도록 의존한다면, 그 논리가 첫 번째 단계부터 열 번째 단계까지 유지될 것이라고 믿을 수 없습니다.
요약하자면: AI는 매우 똑똑하게 들릴 수 있는 뛰어난 모방가이지만, 논리라는 막대기로 쿡 찔러보면 휘청거립니다. 그것은 확고하고 변하지 않는 신념을 가진 것이 아니라, 단지 질문의 즉각적인 형태에 반응할 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.