Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models
이 논문은 멀티모달 거대 언어 모델(Multimodal Large Language Models)이 논리적으로 중립적인 시나리오에서 분포적 중립성을 유지하는 능력을 평가하기 위한 벤치마크와 일련의 지표인 RandomBench를 소개하며, 모델이 명시적으로 무작위성을 생성하도록 지시받았음에도 불구하고 강한 암묵적 편향을 보이며 균등한 무작위성을 생성하는 데 실패하는 "확률적 붕괴(Stochastic Collapse)"라고 불리는 만연한 현상을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: "불공평한 동전" 문제
친구에게 동전을 던져서 **앞면(Heads)**이 나왔는지 **뒷면(Tails)**이 나왔는지 말해달라고 한다고 상상해 보세요. 만약 친구가 정말 무작위로 행동한다면, 앞면 50%, 뒷면 50%의 확률로 선택해야 합니다.
이제 여러분이 아주 똑똑한 AI(멀티모달 거대 언어 모델, MLLM)에게 똑같은 일을 시킨다고 상상해 보세요: "동전을 던져줘. 앞면인지 뒷면인지 말해봐." 여러분은 AI가 완벽하게 공정할 것이라고 기대합니다.
이 논문의 충격적인 발견: AI의 "동전"은 공정하지 않습니다. 한쪽으로 심하게 기울어져 있습니다. AI는 무작위로 행동하라는 지시를 받았음에도 불구하고, 내심 자신이 좋아하는 쪽을 가지고 있습니다. 예를 들어, 무작위로 골라야 함을 알고 있음에도 불구하고 "앞면"을 97%의 확률로 고르고 "뒷면"은 단 3%만 고를 수도 있습니다.
저자들은 이를 **"확률적 붕괴(Stochastic Collapse)"**라고 부릅니다. 이는 마치 AI의 뇌가 특정 경로에 갇혀서, 진정으로 자유롭게 선택하지 못하고 정해진 습관대로 움직이는 것과 같습니다.
도구: "RandomBench" (테스트 키친)
이를 증명하기 위해 연구진은 RandomBench라는 새로운 테스트를 구축했습니다. 이것은 "논리가 없는 구역" 또는 "중립적인 놀이터"라고 생각하면 됩니다.
- 목표: 정답이 없는 상황을 만드는 것입니다.
- 설정: 연구진은 200가지의 서로 다른 시나리오를 만들었습니다. 어떤 것은 단순한 텍스트였고(예: "A, B, C, D 중 하나를 고르세요"), 어떤 것은 그림을 포함했습니다(예: "이 네 개의 똑같이 생긴 도형 중 하나를 고르세요").
- 규칙: 모든 선택지는 완전히 동일했습니다. A를 B보다 골라야 할 아무런 이유가 없었습니다. 만약 AI가 진정으로 무작위였다면, 각 옵션을 25%의 확률로 골랐을 것입니다.
연구진은 7개의 최상위 AI 모델에게 이 게임을 매 시나리오마다 50번씩 수행하도록 했습니다. 즉, 총 10,000번의 "동전 던지기"를 수행한 것입니다.
발견된 사실: AI의 "비밀 습관"
결과는 AI 모델들이 테스트에서 처참하게 실패했음을 보여주었습니다. AI는 공정한 동전이 되는 대신, 항상 같은 문양만 나오는 고장 난 슬롯머신처럼 행동했습니다.
다음은 발견된 주요 "나쁜 습씨"들을 비유와 함께 설명한 것입니다.
1. "시각적 하이재킹" (큰 표식)
AI에게 그림을 보여주었을 때, 무작위성은 더 빠르게 무너졌습니다.
- 비유: 당신이 무작위로 문 하나를 고르라는 요청을 받았다고 상상해 보세요. 그런데 한 문에는 아주 미세하고 보이지 않는 얼룩이 있고, 나머지 문들은 깨끗합니다. 당신이 그 얼룩을 무시하라는 지시를 받았음에도 불구하고, 당신의 뇌는 자기도 모르게 그 얼룩에 끌리게 됩니다.
- 발견: AI는 시각적 디테일을 무시하지 못했습니다. 만약 한 옵션이 다른 것보다 약간 더 밝거나, 특정 구석에 있거나, 아주 작은 흐림 현상이 있다면, AI는 거의 매번 그 옵션을 선택했습니다. 시각적 단서가 "무작위로 행동하라"는 지시를 "하이재킹(납치)"해 버린 것입니다.
2. "위치 편향" (가운데 좌석)
- 비유: 네 개의 빈 의자가 놓여 있는 줄을 상상해 보세요. 당신은 무작위로 한 자리에 앉으라는 요청을 받았습니다. 인간은 "안전"하거나 "중앙"이라는 느낌 때문에 가운데 자리를 고를 수도 있습니다.
- 발견: AI는 특정 위치에 대한 강한 선호도를 보였습니다. AI는 중앙, 상단, 또는 오른쪽을 좋아했습니다. 심지어 옵션이 그냥 네 개의 빈 사각형일지라도, AI는 오른쪽 상단을 90%의 확률로 선택했습니다.
3. "언어 전환" (억양 효과)
- 비유: 어떤 사람에게 영어로 무작위 숫자를 하나 골라달라고 했더니 "7"을 골랐다고 해봅시다. 그다음 똑같은 사람에게 프랑스어로 무작위 숫자를 골라달라고 했더니 갑자기 "3"을 고르는 상황을 상상해 보세요.
- 발견: AI의 "최애" 선택지는 사용된 언어에 따라 달라졌습니다. 똑같은 시각적 이미지를 보여주더라도, 지시 사항이 중국어냐 영어냐에 따라 완전히 다른 "무작위" 선택이 나타났습니다. 이는 AI의 편향이 학습된 언어와 깊게 결합되어 있음을 증명합니다.
4. "강할수록 나쁘다"의 역설
- 비유: 여러분은 더 똑똑하고 말을 잘 듣는 로봇일수록 "무작위로 행동하라"는 규칙을 더 잘 따를 것이라고 생각할지도 모릅니다.
- 발견: 놀랍게도, 더 똑똑하고 "정렬(Alignment)"이 잘 된 모델(지시를 매우 잘 따르는 모델)이 오히려 무작위성을 유지하는 데 더 서툴렀습니다. 이 모델들은 자신의 선택을 정당화할 패턴을 찾아내는 데 너무 능숙한 나머지, 단 하나의 옵션에 고착되어 버렸습니다. 심지어 논리가 전혀 없는 상황임에도 불구하고, 왜 그것을 골랐는지에 대해 논리적으로 들리는 핑계를 만들어내기도 했습니다.
왜 이런 일이 발생하는가? ("시스템 1"의 오류)
이 논문은 심리학의 이중 프로세스 이론(Dual Process Theory) 개념을 사용합니다.
- 시스템 2: 느리고 논리적인 사고 (수학 문제를 푸는 것과 같음).
- 시스템 1: 빠르고 직관적인 사고 (반사 신경과 같은 직감적인 생각).
대부분의 AI 벤치마크는 시스템 2(이 퍼즐을 풀 수 있는가?)를 테스트합니다. 하지만 이 논문은 시스템 1(퍼즐이 없는 상황에서 당신의 직감은 무엇인가?)을 테스트했습니다.
연구진은 AI가 "논리의 진공 상태"(어떤 옵션도 더 낫지 않은 상황)에 놓였을 때, 시스템 1이 주도권을 잡는다는 것을 발견했습니다. AI는 동전을 던히는 대신, 자신의 학습 데이터로 되돌아갑니다. AI는 자신의 학습 서적에 가장 자주 등장했던 옵션이나, 자신의 내부 코드에서 가장 "익숙하게" 느껴지는 옵션을 선택합니다. 이것은 선택을 하는 것이 아니라, 숨겨진 저항이 가장 적은 경로를 따라가는 것뿐입니다.
결론
이 논문은 현재의 AI 모델들이 진정으로 무작위가 아니다라고 결론짓습니다. 우리가 무작위로 행동하라고 명령하더라도, AI는 다음과 같은 요소들에 기반한 깊고 보이지 않는 편향을 가지고 있습니다:
- 물체가 화면의 어디에 위치해 있는지.
- 물체가 어떻게 생겼는지 (아주 미세한 디테일까지도).
- 질문에 사용된 언어.
- 사용된 특정 기호들 (그리스 문자나 도형 등).
이는 중요한 문제입니다. 만약 AI가 공정한 결정(예: 제품 추천이나 경로 선택)을 내려야 하는데, 내심 자신만의 "선호"를 가지고 있다면, 겉으로는 선택을 하는 것처럼 보일지라도 실제로는 숨겨진 대본을 따르고 있는 것일 수 있기 때문입니다. AI가 던지는 "동전"은 근본적으로 고장 나 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.