← 최신 논문
💬 NLP

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

이 논문은 인간이 자신의 색채 판단 규칙을 충실히 따르는 반면, 비전 - 언어 모델 (VLM) 은 내적 추론 규칙을 일관되게 위반하고 세계 지식에 따른 선입견이 신뢰성을 저해한다는 사실을 새로운 '등급 색상 귀속 (GCA)' 벤치마크를 통해 규명했습니다.

원저자: Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

게시일 2026-04-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍎 제목: "언제 사과를 '빨간색'이라고 부를까?"

이 연구는 인공지능이 그림을 볼 때, 스스로 정한 규칙을 얼마나 잘 지키는지를 테스트했습니다.

1. 실험 도구: "회색 그림에 색칠하기" (GCA 데이터셋)

연구진은 검은색과 흰색으로만 된 사과, 딸기, 오징어 같은 그림을 준비했습니다. 그리고 이 그림의 일부분만 특정 색상 (예: 빨간색) 으로 칠해 넣었습니다.

  • 0%: 완전히 하얀 사과.
  • 10%: 아주 조금만 빨간색으로 칠해진 사과.
  • 50%: 반은 빨간색, 반은 하얀 사과.
  • 100%: 완전히 빨간 사과.

사람들과 AI 에게 "이건 빨간 사과야?"라고 물었습니다.

2. 실험 과정: "스스로의 규칙을 먼저 말하기"

AI 에게는 두 가지 질문을 던졌습니다.

  1. 규칙 정하기: "사과가 빨간색이라고 부르기 위해, 최소 몇 % 가 빨간색이어야 한다고 생각하세요?" (예: "적어도 50% 는 빨간색이어야 해.")
  2. 실제 판단: "이 그림은 빨간색이야?"

이 과정을 통해 AI 가 스스로 세운 규칙실제 행동이 일치하는지 ('신뢰성') 확인했습니다.


🔍 발견된 놀라운 사실들

1. 인간은 "약간 과장"하지만 규칙을 지킨다 🧑‍🎨

사람들은 실험에서 "사과가 빨간색이 되려면 최소 60% 가 빨간색이어야 한다"고 말했습니다. 하지만 실제로는 30% 만 빨간색이어도 "빨간색이다"라고 답하는 경우가 많았습니다.

  • 비유: "나는 60% 이상 먹어야 배가 부른다고 생각하지만, 실제로는 30% 먹어도 '배불렀어'라고 말하는 거죠."
  • 원인: 인간은 색의 양을 과대평가하는 경향이 있습니다. 하지만 일단 정한 기준 (60%) 에 도달하면, 그 기준에 맞춰 행동합니다. 즉, 규칙을 지키려는 의지는 있습니다.

2. AI 는 "말과 행동이 완전히 다릅니다" 🤖

AI 는 인간과 달랐습니다.

  • AI 는 "이 사과가 빨간색이 되려면 50% 이상 빨간색이어야 해"라고 명확히 규칙을 세웠습니다.
  • 그런데 막상 그림을 보면, 빨간색이 10% 만 있어도 "이건 빨간 사과야!"라고 답했습니다.
  • 비유: "내가 '100 점 맞아야 합격이다'라고 공언해 놓고, 10 점만 받아도 '합격이다!'라고 외치는 것과 같습니다."
  • 특이점: AI 는 색의 양을 정확히 계산할 수 있습니다 (10% 가 빨간색인지 50% 인지 정확히 아는데도). 하지만 자신의 계산 결과를 무시하고 결론을 내립니다.

3. "세상의 상식"이 AI 를 망친다 🌍

가장 큰 문제는 사과딸기처럼 우리가 이미 알고 있는 사물에서 나타났습니다.

  • **사과 **(빨간색 상식) 그림이 하얀색이 90% 라도, AI 는 "사과니까 빨간색이야"라고 말합니다.
  • **오징어 **(색상 상식 없음) 오징어 같은 경우는 AI 가 그림의 색을 더 잘 보고 규칙을 따릅니다.
  • 비유: AI 는 "사과"라는 이름을 듣는 순간, **눈으로 보는 사실 **(하얀색)을 무시하고 **머릿속에 있는 상식 **(빨간색)을 우선시합니다. 마치 "사과를 보는데 하얀색으로 칠해져 있어도, '사과니까 빨간 거야'라고 고집하는 것"과 같습니다.

💡 결론: 왜 이것이 중요한가?

이 연구는 AI 가 고난도 문제를 풀어서 실패하는 게 아니라, 아주 쉬운 문제에서도 스스로 정한 논리를 배신한다는 것을 보여줍니다.

  • 인간: "내 기준은 60% 지. 근데 내가 색을 과대평가해서 30% 에도 '빨간색'이라고 했어." (일관성 있음)
  • AI: "내 기준은 50% 지. 근데 10% 에도 '빨간색'이야. 왜? 사과니까." (일관성 없음)

의미:
의료나 법률처럼 중요한 분야에서 AI 를 쓸 때, "AI 가 스스로 설명하는 논리 (Chain-of-Thought) 를 믿으면 될까?"라는 질문에 아니오라고 답합니다. AI 는 설명할 때는 그럴듯한 규칙을 말하지만, 실제 결정할 때는 그 규칙을 무시하고 '세상의 상식'이나 '암기된 패턴'에 따라 행동할 수 있기 때문입니다.

한 줄 요약:

인간은 규칙을 지키려고 노력하지만 실수를 하고, AI 는 규칙을 말은 하지만 상식에 따라 행동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →