← 최신 논문
💻 computer science

The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models

본 논문은 언어 모델이 반복적인 반례 제시와 수정 주기를 통해 철학적 개념 분석을 유지할 수 있는지 조사한 결과, 모델이 해당 과정에 참여할 수는 있으나, 정확도 향상 없이 점차 verbosity 가 증가하는 한계 수확 체감 현상이 빠르게 나타나고 인간 판정자보다 무효한 반례를 과도하게 수용하는 경향이 있음을 발견했다.

원저자: Daniel Drucker, Kyle Mahowald

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Drucker, Kyle Mahowald

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

철학자 한 무리가 높은 stakes 의 "Gotcha" 게임을 한다고 상상해 보세요.

한 사람이 "게임은 재미를 위해 하는 활동이다"와 같이 단어에 대한 간단한 정의를 제안합니다. 다음 사람은 그 정의가 실패하는 실제 상황을 찾아 (반례를 찾아) 그 정의를 깨뜨리려 합니다. 예를 들어, "돈을 벌기 위해 계속 플레이하지만 스트레스를 받고 게임을 싫어하는 프로 포커 플레이어는 어떨까요? 여전히 게임이지만 '재미를 위해' 하는 것은 아닙니다."

첫 번째 사람은 이제 포커 플레이어를 포함하면서도 게임이 아닌 것들은 제외하도록 정의를 수정해야 합니다. 다시 시도하고 이 사이클이 반복됩니다. 이를 개념 분석이라고 하며, 철학자들은 수천 년 동안 이 방식을 통해 아이디어를 다듬어 왔습니다.

이 논문의 연구자들은 다음과 같이 질문했습니다: AI 언어 모델은 이 게임을 할 수 있을까요?

그들은 이 게임의 디지털 버전을 구성했는데, 한 AI 가 정의하는 "제안자" 역할을 하고 다른 AI 는 정의의 허점을 찾는 "비평가" 역할을 합니다. 그들은 이 루프를 반복해서 플레이하게 했습니다. 때로는 50 회 연속으로 플레이하여 AI 가 "친구", "거짓말", "샌드위치"와 같은 것을 정의하는 데 더 똑똑해지는지 확인했습니다.

그들이 발견한 바를 일상적인 용어로 번역하면 다음과 같습니다:

1. AI 심판은 조금 지나치게 관대합니다

게임에서 "비평가"는 나쁜 정의를 찾아내야 합니다. 연구자들은 인간 전문가와 AI 심판이 AI 의 반례를 평가하게 했습니다.

  • 결과: AI 심판은 인간 전문가보다 약 두 배 더 자주 "네, 그건 유효한 반례입니다!"라고 답했습니다.
  • 비유: 엄격한 선생님 (인간) 과 매우 열성적인 학생 (AI) 이 시험을 채점한다고 상상해 보세요. 학생은 모든 틀린 답을 훌륭한 함정 질문이라고 생각하지만, 선생님은 그중 일부는 단순한 실수임을 알고 있습니다. 하지만 그들은 "큰 실수" 즉, 매우 명백한 결함에는 동의했습니다. 따라서 AI 는 자신에게 조금 너무 관대하지만 완전히 환각을 보고 있는 것은 아닙니다.

2. "길수록 좋다"는 함정

연구자들은 AI 가 더 많은 라운드를 플레이할수록 정의가 인간 철학자가 수년에 걸쳐 아이디어를 다듬듯이 더 날카롭고 정확해지기를 기대했습니다.

  • 결과: 오히려 더 나아지는 대신 정의는 더 길고 말수가 많아졌습니다.
  • 비유: 외계인에게 "개"를 설명하려 한다고 상상해 보세요.
    • 1 라운드: "개는 털이 있는 동물이다." (너무 광범위: 고양이 포함)
    • 2 라운드: "개는 짖는 털이 있는 동물이다." (너무 광범위: 일부 바다표범 포함)
    • 50 라운드: "개는 털이 있고 짖으며 네 다리를 가지고 있고 바다표범이 아니며 고양이도 아니며 보통 꼬리가 있고 뼈를 좋아하며 로봇이 아닌 동물이다. 다만 특정 유형의 로봇 개를 제외하고는..."
      AI 는 모든 구멍을 메우기 위해 "예외"와 "규칙"을 계속 추가했지만, 실제로 개의 본질적인 진리를 파악한 적은 없습니다. 정의는 명확하고 간결한 통찰이 아니라 거대하고 투박한 규칙 목록이 되었습니다.

3. 어떤 개념은 단순히 잡기 어렵습니다

연구자들은 20 가지 다른 개념을 테스트했습니다. 그들은 일부 단어는 반례로 쉽게 "깨뜨릴" 수 있었지만, 다른 단어들은 거의 불가능하다는 사실을 발견했습니다.

  • 깨뜨리기 쉬운 것: "이웃"이나 "친구"와 같은 단어입니다. AI 는 쉽게 이상한 엣지 케이스를 찾을 수 있었습니다 (예: "이웃은 만나 본 적이 없지만 옆집에 사는 사람일까요?").
  • 깨뜨리기 어려운 것: "실수"나 "전문가"와 같은 단어입니다. 이러한 개념들은 게임에 저항하는 듯했습니다. AI 는 유효한 반례를 찾기 어려워했는데, 이는 이러한 아이디어가 본질적으로 더 모호하거나 엄격한 규칙으로 정의하기 어렵다는 것을 시사합니다.

4. "기억"은 도움이 되지 않았습니다

연구자들은 두 가지 버전의 게임을 시도했습니다:

  1. 기억 없음: AI 는 현재 정의만 봅니다.
  2. 이력 포함: AI 는 이전 모든 정의와 반례의 전체 이력을 봅니다.
  • 결과: 이력을 가지고 있어도 AI 는 더 나아지지 않았습니다. 과거의 실수에서 배우지 못했습니다. 더 많은 단어로 같은 종류의 실수를 계속 반복했을 뿐입니다.

결론

이 논문은 AI 가 "반례 게임"을 하고 규칙을 이해할 수는 있지만, 매우 빠르게 벽에 부딪힌다고 결론지었습니다. 연습을 통해 더 똑똑해지지 않고, 단지 더 말수가 많아질 뿐입니다.

연구자들은 이것이 AI 를 테스트하는 훌륭한 방법이라고 제안합니다. AI 가 고수준의 반복적 철학적 추론 (시간이 지남에 따라 나아지는 것) 을 지속하지 못한다면, 이는 이러한 모델이 어떻게 생각하는지에 대해 중요한 것을 알려줍니다. 즉, 단기적으로는 구멍을 메우는 데는 능숙하지만 장기적으로는 복잡한 아이디어에 대한 안정적이고 깊은 이해를 구축하는 데는 어려움을 겪는다는 것입니다.

간단히 말해: AI 는 게임을 할 수는 있지만, 규칙집에 점점 더 많은 규칙을 추가할 뿐 스포츠 자체를 실제로 이해하지 못하는 플레이어와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →