← 최신 논문
🤖 AI

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

이 논문은 과학적 발견을 위한 LLM의 귀납적 추론을 평가하기 위해 Wason 2-4-6 과제에서 영감을 얻은 벤치마크인 FALSIFYBENCH를 소개하며, 추론 모델이 주로 부정 테스트(negative testing) 능력 덕분에 지시 미세 조정(instruction-tuned) 모델보다 우수한 성능을 보인다는 점과 실패가 가설 탐색 과정에서의 식별 가능한 패턴에서 기인한다는 점을 밝힌다.

원저자: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구와 추측 게임을 하고 있다고 상상해 보세요. 친구는 비밀 규칙을 알고 있지만, 당신은 모릅니다. 친구는 "2, 4, 6"처럼 규칙에 부합하는 세 가지 예시를 보여줍니다. 당신의 임무는 자신만의 숫자 집합을 제안하고 "이것도 해당하나요?"라고 물으며 비밀 규칙을 알아내는 것입니다.

이것은 인간의 사고 방식을 연구하기 위해 사용되는 유명한 퍼즐인 "Wason 2-4-6 과제"입니다. 질문하신 논문인 FALSIFYBENCH는 이 게임을 AI 모델에게 적용했는데, 숫자 대신 단어와 범주(예: "동물" 또는 "도구")를 사용했습니다.

다음은 연구진이 수행한 작업과 발견한 내용을 쉬운 비유를 사용하여 정리한 것입니다.

게임: "숨겨진 범주 찾기"

AI를 미스터리를 풀려는 탐정이라고 생각해보세요.

  • 설정: AI에게 "박쥐", "스키머(skimmer)", "타르시에(tarsier)"와 같은 세 가지 항목이 주어집니다.
  • 목표: AI는 이 항목들이 속한 숨겨진 범주(예: "동물")를 맞춰야 합니다.
  • 함정: AI는 정답을 모릅니다. AI는 규칙을 추측하고, 테스트하고, 피드백을 받아야 합니다.
    • 만약 AI가 "나는 것들"이라고 추측하고 "박쥐"를 테스트했을 때, 시스템이 "네, 맞습니다"라고 한다면, AI는 자신의 규칙이 너무 넓다는 것을 알게 됩니다.
    • 만약 AI가 "물고기"를 테스트했는데 시스템이 "아니요, 맞지 않습니다"라고 한다면, AI는 자신의 규칙이 너무 좁다는 것을 배웁니다.
    • 만약 AI가 "고래"를 테스트했고 시스템이 "네, 맞습니다"라고 했는데, AI가 처음에 "나는 것들"이라고 생각했다면, AI는 자신의 규칙이 너무 좁다는 것을 깨닫게 됩니다.

핵심 문제: "예스맨(Yes-Man)"의 함정

연구진은 대부분의 AI 모델(그리고 인간도)이 **확증 편향(Confirmation Bias)**이라는 특정 사고 오류를 겪는다는 것을 발견했습니다.

당신이 범인이 "집사"라고 확신하고 있는 탐정이라고 상상해 보세요.

  • "예스맨" 전략 (확증): 당신은 오직 집사가 범인임을 증명하는 질문만 던집니다. "집사가 동기를 가졌나요?" "네." "집사가 현장에 있었나요?" "네." 당신은 자신감을 얻지만, 실제로 집사의 무죄를 확인하지는 않습니다. 당신은 그저 "예"라는 대답만을 찾고 있는 것입니다.
  • "악마의 변호인" 전략 (반증): 당신은 적극적으로 집사가 범인이 아님을 증명하려고 노력합니다. "범행 당시 집사는 해변에 있었나요?" 만약 대답이 "예"라면, 당신의 이론은 파괴되며 새로운 용의자를 찾아야 합니다.

논문의 주요 발견:
자신의 이론을 깨뜨리려고 노력했던(Devil's Advocates) AI 모델들이 훨씬 더 잘 해결했습니다. 자신의 이론이 맞다는 증거만을 찾았던(Yes-Men) 모델들은 정체되었습니다. 이들은 계속해서 좁은 규칙(예: "나는 포유류")을 추측하다가, 실제 규칙이 더 넓다(예: "모든 동물")는 사실을 깨닫지 못했습니다.

결과: 누가 가장 잘했나?

연구팀은 12개의 서로 다른 AI 모델을 테스트했습니다. 결과는 다음과 같습니다.

  1. "추론" 모델이 승리했다: 말하기 전에 먼저 "생각"하도록 설계된 최신 AI 모델들(흔히 "추론 모델"이라 불림)은 일반 모델들보다 더 뛰어난 탐정이었습니다. 이들은 자신의 이론을 스스로 깨뜨리려고 시도할 가능성이 더 높았습니다.
  2. 완벽한 모델은 없었다: 가장 뛰어난 AI 모델조차 게임을 완벽하게 해결하지는 못했습니다. 이들은 여전히 실수를 저질렀으며, 이는 AI가 아직 과학적 발견의 마스터가 아님을 보여줍니다.
  3. 지능의 문제가 아니라 전략의 문제였다: 연구진은 AI가 단어의 정의를 몰라서(예: "박쥐"가 무엇인지 몰라서) 실패하는 것인지 확인했습니다. 조사 결과, 그것은 문제가 아니었습니다. AI는 단어를 알고 있었지만, 전략이 잘못되었습니다. AI는 틀릴 수도 있는 아이디어를 테스트하는 것을 너무 두려워했습니다.

"차례별(Turn-by-Turn)" 분석

연구진은 단순히 누가 이겼는지만 본 것이 아니라, AI가 매 단계 어떻게 플레이하는지 관찰했습니다. 그들은 AI가 실패하는 두 가지 주요 방식을 발견했습니다.

  1. 길을 잃다: 구체적인 추측에서 일반적인 추측으로 천천히 이동하는 대신(예: "박쥐"에서 "포유류"를 거쳐 "동물"로 가는 것), AI는 때때로 완전히 관련 없는 추측으로 건너뛰었습니다(예: "B로 시작하는 것들").
  2. 잘못된 세부 사항에 집중하다: 때때로 AI는 단어의 의미를 추측하는 대신, 단어가 어떻게 보이는지를 바탕으로 추측했습니다. 예를 들어, "규칙은 모든 단어가 세 글자라는 것이다"라거나 "모든 단어가 모음으로 시작한다는 것이다"라고 추측하는 식입니다. 이는 탐정이 범죄 현장은 무시하고 용의자의 신발 색깔에만 집중하는 것과 같습니다.

결론

이 논문은 AI가 진정한 과학적 사고를 할 수 있는지 확인하기 위한 새로운 테스트(FALSIFYBENCH)를 소개합니다. 결론은, AI가 "생각"하는 능력은 향상되고 있지만, 여전히 과학의 가장 중요한 부분인 **"틀릴 수 있는 용기"**를 갖추는 데 어려움을 겪고 있다는 것입니다.

좋은 과학자(또는 좋은 탐정)가 되려면, 자신의 아이디어가 틀렸음을 입증하기 위해 적극적으로 노력해야 합니다. 이렇게 학습한 AI 모델들이 승리했지만, 이들이 인간 과학자를 대체하기까지는 아직 갈 길이 멉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →