← 최신 논문
🤖 AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

이 논문은 봉가드 문제(Bongard problems)를 해결하기 위해 매개변수화된 프로그램을 생성하는 거대 언어 모델과 매개변수 적합을 위한 베이지안 최적화를 결합한 신경-기호적 접근 방식을 소개하며, 이를 통해 시각적 지각과 추상적 추론 사이의 간극을 메운다.

원저자: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "시각적 수수께끼"의 도전

당신에게 12개의 그림 세트가 주어졌다고 상상해 보세요. 그중 6개는 "좋은(positive)" 그림이고, 나머지 6개는 "나쁜(negative)" 그림입니다. 당신의 임무는 좋은 그림과 나쁜 그림을 가르는 비밀 규칙을 찾아내는 것입니다.

이것을 **봉가르드 문제(Bongard Problem)**라고 부릅니다. 이것은 단순히 "틀린 그림 찾기" 같은 단순한 퍼즐이 아닙니다. 규칙은 믿기지 않을 정도로 까다로울 수 있습니다.

  • 예시: 어떤 경우에는 "좋은" 그림들이 모두 "목(neck)" 부분이 가로로 놓인 모양을 가지고 있고, "나쁜" 그림들은 목이 세로로 놓여 있을 수도 있습니다. 또는 "좋은" 그림들은 모양이 "구불구불"하고, "나쁜" 그림들은 "매끄러운" 것일 수도 있습니다.

이 논문은 근본적인 질문을 던집니다: 인공지능(AI)이 인간처럼 이 수수께끼를 풀 수 있을까? 인간은 완전히 새로운 상황을 마주했을 때, 즉석에서 새로운 개념(예: "가로 방향의 목")을 만들어내고 이를 적용하는 데 매우 능숙합니다. 현재의 AI는 이미 본 적이 있는 것(예: "이것은 고양이다")을 인식하는 데는 뛰어나지만, 무에서 유를 창조하듯 새로운 개념을 발명해야 할 때는 어려움을 겪곤 합니다.

문제점: 너무 경직되거나 너무 모호한 AI

연구진은 AI가 문제를 해결할 때 두 가지 주요 사고 방식을 사용하며, 두 방식 모두 결함이 있다는 것을 발견했습니다.

  1. "챗봇" 방식 (자연어):

    • 작동 방식: AI가 그림을 보고 마치 형사가 보고서를 쓰듯 규칙을 말로 설명하려고 시도합니다.
    • 결함: 큰 아이디어에는 강하지만 정밀함이 부족합니다. AI는 "좋은 모양들은 약간 뾰족하다"라고 말할 수는 있지만, "약간 뾰한" 것과 "매우 뾰족한" 것의 차이를 구별하지 못합니다. 이는 마치 레시피에 "소금 한 꼬집을 넣으라"고 적혀 있지만, 정확히 그 양이 얼마인지는 모르는 요리사와 같습니다.
  2. "프로그래머" 방식 (코드):

    • 작동 방식: AI가 이미지를 검사하기 위한 컴퓨터 프로그램을 작성합니다. 이 방식은 거리, 각도, 개수 등을 정확하게 측정할 수 있습니다.
    • 결함: 정밀함에는 뛰어나지만 창의성이 부족합니다. 만약 규칙이 "모양이 슬픈 얼굴처럼 보인다"라면, 컴퓨터 프로그램은 "슬픔"이라는 개념을 수학적으로 정의하는 데 애를 먹습니다. 이는 방의 크기를 밀리미터 단위로 측정할 수는 있지만, "아늑함"이라는 개념은 이해하지 못하는 로봇과 같습니다.

해결책: "번역가" 팀

저자들은 두 명의 전문가가 협력하는 팀처럼 작동하는 새로운 시스템을 구축했습니다. 그들은 이를 "뉴로심볼릭(neurosymbolic)" 접근 방식(신경망/AI와 기호 논리/프로그램의 결합)이라고 부릅니다.

이 팀이 작동하는 단계별 과정은 다음과 같습니다.

1단계: 아이디어 생성기 (The "Chatbot")

먼저, 강력한 AI(시각-언어 모델)에게 수수께끼를 보여주고 평범한 영어로 가능한 몇 가지 규칙을 추측하게 합니다.

  • 비유: 창의적인 작가가 "아마도 규칙은 모양의 '목'에 관한 것일지도 몰라!"라고 제안하는 브레인스토밍 세션을 상상해 보세요.

2단계: 번역가 (The "Programmer")

다음으로, 시스템은 이러한 영어 추측들을 컴퓨터 코드로 변환하려고 시도합니다.

  • 반전: AI는 단순히 코드를 쓰는 것이 아니라, 까다로운 숫자들을 위해 "빈칸"을 남겨둡니다. 예를 들어, 규칙이 "목의 길이가 X보다 긴 모양"이라면, AI는 코드를 작성하되 X를 미지의 변수로 남겨둡니다.
  • 비유: 작가가 "목은 [빈칸]보다 길어야 한다"라고 말하면, 프로그래머는 기계를 설정하여 목의 길이를 측정하되 정확한 숫자가 나올 때까지 기다립니다.

3단계: 튜너 (베이지안 최적화 - Bayesian Optimization)

이것이 바로 핵심 비법(secret sauce)입니다. 시스템은 그 빈칸에 들어갈 완벽한 숫자를 찾기 위해 "시행착오" 과정을 거칩니다. 시스템은 다양한 숫자(예: 5픽셀, 10픽셀, 15픽셀)를 테스트하며, 어떤 숫자가 "좋은" 그림과 "나쁜" 그림을 완벽하게 갈라놓는지 확인합니다.

  • 비유: 라디오 주파수를 맞추는 것을 상상해 보세요. 당신은 스테이션이 90과 100 사이 어딘가에 있다는 것은 알지만, 정확한 주파수는 모릅니다. 당신은 음악이 완벽하게 들리고 잡음이 사라질 때까지 천천리 다이얼을 돌립니다. 시스템은 정확한 "차단 지점(cutoff point)"을 찾기 위해 수학적으로 이 과정을 수행합니다.

4단계: 판사 (검증기 - The Verifier)

마지막으로, 시스템은 "이 코드가 실제로 모든 훈련 이미지에 작동하는가?"를 확인합니다.

  • 코드가 완벽하게 작동하면, 시스템은 그 규칙을 수용합니다.
  • 코드가 실패하면, 시스템은 다시 "챗봇"에게 돌아가 "그 아이디어는 효과가 없었어, 다시 시도해 봐"라고 말하며 이 순환 과정을 반복합니다.

연구 결과는 어떠했는가?

연구진은 이 "팀 접근 방식"을 현존하는 최고의 AI 모델들(GPT-4o나 Claude 3.7 등) 및 평균적인 인간의 성적과 비교 테스트했습니다.

  1. 팀의 승리: 챗봇의 창의성과 프로그래머의 정밀함을 결합함으로써, 이 시스템은 100개의 봉가르드 문제 중 51개를 해결했습니다.
  2. 인간을 넘어서다: 이전 연구에서 평균적인 인간은 약 47개의 문제를 풀었습니다. 이 AI 팀은 51개를 풀어내며, 이 특정 테스트에서 인간의 평균 성능을 넘어선 최초의 사례를 기록했습니다.
  3. 서로 다른 강점:
    • 문제가 기하학이나 수학(예: "이 선들이 평행한가?")에 관한 것이었을 때, 팀의 "프로그래머" 부분이 영웅 역할을 했습니다.
    • 문제가 추상적인 개념(예: "이 모양이 '열려' 있는가, '닫혀' 있는가?")에 관한 것이었을 때, 팀의 "챗봇" 부분이 영웅 역할을 했습니다.
    • 챗봇이나 프로그래머 중 하나만 사용했을 때는 성적이 더 낮았습니다. 그들은 둘 다 필요했습니다.

"암기" 여부 확인

연구진은 AI가 인터넷에 있는 답을 단순히 암기해서 "속임수"를 쓰는 것이 아닌지 우려했습니다. 이를 테스트하기 위해 규칙을 뒤집었습니다. 즉, "나쁜" 그림이 사실은 "좋은" 그림이라고 AI에게 알려준 것입니다. AI는 여전히 높은 성능을 보였으며, 이는 AI가 단순히 암기된 답을 읊는 것이 아니라 실제로 논리를 파악하고 있음을 증명했습니다.

결론

이 논문은 어려운 시각적 퍼즐을 풀기 위해서 AI가 단순히 인간처럼 "생각"하거나 컴퓨터처럼 "계산"하는 것만으로는 부족하다는 것을 보여줍니다. AI는 둘 다 해야 합니다. 창의적인 AI가 아이디어를 제안하고, 정밀한 컴퓨터가 정확한 수학으로 이를 검증하게 함으로써, 우리는 인간만큼, 혹은 때로는 인간보다 더 잘 새로운 시각적 개념을 학습하는 시스템을 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →