The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark
KnotBench 는 약 86 만 개의 매듭 도형을 활용한 엄격한 벤치마크를 도입하여, 현재 시각 - 언어 모델들이'사고'modes 를 통해 성능이 향상되었음에도 불구하고 시각적 매듭 구조를 실행 가능한 기호 추론으로 변환하는 데 근본적으로 어려움을 겪으며, 도형 조작이 필요한 작업에서는 종종 무작위 기준선보다도 못한 결과를 보임을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑한 로봇이 꼬인 실의 사진을 보고 완벽하게 묘사할 수 있다고 가정해 봅시다. 로봇은 "빨간 고리가 파란 고리를 가로지르고, 그 다음 초록색 고리 아래로 지나갑니다"라고 말할 수 있습니다. 이 로봇은 시력이 매우 뛰어납니다.
하지만 여기서 함정이 있습니다. 같은 로봇에게 꼬인 실을 풀어달라고 하거나, 두 개의 다른 매듭 그림이 실제로는 단순히 다르게 그려진 동일한 매듭인지 말해달라고 하면, 로봇은 완전히 실패합니다. 로봇은 매듭을 묘사할 수는 있지만, 마음속에서 그것을 "조작"할 수는 없습니다.
이 논문은 **"VLM 을 위한 고디안 매듭 (The Gordian Knot for VLMs)"**이라는 제목으로, 현대 AI 모델들에게서 "보는 것"과 "행동하는 것" 사이의 격차가 얼마나 큰지를 증명하기 위해 KnotBench라는 새로운 테스트를 소개합니다.
설정: 디지털 매듭 정원
연구자들은 858,000 장의 매듭 사진으로 이루어진 거대한 정원을 만들었습니다.
- 출처: 그들은 1,951 개의 기본 "프로토타입" 매듭 (매듭 이론의 가장 단순한 구성 요소) 으로 시작했습니다.
- 마법: 그들은 *라이데마이스터 이동 (Reidemeister move)*이라는 수학적 규칙을 사용하여 이러한 매듭들을 수천 번 비틀고, 회전시키고, 다시 그렸습니다.
- 결과: 3 개의 교차점을 가진 간단한 "트리폴 (trefoil)" 매듭의 사진과, 20 개의 교차점을 가진 정확히 같은 매듭의 사진이 완전히 다르게 보일 수 있습니다. 또는 거의 동일하게 보이는 두 개의 사진이 실제로는 서로 다른 매듭일 수도 있습니다 (왼손 장갑과 오른손 장갑처럼).
컴퓨터는 각 매듭의 "진정한 정체성"을 알고 있습니다. 왜냐하면 이는 인간의 추측이 아닌 수학으로 생성되었기 때문입니다. 이로 인해 테스트는 완벽하게 공정합니다.
테스트: 14 가지의 막다른 길
연구자들은 이용 가능한 가장 똑똑한 네 가지 AI 모델 (Claude Opus 4.7 및 GPT-5 포함) 에게 14 가지 다른 작업을 수행하도록 요청했습니다. AI 가 어디서 무너지는지 확인하기 위해 작업을 두 그룹으로 나누었습니다:
- "이미지" 그룹: AI 는 매듭의 사진을 봅니다.
- "텍스트" 그룹: AI 는 매듭을 설명하는 숫자와 문자의 목록 (코드) 을 봅니다.
다음은 AI 에게 요청한 내용들입니다. 간단한 비유를 사용하여 설명합니다:
"같거나 다른가?" 테스트 (A 군): "이 두 사진은 같은 매듭인가요?"
- 함정: 때로는 사진이 완전히 다르게 보이지만 같은 매듭인 경우가 있고, 거의 동일하게 보이지만 다른 매듭인 경우가 있습니다.
- 결과: 텍스트 코드를 제공받았을 때 AI 는 이 작업을 훌륭하게 수행했습니다. 하지만 사진을 제공받았을 때는 원숭이가 다트를 던지듯 무작위로 추측했습니다.
"무슨 일이 일어났는가?" 테스트 (B 군): "나는 당신에게 매듭을 보여준 후, 고리를 하나 추가하는 것과 같은 작은 움직임 하나를 만들었습니다. 나는 어떤 움직임을 만들었나요?"
- 함정: 이는 AI 가 움직임을 마음속에서 시뮬레이션해야 함을 의미합니다. "내가 여기서 이 실을 당기면 사진은 어떻게 보일까요?"
- 결과: 텍스트 코드를 제공받았을 때 AI 는 이를 파악할 수 있었습니다. 하지만 사진을 제공받았을 때는 처참하게 실패했습니다. 한 모델 (GPT-5) 은 수학 공식을 배우지 않고 정답지 외운 학생처럼 가장 흔한 정답 ("R3") 을 계속해서 추측하기만 했습니다.
"세기" 테스트 (C 군): "실들이 교차하는 횟수는 몇 번인가요?"
- 결과: AI 는 8 번의 교차점을 쉽게 셀 수 있었습니다. 하지만 매듭이 복잡해지면 (17 회 이상 교차), AI 의 세기 결과는 완전히 엉망이 되었습니다. AI 는 자신이 보고 있는 항목조차 셀 수 없었습니다.
"번역기" 테스트 (D 군): "여기에 사진이 있습니다. 이에 대한 비밀 코드를 적어보세요."
- 결과: 0 점입니다. 어떤 모델도 이를 수행할 수 없었습니다. "생각" 모드를 켜두었음에도 불구하고 시각적 사진을 수학적 코드로 번역할 수 없었습니다.
큰 발견: "지각 - 조작 격차"
이 논문은 실패 지점을 **"지각 - 조작 격차 (Perception-Operation Gap)"**라고 부릅니다.
이렇게 생각해 보세요:
- 지각은 지도를 보고 "강과 다리가 보입니다"라고 말하는 것입니다.
- 조작은 같은 지도를 보고 "다리를 건너면 다른 쪽에 도착할 것입니다"라고 말하는 것입니다.
AI 모델들은 지각에 놀라울 정도로 뛰어납니다. 그들은 매듭을 묘사할 수 있습니다. 하지만 조작에는 매우 서툴러요. 그들은 자신이 본 것을 마음속에서 조작하여 문제를 해결할 수 없습니다.
"생각"이 도움이 될까요?
연구자들은 AI 의 "생각 모드" (모델이 답변하기 전에 스스로와 대화하는 모드) 를 켰습니다.
- 도움이 되었나요? 네, 하지만 아주 조금만요.
- 어디서 도움이 되었나요? AI 가 텍스트 코드를 제공받았을 때만 도움이 되었습니다. AI 가 먼저 사진을 봐야 한다면, "생각"은 문제를 해결하지 못했습니다. 이는 화면의 숫자를 읽을 수 없는 사람에게 계산기를 주는 것과 같습니다. 계산기는 쓸모가 없습니다.
결론
이 논문은 현재의 AI 모델이 정교한 사진사는 될 수 있지만 기계공은 될 수 없다고 결론지었습니다. 그들은 매듭의 완벽한 사진을 찍고 모든 세부 사항을 묘사할 수 있지만, 인간이 사물을 비틀고 회전시켜 작동 방식을 이해하는 데 사용하는 내부 "시뮬레이터"가 부족합니다.
그들은 매듭을 볼 수는 있지만, 그것을 행동으로 옮길 수는 없습니다. AI 가 이러한 내부 "정신적 시뮬레이터"를 구축하기 전까지는, 아무리 많은 사진을 보더라도 다이어그램의 논리에는 여전히 맹목일 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.