Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems
이 논문은 Bennett 기계 이해 테스트에서 도출된 정답과 비교하여 Gemma-3와 Qwen-VL 두 최첨단 멀티모달 모델의 사고 사슬(chain-of-thought) 과정과 최종 답변을 분석함으로써, 질적 기계 문제 해결 과제에 대한 이들의 공간 및 상식 추론 능력을 평가한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
일상생활은 계산기를 꺼내 들지 않고도 해결하는 일종의 기계적 퍼즐들로 가득 차 있습니다. 수도꼭지를 틀거나, 왜 무거운 상자를 경사로 위로 밀어 올리는 것이 가벼운 것보다 더 힘든지 이해하거나, 손잡이를 돌릴 때 일련의 기어들이 어느 방향으로 회전할지 파고드는 것 등은 우리가 '상식'이라는 것을 사용하여 수행하는 작업들입니다. 질적 추론(qualitative reasoning)이라고 알려진 이 능력은 정밀한 측정이나 복잡한 공식에 의존하기보다는 사물이 어떻게 보이고, 느껴지며, 공간 속에서 서로 어떻게 관계를 맺는지 이해하는 것에 기반합니다. 이는 인간 지능의 매우 근본적인 기술이기에, 고용주들은 배관, 응급 의료 또는 운전과 같은 역할에 필요한 타고난 기계적 직관을 갖추었는지 확인하기 위해 베넷 기계 이해력 테스트(Bennett Mechanical Comprehension Test)와 같은 특정 테스트를 사용하기도 합니다. 수십 년 동안 과학자들은 기계가 단순히 숫자를 계산하는 것을 넘어, 인간이 하는 것처럼 물리적 세계를 진정으로 '보고' 이해함으로써 동일한 일을 학습할 수 있을지 궁금해해 왔습니다.
뉴올리언스 루이지애나 주립대학교의 연구진은 최근 보고, 읽기, 그리고 보기 기능을 동시에 수행하도록 설계된 두 가지 새로운 소형 인공지능 모델을 조사함으로써 이 질문을 시험대에 올렸습니다. Gemma와 Qwen이라는 이름의 이 모델들은 이미지를 보고 그에 대한 질문에 답할 수 있도록 구축되었으며, 이러한 능력은 현대 기술에서 점점 더 흔해지고 있습니다. 연구진은 이 시스템들이 인간이 직면하는 것과 같은 종류의 기계적 퍼즐을 풀 수 있는지 알고 싶었으며, 더 중요한 것은 이 기계들이 어떻게 답에 도달하기 위해 사고하는지를 확인하고 싶었습니다. 단순히 최종 답변이 맞았는지 틀렸는지만 확인하는 대신, 연구팀은 모델들에게 단계별로 추론 과정을 설명하도록 요청하여 결론에 도달하기 위해 사용된 내부 논리를 드러내게 했습니다. 연구진은 기어, 수압, 음파, 열을 포함하여 쉬운 수준부터 어려운 수준까지 다양한 난이도를 아우르는 30가지 서로 다른 문제를 모델들에게 테스트했습니다.
결과는 유망함과 상당한 한계를 동시에 보여주었습니다. 문제가 단순하고 시각적 단서가 명확할 때, 두 모델 모두 높은 성능을 보였으며, 정답을 정확히 식별하고 명확한 단계별 흐름으로 자신의 논리를 설명했습니다. 이러한 이상적인 상황에서 기계들은 마치 내용을 공부하고 개념을 이해하는 학생처럼, 자신이 본 것을 물리 법칙에 성공적으로 매핑했습니다. 그러나 문제가 더 미묘해지거나 공간적 관계에 대한 깊은 이해를 요구하게 되면 모델들은 비틀거리기 시작했습니다. 오류의 상당 부분은 지식의 부족 때문이 아니라 그림을 제대로 보지 못한 데서 발생했습니다. 잠수함과 음파와 관련된 한 사례에서, 두 모델 모두 정지된 장면임에도 불구하고 잠수함이 폭발을 향해 움직이거나 멀어지는 것과 같이 이미지에 없는 세부 사항을 만들어냈습니다. 이들은 이러한 움직임을 환각(hallucination)해 냈기 때문에 잘못된 논리를 적용했고, 실제 해결책은 단순히 소리가 공기 중에서 물 속에서보다 얼마나 빨리 전달되는지에 달려 있었음에도 불구하고 틀린 답에 도달했습니다.
다른 사례에서는 모델들이 틀린 이유로 맞는 답을 맞히기도 했는데, 연구진은 이 현상이 특히 시사하는 바가 크다고 발견했습니다. 한 모델은 세 개의 수력 터빈 중 어떤 것이 가장 빠르게 회전할지를 정확히 식별했지만, 그 설명은 물줄기가 날개에 부딪히는 방식에 대한 완전히 잘못된 이해에 기반하고 있었습니다. 이 모델은 잘못된 내부 과정을 숨긴 채 우연히 정답을 맞힌 것입니다. 이는 모델들이 때때로 이해하는 것처럼 흉내 낼 수는 있지만, 자신의 생각을 검증하는 데 사용하는 견고하고 근거 있는 추론 능력은 부족하다는 것을 시사합니다. 연구에 따르면 모델들은 약 절반의 문제 해결에 실패했으며, 그 오류는 공간 추론 능력의 부족(접촉점이나 거리와 같은 핵심적인 시각적 세부 사항을 놓치는 것)이나 물리 법칙을 잘못 적용하는 결함 있는 논리에서 비롯되었습니다. 예를 들어, 기어 문제에서 한 모델은 큰 기어가 작은 기어를 더 빠르게 구동한다고 가정했는데, 이는 해당 이미지에 나타난 특정 배치에는 적용되지 않는 규칙입니다.
연구진은 이러한 소형 시각-언어 모델들이 인상적인 성과를 낼 수 있음에도 불구하고, 복잡한 기계적 작업에서 인간의 직관을 대체할 준비가 아직 되지 않았다고 결론지었습니다. 정답을 얻는 것만으로는 충분하지 않습니다. 그 답으로 가는 경로가 논리적이어야 하며 시각적 세계에 대한 진정한 읽기에 기반해야 합니다. 이 연구는 현재의 인공지능이 인간이 물리적 세계를 막힘없이 항해할 수 있게 해주는 깊은 상식적 공간 추론 능력에 여전히 어려움을 겪고 있다는 점을 강조합니다. 앞으로 나아가기 위해 저자들은 미래의 시스템이 공간과 관계를 이해하는 데 특화된 과업들을 통해 훈련되어야 하며, 아마도 알려진 물리적 원칙에 대해 사실을 검증할 수 있는 시스템과 결합되어야 한다고 제안합니다. 그때까지 기계는 때때로 추측을 통해 시험을 통과할 수는 있지만, 우리가 세상을 보는 것처럼 세상을 진정으로 보는 법은 아직 배우지 못한 학생으로 남아 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.