GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
이 논문은 GUI-Primitives를 소개하며, 시각-언어 모델들이 공간적 관계를 이해하는 데 문제가 있는 것이 아니라 주로 후보 인터페이스 요소들을 국지화(localizing)하는 데 실패한다는 점을 밝히는데, 이는 모델들이 올바른 영역으로 제한되었을 때는 높은 정확도를 보이지만 제약이 없는 좌표 예측에서는 저조한 성능을 보인다는 점에 의해 입증된다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
소프트웨어 프로그램의 스크린샷을 보고, "저장 아이콘 오른쪽의 버튼을 클릭하세요"와 같은 문장을 읽은 뒤, 마우스 커서를 정확히 그 위치로 이동시킬 수 있는 컴퓨터를 상상해 보십시오. 이것이 우리의 컴퓨터를 대신 조작하기 위해 설계된 새로운 세대의 인공지능 에이전트가 약속하는 미래입니다. 이들은 양식을 채우는 것부터 복잡한 메뉴를 탐색하는 것에 이르기까지 다양한 작업을 수행하도록 구축되고 있으며, 우리가 매일 사용하는 그래픽 인터페이스를 보고 상호작용할 수 있는 디지털 비서 역할을 합니다. 이러한 에이전트가 제대로 작동하려면 "그라운딩(grounding, 접지)"이라 불리는 근본적인 기술, 즉 문장의 특정 단어를 화면상의 특정 모양이나 버튼에 연결하는 능력을 갖추어야 합니다. 만약 에이전트가 "오른쪽의 버튼"을 안정적으로 찾아내지 못한다면, 계획을 세우거나 타이핑을 하는 데 아무리 똑똑하더라도 해당 작업을 수행할 수 없습니다.
연구자들은 이러한 컴퓨터 에이전트들이 때때로 실수를 한다는 사실을 오래전부터 알고 있었지만, 정확히 왜 그런 실수가 발생하는지는 밝혀내는 데 어려움을 겪어 왔습니다. 컴퓨터가 화면의 텍스트를 읽지 못해서 실패하는 것일까요? "오른쪽"이라는 의미를 혼동하고 있는 것일까요? 아니면 단순히 버튼 자체를 찾는 데 능력이 없는 것일까요? 기존의 시스템 테스트들은 이러한 기술들을 모두 섞어서 테스트하기 때문에, 에이전트가 잘못된 곳을 클릭했을 때 뇌의 어느 부분이 고장 난 것인지 파악하는 것이 불가능했습니다. 이 수수께끼를 풀기 위해, 과학자 팀은 단 하나의 기초적인 능력, 즉 컴퓨터 인터페이스에서의 공간적 관계를 이해하는 능력을 분리하여 테스트할 수 있는 매우 통제된 새로운 테스트를 만들었습니다.
연구진은 거의 천 쌍의 질문으로 구성된 GUI-PRIMITIVES라는 데이터셋을 구축했습니다. 각 쌍은 정확히 동일한 스크린샷과 동일한 시작점인 "앵커(anchor)"를 사용하지만, 지침에서 단 한 단어만을 바꿉니다. 한 버전에서는 컴퓨터에게 특정 아이콘의 왼쪽 요소를 클릭하라고 요청하고, 쌍을 이루는 다른 버전에서는 동일한 아이콘의 오른쪽 요소를 클릭하라고 요청합니다. 이미지와 앵커가 동일하기 때문에 차이점은 오직 방향뿐입니다. 만약 컴퓨터가 언어를 진정으로 이해하고 있다면, 첫 번째 질문에는 왼쪽 버튼을 클릭하고 두 번째 질문에는 오른쪽 버튼을 클릭해야 합니다. 만약 컴퓨터가 두 질문 모두에 대해 같은 버튼을 클릭하거나 완전히 다른 영역을 클릭한다면, 이는 공간적 관계를 이해하는 데 실패했음을 드러내는 것입니다. 연구팀은 강력하고 값비싼 상용 시스템부터 작고 오픈 소스인 버전까지, 19가지의 서로 다른 인공지능 모델을 대상으로 이 챌린지를 테스트했습니다.
결과는 극명했습니다. 가장 진보된 모델조차 성능이 저조했으며, 가장 뛰어난 시스템도 약 32%의 경우에만 정답을 맞혔습니다. 이는 사람들이 거의 97%의 확률로 정답을 맞히는 인간의 성과와 비교했을 때 엄청난 격차입니다. 연구진은 실패가 어디에서 발생하는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 문제가 주로 "왼쪽"이나 "오른쪽"이라는 단어 때문에 발생하는 것이 아님을 발견했습니다. 대신, 모델들이 화면의 올바른 영역을 찾는 것 자체에 실패하고 있었습니다. 오류의 60~92%에서 컴퓨터의 예측 클릭은 정답 대상과 오답 방해 요소 모두를 벗어나, 종종 이미지의 완전히 빈 부분에 떨어졌습니다.
연구진이 이러한 "길을 잃은" 예측들을 제외하고, 컴퓨터가 실제로 두 후보 버튼 중 하나를 가리켰던 경우만을 살펴보았을 때 그림은 달라졌습니다. 가로 및 세로 방향의 경우, 모델들이 일단 올-바른 영역으로 범위를 좁히기만 하면 올바른 것을 선택하는 데 꽤 능숙했습니다. 그러나 어떤 항목이 패널 안에 있는지 또는 팝업 창 뒤에 숨겨져 있는지와 같은 더 복합적인 관계의 경우, 모델들은 적절한 후보를 보고 있음에도 불구하고 무작위로 추측하는 것보다 나은 성과를 내지 못했습니다. 이는 모델들이 때때로 단어는 이해할 수 있을지 몰라도, 그 단어들이 복잡한 화면의 어디에 적용되는지를 시각적으로 찾아내는 작업에는 상당한 어려움을 겪고 있음을 시사합니다.
연구진은 또한 이러한 공간 기술이 실제 성능에 중요한 영향을 미치는지 테스트했습니다. 그들은 강력한 연관성을 발견했습니다. 이러한 기본적인 공간 테스트를 더 잘 수행하는 모델일수록, 실제 데스크톱 애플리케이션을 클릭하는 별도의 더 복잡한 벤치마크에서도 더 뛰어난 성능을 보였습니다. 이는 단순한 공간 지침을 이해하는 능력이 더 발전된 컴퓨터 사용을 위한 기초적인 빌딩 블록임을 확인시켜 줍니다. 연구진은 또한 단계별로 생각하도록 요청하거나 화면에 시각적 표식을 추가하여 모델을 돕는 몇 가지 기법을 시도했습니다. 후보 버튼 위에 직접 번호가 매겨진 태그를 배치하는 방식은 일부 모델의 점수를 30%에서 거의 90%까지 끌어올리며 극적인 개선 효과를 보였습니다. 그러나 이것은 진단 도구일 뿐 실질적인 해결책은 아니었습니다. 왜냐นั้น 태그를 배치하기 위해서는 컴퓨터가 이미 버튼이 어디에 있는지 알고 있어야 하기 때문입니다.
궁극적으로, 이 연구는 현재 세대의 컴퓨터 사용 에이전트가 퍼즐의 결정적인 조각을 놓치고 있음을 보여줍니다. 그들은 언어를 추론하지 못하거나 화면을 보지 못해서 실패하는 것이 아닙니다. 그들은 단순한 공간 지침을 붐비고 복잡한 인터페이스상의 특정 위치로 신뢰성 있게 매핑하지 못하기 때문에 실패하고 있습니다. 단어와 시각적 위치를 연결하는 이 근본적인 기술이 해결되지 않는 한, 이 디지털 비서들은 우리 디지털 세계를 탐색하는 가장 기본적인 작업조차 계속해서 어려움을 겪을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.