← 최신 논문
💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

본 논문은 렌더링된 커서의 시각적 피드백과 강화 학습을 활용하여 GUI 그라운딩을 상호작용적 검색 작업으로 재정의함으로써 비전 언어 모델의 좌표 예측 한계를 극복하고, 더 적은 학습 데이터로 공간 추론 및 에이전트 작업에서 우수한 성능을 달성하는 GUI-Cursor 모델을 소개합니다.

원저자: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"시각적 피드백을 통한 공간 추론으로 GUI 그라운딩 학습하기"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 제시합니다.

큰 문제: "눈먼 건축가"

상상해 보세요. 거대하고 복잡한 벽 (컴퓨터 화면) 에 특정 벽돌을 어디에 놓아야 하는지 로봇에게 알려주는 건축가가 되어 있습니다. 벽은 거대하고 벽돌은 아주 작습니다.

오랫동안 연구자들은 로봇에게 한 번에 정확한 좌표 (예: "45 행, 12 열") 를 추측하도록 가르치려 했습니다. 이 논문은 이를 벽이나 벽돌을 한 번도 보지 않은 채 건축가에게 위치를 추측하라고 요구하는 것과 같다고 주장합니다. 가장 똑똑한 AI 모델조차도 여기서 자주 실패합니다. 왜냐하면 그들은 사물이 '무엇'인지 인식하는 데는 뛰어나지만, 고해상도 화면에서 정확히 '어디'에 있는지 파악하는 데는 서툴기 때문입니다. 그들은 "공간적으로 눈멀어 있습니다."

해결책: "보물찾기" (GUI-CURSOR)

저자 유 Zhao 와 그의 팀은 AI 에게 즉시 정답을 추측하라고 요구하는 것을 멈추기로 결정했습니다. 대신, 이 작업을 보물찾기로 바꾸었습니다.

그들은 GUI-CURSOR라는 새로운 방법을 도입했습니다. 단순히 "버튼은 (500, 500) 에 있습니다"라고 말하는 대신, AI 에게 가상 마우스 커서를 부여합니다. AI 는 커서를 화면 위를 이동하며 단계별로 목표물을 찾을 때까지 움직여야 합니다.

이 "보물찾기"의 작동 방식은 다음과 같습니다:

  1. 이동: AI 가 화면을 보고 "목표물이 저기에 있는 것 같습니다"라고 말하며 커서를 이동시킵니다.
  2. 피드백: 컴퓨터는 커서가 그 새로운 위치에 놓인 새로운 이미지를 AI 에게 보여줍니다.
  3. 확인: AI 는 새로운 이미지를 보고 스스로에게 묻습니다. "커서가 올바른 버튼 위에 있나요? 아니요? 알겠습니다, 왼쪽으로 이동해야 합니다."
  4. 반복: AI 는 "네, 찾았습니다!"라고 말할 때까지 이동하고 확인하는 과정을 반복하다가 멈춥니다.

비밀 재료: 실수에서 배우기

이 논문은 이 과정이 강화 학습에 의해 구동된다고 설명합니다. 이는 강아지를 훈련시키는 것과 같습니다.

  • 강아지가 커서를 목표물에 더 가깝게 이동시키면, "간식" (보상) 을 받습니다.
  • 강아지가 잘못된 방향으로 이동하거나, 너무 일찍 멈추거나, 빙글빙글 돌고 있다면, "아니오" (페널티) 를 받습니다.

저자들은 AI 가 효율적으로 보물을 찾도록 가르치기 위해 특별한 규칙 세트 (보상 함수) 를 만들었습니다:

  • 너무 일찍 포기하지 마세요: 아직 도착하지 않았는데 멈추면 페널티입니다.
  • 빙글빙글 돌지 마세요: 이미 갔던 곳으로 이동하면 페널티입니다.
  • 도망치지 마세요: 목표물에서 더 멀리 이동하면 페널티입니다.

왜 이것이 더 잘 작동하는가

이 논문은 이 방법이 두 가지 주요 이유로 더 우수하다고 주장합니다:

  1. 시각적 피드백 루프: 이전 방식에서는 AI 가 숫자를 추측했을 뿐, 그것이 맞는지 보지 못했습니다. 하지만 이 새로운 방식에서는 AI 가 자신의 추측이 어디에 떨어졌는지 봅니다. 지도상의 위치를 추측하는 것과 실제로 그곳을 걸어가 보물을 찾았는지 확인하는 것의 차이입니다. 이는 AI 가 "숫자"와 "시각적 지점" 사이의 연결을 학습하는 데 도움을 줍니다.
  2. 향상된 공간 추론: 저자들은 AI 를 간단한 게임으로 테스트했습니다: "검은 점이 빨간 상자 안에 있나요?" 그들은 표준 AI 모델이 이 간단한 작업에서 놀라울 정도로 서툴러서, 상자가 화면 정중앙에 있지 않으면 자주 실패한다는 것을 발견했습니다. 그러나 "보물찾기" 방법으로 훈련된 AI 는 이 게임에 명시적으로 가르치지 않았음에도 훨씬 더 잘 수행했습니다. 커서를 움직이는 법을 배우는 것이 AI 가 공간과 거리를 더 잘 이해하도록 가르치는 것 같습니다.

결과: 더 빠르고, 더 똑똑하며, 더 저렴함

팀은 그들의 새로운 AI(GUI-CURSOR) 를 다른 최상위 모델들과 비교하여 테스트했습니다.

  • 정확도: 어려운 고해상도 화면에서 이전 최고 성능 모델들을 능가했습니다.
  • 효율성: 95% 의 문제를 단 두 번의 이동으로 해결하도록 학습했습니다.
  • 데이터 절감: 이전 리더 모델이 64,000 개의 훈련 예제가 필요했던 반면, 이 결과는 단 8,000 개의 훈련 예제만으로 달성했습니다. 이는 며칠 동안 운전하는 대신 몇 시간 동안 작은 트랙에서 운전을 연습하는 것과 같습니다.

요약

이 논문은 AI 에게 컴퓨터 좌표를 위한 "한 번의 추측자"가 되도록 강요하는 대신, "호기심 많은 탐험가"가 되도록 해야 한다고 제안합니다. AI 에게 가상 마우스를 주고 이동하고, 보고, 스스로 수정하도록 함으로써, AI 는 화면의 레이아웃을 훨씬 더 잘 이해하게 됩니다. 이는 버튼과 아이콘을 찾는 데 더 똑똑하게 만들며, 놀랍게도 일반적인 기본 공간 관계를 이해하는 능력도 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →