← 최신 논문
💻 computer science

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

본 논문은 771,000 개의 스크린샷에 걸쳐 2,100 만 개의 UI 요소에 대한 밀집 주석이 포함된 대규모 데이터셋인 ScreenParse 와, 이 데이터로 훈련되어 스크린 파싱에서 더 큰 기반 모델들을 크게 능가하며 전이 가능한 구조적 사전 지식을 통해 그라운딩 능력을 향상시키는 소형 모델인 ScreenVLM 을 소개합니다.

원저자: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"희소 그라운딩을 넘어 완전한 화면 파싱 감독으로 이동"이라는 논지에 대한 설명을 창의적인 비유와 함께 쉬운 언어로 번역한 것입니다.

큰 문제: "스포트라이트" 대 "온전한 방"

로봇이 바쁜 거실을 어떻게 이동하는지 가르치려 한다고 상상해 보세요.

  • 옛 방식 (희소 그라운딩): 대부분의 현재 AI 훈련은 한 번에 한 개의 물체에만 스포트라이트를 비추는 것과 같습니다. "리모컨을 집어라"라는 지시가 주어지면 로봇은 리모컨 모양만 배웁니다. 커피 테이블, 램프, 러그, TV 는 무시합니다. 그런 다음 "소파에 앉아라"라고 요청하면, 소파가 어디에 있는지 또는 어떤 모양인지 전혀 배우지 않았기 때문에 혼란스러워할 수 있습니다. 로봇은 지시받은 특정 물체만 알고 있을 뿐입니다.
  • 새로운 방식 (ScreenParse): 이 논문은 진정한 지능형 컴퓨터 에이전트를 만들기 위해서는 천장등을 켜고 로봇에게 온전한 방을 한 번에 보여줘야 한다고 주장합니다. 모든 단일 물체, 그 위치, 이름, 그리고 무엇을 말하는지 동시에 가르쳐야 합니다.

해결책: ScreenParse ("슈퍼 지도")

저자들은 ScreenParse라는 거대한 새로운 데이터셋을 만들었습니다. 이는 인터넷의 거대하고 초정밀한 지도라고 생각하세요.

  • 무엇이 들어있나요? 웹사이트 스크린샷 771,000 개가 포함되어 있습니다.
  • 얼마나 상세한가요? 이전 지도들이 "중요한" 버튼만 표시했다면, 이 지도는 모든 것을 표시합니다. 버튼, 텍스트 상자, 이미지, 로고와 같은 2100 만 개의 개별 요소를 식별하고 55 가지 유형 중 하나로 레이블을 지정합니다.
  • 규모: 이는 주요 도로뿐만 아니라 한 도시 전체의 모든 집, 우체통, 나무, 거리 표지판까지 보여주는 지도와 같습니다.

어떻게 만들었나요: "Webshot" 공장

"2100 만 개 항목을 어떻게 레이블을 지정했나요? 백만 명을 고용했나요?"라고 물을 수 있습니다.
아닙니다. 그들은 Webshot이라는 자동화 공장을 구축했습니다.

  1. 크롤러: 100 만 개의 서로 다른 웹사이트를 방문했습니다 (모든 거리의 사진을 찍는 관광객처럼).
  2. 스캐너: 페이지의 모든 보이는 요소를 자동으로 찾도록 컴퓨터 프로그램을 사용했습니다 (모든 먼지 덩어리를 보는 로봇 진공청소기처럼).
  3. 편집자 ("심판"): 컴퓨터가 실수를 할 수 있기 때문에 (예: 그림자를 버튼으로 레이블 지정), 스마트 AI(비전 언어 모델) 를 "품질 심판"으로 사용했습니다. 이는 컴퓨터의 작업을 검토하고 레이블을 수정하며, 지저분하거나 혼란스러운 스크린샷은 폐기했습니다.

주인공: ScreenVLM ("소형 전문가")

이 새로운 "슈퍼 지도"로 그들은 ScreenVLM이라는 새로운 AI 모델을 훈련시켰습니다.

  • 비유: 도서관을 상상해 보세요. 대형 기반 모델 (Qwen 또는 InternVL 등) 은 거대하고 무거운 백과사전과 같습니다. 많은 것을 알고 있지만 운반하기 느리고 사용 비용이 비쌉니다.
  • ScreenVLM주머니 크기의 매우 전문화된 현장 가이드와 같습니다. 훨씬 작습니다 (3 억 1600 만 개 파라미터만 포함) 하지만 "슈퍼 지도"로 훈련되었기 때문에 화면 레이아웃을 이해하는 데 놀라울 정도로 뛰어납니다.
  • 비밀 재료: 그들은 ScreenVLM 에게 단순히 텍스트를 읽는 것보다 페이지의 "구조"(무엇이 어디에 있는지) 에 더 주의를 기울이도록 가르쳤습니다. 이는 학생에게 표지판의 단어뿐만 아니라 건물의 평면도를 외우도록 가르치는 것과 같습니다.

결과: 왜 중요한가요

이 논문은 이 새로운 접근 방식을 세 가지 방법으로 테스트했습니다.

  1. 테스트: 모델들에게 전체 화면을 설명하도록 요청했습니다. ScreenVLM 은 거대하고 무거운 모델들 (약 30% 정확도) 에 비해 모든 것을 찾는 데 훨씬 더 뛰어났습니다 (60% 정확도).
  2. 전이: 그들은 다른 대형 모델들에게 ScreenParse 지도를 사용하여 "단기 집중 과정"을 제공했습니다. 갑자기 그 대형 모델들도 화면 이해 능력이 크게 향상되었습니다. 이는 "온전한 방"을 배우는 것이 그들이 구축한 로봇뿐만 아니라 어떤 로봇에게도 도움이 되는 기술임을 증명합니다.
  3. 속도: ScreenVLM 은 작기 때문에 대형 모델보다 4 배 더 빠르게 실행됩니다. 이는 거대한 데이터 센터가 아닌 일반 노트북이나 휴대폰에서도 실행될 수 있음을 의미합니다.

결론

이 논문은 더 나은 컴퓨터 사용 에이전트를 구축하려면 한 번에 한 가지 것만 찾도록 가르치는 것을 멈추어야 한다고 주장합니다. 대신, 그들에게 온전한 그림을 한 번에 보도록 가르쳐야 합니다. 화면의 모든 단일 픽셀과 요소를 레이블 지정하는 거대한 데이터셋을 생성함으로써, 그들은 현재 거대 모델들보다 컴퓨터 화면을 더 잘 이해하는 작고 빠르며 놀라울 정도로 지능적인 AI 를 구축했습니다.

이 논문이 주장하지 않는 것:

  • 아직 모바일 앱이나 데스크톱 소프트웨어에서 완벽하게 작동한다고 주장하지 않습니다 (주로 웹사이트에 초점을 맞춤).
  • 모든 로봇 문제를 해결한다고 주장하지 않으며, 로봇이 행동하기 전에 화면을 "보고" "이해"하는 방식을 개선한다는 점만 주장합니다.
  • 의료 또는 임상 용도에 대해 언급하지 않습니다. 초점은 엄격하게 컴퓨터 인터페이스 (GUI) 와 웹 페이지에 맞춰져 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →