← 최신 논문
🤖 AI

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse는 어텐션 메커니즘, OCR 기반 텍스트, 그리고 아이콘 수준의 캡션을 합의-단일 정점(Consensus-SinglePeak) 융합 전략을 통해 통합함으로써, 작업별 미세 조정 없이도 다양한 인터페이스 전반에서 견고한 성능을 달성하여 GUI 그라운딩을 향상시키는 새로운 어텐션 기반 프레임워크이다.

원저자: Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 똑똑하지만 약간 주의력이 산만한 로봇에게 당신의 컴퓨터나 휴대폰을 사용하는 법을 가르치려 한다고 상상해 보세요. 당신이 "빨간색 'Submit' 버튼을 클릭해"라는 음성 명령을 내립니다. 로봇은 화면을 보고, 당신의 말을 이해하고, 그 버튼을 정확히 향해 손가락을 가리켜야 합니다. 이 작업을 **GUI 그라운딩(GUI Grounding)**이라고 부릅니다.

오랫동안 로봇에게 이를 가르치는 가장 좋은 방법은 수백만 개의 화면과 버튼 사례를 보여주어, 본질적으로 정답을 암기하도록 강요하는 것이었습니다. 이것은 마치 학생이 교과서에 있는 모든 질문과 답을 통째로 외워 시험을 준비하는 것과 같습니다. 교과서 내용에는 효과적이지만, 만약 선생님이 글꼴이나 레이아웃을 바꾸면 학생은 혼란에 빠집니다. 이 방식은 방대한 양의 "정답지"가 필요하기 때문에 비용이 많이 들고 느립니다.

최 최근 연구자들은 로봇에게 아무것도 암기하지 말고, 단지 화면을 보고 있는 것에 "주의를 기울이라"고 요청하는 다른 접근 방식을 시도했습니다. 이것은 로봇에게 화면을 보고 "내 눈이 자연스럽게 당신이 언급한 버튼으로 향합니다"라고 말하게 하는 것과 같습니다. 이 방식은 더 빠르고 교과서를 암기할 필요도 없습니다. 하지만 이 논문은 이 방법이 종종 신뢰할 수 없다고 주장합니다. 로봇의 "시선"은 안개가 낀 창문을 통해 지도를 보는 것처럼 흐릿할 수 있습니다. 일반적인 영역은 볼 수 있지만 정확한 지점은 놓칠 수 있습니다.

트라이퓨즈(Trifuse): 세 명의 탐정

저자들은 **트라이퓨즈(Trifuse)**라고 불리는 새로운 시스템을 제안합니다. 트라이퓨즈는 화면을 보는 데 단 한 가지 방법만을 사용하는 대신, 각기 다른 초능력을 가진 세 명의 탐정 팀처럼 작동하여 목표물을 찾아냅니다.

  1. 어텐션 탐정 (The "Gaze", 시선): 이것은 로봇의 자연스러운 주의 집중 메커니즘입니다. 화면을 보고 자신의 내부 초점이 어디에 맺히는지 확인합니다.

    • 문제점: 때때로 시선이 너무 넓게 퍼지거나 무관한 단어들에 의해 주의가 분산됩니다.
    • 해결책: 트라이퓨즈는 이 탐정이 "노이즈"(작고 중요하지 않은 단어들)를 무시하고, 위치를 포착하는 데 능숙한 가장 관련성 높은 "헤드(heads)"(뇌의 특정 부분)에만 집중하도록 가르칩니다.
  2. OCR 탐정 (The "Reader", 독자): 이 탐정은 도구를 사용하여 화면의 모든 단어를 읽습니다.

    • 강점: 만약 당신이 "'Submit'을 클릭해"라고 말한다면, 이 탐정은 "Submit"이라는 단어가 정확히 어디에 있는지 압니다.
    • 약점: 하지만 당신이 "빨간색 쓰레기통을 클릭해"라고 말한다면 도움을 줄 수 없습니다. 쓰레기통에는 텍તાઓ(텍스트)가 없기 때문입니다.
  3. 캡션 탐정 (The "Describer", 묘사가): 이 탐정은 아이콘과 버튼을 보고 이를 평이한 언어로 설명합니다 (예: "이것은 빨간색 쓰레기통 아이콘입니다").

    • 강점: 텍스트가 없는 시각적 형태와 색상을 이해합니다.
    • 약점: 텍스트 중심의 작업에서는 독자만큼 정밀하지 못할 수 있습니다.

마법의 기술: "컨센서스-싱글피크(Consensus-SinglePeak)" 전략

이제 이 세 명의 탐정이 각자의 추측을 외치고 있다고 상상해 보세요. 때로는 세 명 모두 동의하기도 합니다 ("확실히 오른쪽 상단에 있는 버튼이야!"). 때로는 한 명만이 강력한 직감을 갖기도 합니다 ("다른 이들은 불확실해도, 나는 'Submit'이라는 단어를 아주 명확하게 보고 있어!").

기존 방식들은 단순히 그들의 추측을 평균 내었습니다. 이는 마치 "좋아, 중간 지점에서 만나자"라고 말하는 것과 같으며, 두 명이 틀리고 한 명이 맞더라도 그렇게 행동하는 것과 같습니다.

트라이퓨즈는 영리한 전략인 **컨센서스-싱글피크(Consensus-SinglePeak, CS)**를 사용합니다:

  • 컨센서스(Consensus, 합의): 세 명의 탐정이 한 지점에 동의하면, 트라이퓨즈는 "좋아! 저기가 확실한 목표물이야"라고 말합니다. 이는 답변을 매우 신뢰할 수 있게 만듭니다.
  • 싱글 피크(Single Peak, 단일 정점): 만약 한 명의 탐정이 매우 강력하고 명확한 신호(예: 'Submit'이라는 단어를 포착한 독자)를 가지고 있다면, 트라이퓨즈는 "좋아, 다른 이들이 확신이 없더라도, 이 하나의 신호는 무시하기에는 너무 강력해"라고 판단합니다. 즉, 그 단일하고 명확한 단서를 증폭시킵니다.

이 방식을 통해 트라이퓨즈는 두 가지 장점을 모두 얻습니다. 모두가 동의할 때는 안전하며, 한 명의 전문가가 확신할 때는 그 전문가를 믿을 만큼 용감합니다.

마지막 단계: "줌인(Zoom-In)"

세 명의 탐정이 있더라도, 화면이 매우 크고 로봇이 낮은 해상도의 "썸네일"로 화면을 보기 때문에 여전히 약간 어긋날 수 있습니다. 그래서 트라이퓨즈는 2단계 프로세스를 사용합니다.

  1. 대략적인 추측: 전체 화면을 보고 일반적인 영역을 선택합니다.
  2. 줌인(Zoom-In): 그 작은 영역만을 찍은 사진을 가져와서, 그 부분을 확대하고, 탐정들에게 다시 한번 살펴보라고 요청합니다. 이것은 마치 흐릿한 사진을 찍은 뒤, 흥미로운 부분만 크롭(crop)하여, 그 지점의 정확한 픽셀을 찾기 위해 고해상도 사진을 찍는 것과 같습니다.

결과

논문에 따르면 트라이퓨즈는 믿을 수 없을 정도로 효과적입니다.

  • 암기 불필요: 수백만 개의 사례를 암기한 시스템과 비슷하거나 오히려 더 나은 성능을 보이면서도, 아무것도 미리 공부할 필요가 없었습니다. 실시간으로 학습했습니다.
  • "시선" 단독 모델보다 우수: 추가적인 도움(독자와 묘사가)을 사용하기 때문에 기존의 "어텐션 전용" 방식들을 큰 차이로 앞섭니다.
  • 어디서나 작동: 화면이 어떻게 생겼든 상관없이 휴대폰, 컴퓨터, 웹사이트에서 모두 작동합니다.

요약하자면, 트라이퓨즈는 세 가지 서로 다른 방식으로 보는 법을 결합하고, 노이즈를 걸러내며, 마지막 답을 위해 줌인을 하는 방식을 통해, 단 하나의 교과서도 암기하지 않고 로봇이 화면의 올바른 지점을 가리키도록 가르치는 스마트하고 데이터 효율적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →