← 최신 논문
💬 NLP

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

본 논문은 인과적 지식 증류, 밀도 인식 예시 재선정, 정교화된 모델 학습이라는 3 단계 과정을 통해 세계 지식을 명시적으로 내재화함으로써 멀티모달 GUI 에이전트의 실제 작업 수행 능력을 향상시키는 미드-트레이닝 프레임워크인 GUI-CIDER 를 제안한다.

원저자: Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스마트폰이나 컴퓨터를 사용하는 법을 로봇에게 가르치려 한다고 상상해 보세요. 로봇이 인간처럼 올바른 버튼을 누르고, 메뉴를 스크롤하며, 앱을 여는 능력을 갖추길 원합니다.

이 논문은 로봇을 가르치는 현재의 방법들이 다소 암기식 학습과 비슷하다고 주장합니다. 만약 로봇에게 누군가 "플러스" 버튼을 클릭하여 작업을 추가하는 동영상을 보여준다면, 로봇은 "아, 플러스 기호가 보이면 클릭해야겠구나"라고 배웁니다. 하지만 로봇이 약간 다른 화면이나 새로운 앱을 마주치면 막힙니다. 왜냐하면 그것은 실제로 현실 세계에서 "플러스" 버튼이 무엇을 의미하는지 이해하지 못하기 때문입니다. 로봇은 단지 패턴을 암기했을 뿐입니다.

저자들은 이를 해결하기 위해 GUI-CIDER라는 새로운 방법을 제안합니다. 이는 로봇에게 누군가가 작업을 수행하는 동영상을 보여주는 대신, 화면 세계가 어떻게 작동하는지에 대한 "교과서"를 제공하는 것과 같습니다.

GUI-CIDER 는 다음과 같이 세 가지 간단한 단계로 작동합니다:

1. 행동을 이야기로 변환하기 (데이터 합성)

일반적으로 로봇 훈련 데이터는 "여기 클릭", "위로 스크롤", "저것 입력"과 같은 원시 행동의 목록일 뿐입니다. 매우 건조하고 기계적입니다.

GUI-CIDER 는 이러한 원시 행동 로그를 가져와 스마트 AI 를 사용하여 이야기로 다시 씁니다.

  • 비유: 스포츠 해설자가 경기를 지켜보는 상황을 상상해 보세요. 해설자가 단순히 "A 선수가 공을 찼다"라고 말하는 대신, 찼는지 설명합니다. "A 선수가 공을 찬 것은 수비가 열려 있었기 때문이며, 이 움직임은 골을 넣기 위해 고안된 것이다."
  • 논문의 수행 내용: 원시 화면 상호작용을 가져와 두 가지 층위의 "이야기"를 추가합니다.
    • 계획: 큰 목표는 무엇인가? (예: "새로운 작업을 추가해야 한다.")
    • 원인: 왜 그 특정 클릭이 발생했는가? (예: "새로운 항목을 생성하려면 인터페이스가 플러스 기호를 클릭하도록 요구하기 때문에, 그리고 이 행동이 '작업 추가' 메뉴를 트리거할 것이기 때문에 플러스 기호를 클릭했다.")
      이것은 지루한 클릭 목록을 인터페이스가 어떻게 그리고 작동하는지에 대한 풍부한 인과적 설명으로 바꿉니다.

2. 최고의 이야기 선별하기 (예시 재선택)

이제 수백만 개의 이러한 "이야기"가 있는 도서관을 상상해 보세요. 일부는 훌륭하지만, 많은 것들은 반복적이거나 혼란스럽습니다. 로봇에게 모든 것을 공급하면 소음에 의해 혼란을 겪을 수 있습니다.

GUI-CIDER 는 최고의 책만 보관하는 엄격한 사서처럼 작동합니다.

  • 비유: 요리하는 법을 배우려 한다고 상상해 보세요. 1 만 개의 레시피 더미가 있습니다. 일부는 완벽하지만, 5 천 개는 "물을 끓이다"가 반복된 것이고, 2 천 개는 당신이 이해하지 못하는 언어로 쓰여 있습니다. 당신은 요리의 논리를 설명하는 것들 (예: "물이 끓으면 파스타를 넣는다") 을 유지하고, 지루하고 반복적인 것들은 버리고 싶을 것입니다.
  • 논문의 수행 내용: 수학적 공식을 사용하여 데이터를 필터링합니다. 강력한 "인과" 논리를 가진 이야기들 (요리 설명과 같은) 에는 보상을 주고, 서로 중복된 이야기들에는 페널티를 부과합니다. 이로써 로봇은 고품질이고 비반복적인 "교과서"를 갖게 됩니다.

3. "중간 훈련" (지식 내면화)

마지막으로, 로봇은 이 필터링된 고품질 교과서를 읽습니다.

  • 비유: 셰프의 동영상을 보는 것 (이는 표준 훈련과 같습니다) 대신, 로봇은 요리의 원리를 설명하는 요리책을 읽고 앉습니다. "열은 물질을 변화시킨다"와 "재료들은 상호작용한다"는 것을 배웁니다.
  • 논문의 수행 내용: 그들은 로봇에게 특정 작업을 가르치기 전에 이 새로운 데이터로 훈련시킵니다. 이를 "중간 훈련"이라고 합니다. 목표는 지식을 "내면화"하는 것입니다. 로봇은 더 이상 "여기 클릭"을 암기하는 것을 멈추고, "이 버튼은 X 를 수행하기 위해 존재하므로 X 가 필요할 때 클릭해야 한다"는 것을 이해하기 시작합니다.

결과

저자들은 이 방법을 여러 벤치마크 (Android 폰에서 작업 해결 또는 다양한 앱 탐색 등) 에서 테스트했습니다.

  • 결과: 이 방법으로 훈련된 로봇들은 자신이 무엇을 하고 있는지 이해하는 능력이 훨씬 향상되었습니다. 그들은 단순히 추측한 것이 아니라, 실제로 인터페이스를 이해했습니다.
  • 놀라운 점: 이 방법으로 훈련된 더 작은 로봇 (40 억 개 파라미터) 이 실제로 구식 표준 방법으로 훈련된 훨씬 더 큰 로봇 (80 억 개 파라미터) 보다 더 좋은 성능을 발휘했습니다. 이는 더 큰 두뇌를 갖는 것보다 더 나은 지식을 갖는 것이 더 중요함을 시사합니다.

요약

이 논문은 더 나은 GUI 에이전트를 만들기 위해 단순히 더 많은 원시 데이터를 공급해서는 안 된다고 주장합니다. 대신 우리는 다음과 같이 해야 합니다:

  1. 원시 행동을 논리적이고 인과적인 이야기로 번역합니다.
  2. 지루하고 반복적인 이야기들을 필터링합니다.
  3. 로봇에게 인터페이스의 이동이 아닌 규칙을 이해하도록 이 이야기들을 가르칩니다.

이 접근법인 GUI-CIDER는 로봇이 행동을 반복하는 "앵무새"에서 디지털 인터페이스가 어떻게 작동하는지 이해하는 "학생"으로 이동하도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →