← 최신 논문
🤖 AI

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

이 논문은 실시간 OSWorld 환경을 활용하여 GUI 에이전트를 위한 검증되고 전역적으로 균형 잡힌 감독(supervision)을 생성함으로써, 장기 과제(long-horizon tasks)에서 우수한 성능과 연산 효율성을 달면서도 현실적인 데스크톱 중단에 대한 향상된 강건성과 시각적 추론 능력의 더 나은 보존을 입증하는 훈련 단계의 탐색 및 필터링 파이프라인인 ENVS를 소개한다.

원저자: Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 컴퓨터 사용법을 가르치려 한다고 상상해 보세요. 로봇은 "항공권 예약하기"나 "문서 편집하기"와 같은 작업을 완료하기 위해 클릭, 타이핑, 창 탐색하는 법을 배워야 합니다.

문제는 컴퓨터 환경이 매우 무질서하다는 점입니다. 로봇이 실수를 하면, 작업이 완전히 끝날 때까지 어느 단계에서 실패가 발생했는지 알 수 없습니다. 그리고 그때가 되면 이미 수정하기에는 너무 늦습니다. 또한, 로봇이 실제 컴퓨터에서 수천 가지 시나리오를 수행하도록 테스트하는 것은 매우 느리고 비용이 많이 듭니다(마치 로봇이 실패하는 것을 지켜보기 위해 슈퍼컴퓨터를 대여하는 것과 같습니다).

이 논문은 ENVS(Environment-Native Verified Search)라고 불리는 새로운 방법을 통해 이 문제를 해결합니다. 이 방법이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 기존 방식: "어둠 속에서의 시행착오" (Online RL)

기존 방식(Online RL이라 불림)은 마치 학생이 실제로 차를 몰고 돌아다니다가 사고를 내면서 운전을 배우는 것과 같습니다.

  • 학생은 운전하고, 사고를 내고, 초기화하고, 다시 시도합니다.
  • 그들은 여정의 맨 마지막에 가서야 "통과" 또는 "실패" 판정을 받습니다.
  • 만약 사고가 났다면, 너무 일찍 회전했는지, 브레이크를 너무 세게 밟았는지, 혹은 표지판을 잘못 본 것인지 알 수 없습니다.
  • 이는 엄청난 시간(연산량)과 연료(비용)를 소모합니다.

2. 새로운 방식: "시뮬레이션 실험실" (ENVS)

저자들은 다른 접근 방식을 제안합니다. 로봇이 실제로 운전대를 잡기 전에, 모든 가능한 경로를 미리 테스트할 수 있는 시뮬레이션 실험실을 구축하는 것입니다.

  • 가지치기 (Branching Out): 로봇이 갈림길에 서 있다고 상상해 보세요. 단순히 하나의 길을 선택하는 대신, 시스템은 32명의 "정찰병"(가상 로봇)을 서로 다른 경로로 동시에 보냅니다.
  • 유사한 동작 그룹화: 만약 20명의 정찰병이 왼쪽으로 돌고 10명이 오른쪽으로 돈다면, 시스템은 "왼쪽"이 인기 있고 올바를 가능성이 높은 움직임이라는 것을 깨닫습니다. 그리고 그곳에 에너지를 집중합니다.
  • "검증된" 필터: 시스템은 모든 경로의 끝을 확인합니다. 정찰병이 항공권을 성공적으로 예약했습니까?
    • 예: 좋습니다! 그 경로를 "골드 스탠다드(Gold Standard)" 레슨으로 저장합니다.
    • 아니오: 그 경로는 버립니다. 로봇에게 실패하는 법을 가르치는 데 시간을 낭비하지 않습니다.
  • 결과: 로봇은 오직 이 "골드 스탠다드" 경로를 통해서만 훈련됩니다. 로봇은 실패의 기록더미가 아니라, 엄선된 성공 사례 라이브러리로부터 배웁니다.

3. "노이즈" 벤치마크: "산만한 사무실"

이 논문은 OSWORLD-NOISY라는 새로운 테스트를 도입했습니다.

  • 시나리오: 당신이 문서를 작업하려고 하는데, 몇 분마다 동료가 옆을 지나가며 소리를 지르거나, 팝업 광고가 화면을 가리거나, 전화벨이 울리는 상황입니다.
  • 테스트: 로봇이 이 소음들을 무시하고, 팝업창을 닫고, 다시 업무에 집중할 수 있습니까?
  • 결과: 새로운 "시뮬레이션 실험실" 방식(ENVS)으로 훈련된 로봇은 기존의 "시행착오" 방식으로 훈련된 로봇보다 이러한 방해 요소들을 훨씬 더 잘 처리했습니다. 로봇은 훈련 데이터 수집 과정에서 이러한 방해 상황들을 경험했기 때문에 "재집중"하고 "기다리는" 법을 배웠습니다.

4. 왜 이것이 중요한가 (결과)

논문은 ENVS의 세 가지 주요 성과를 주장합니다.

  • 더 똑똑함: 기존 방식(26.7%)보다 더 많은 작업을 정확하게 해결했습니다(성공률 30.3%).
  • 더 저렴함: 실패한 실험을 반복해서 실행할 필요가 없었기 때문에 컴퓨터 자원을 훨씬 적게 사용했습니다(약 25% 적게 사용).
  • 더 견고함: 단순히 주요 작업만 잘하게 된 것이 아니라, 훈련 데이터의 품질이 높고 "노이즈" 시나리오가 포함되어 있었기 때문에 시각적 퍼즐을 이해하는 것과 같은 다른 기술들도 실제로 더 좋아졌습니다.

요약

ENVS를 다음과 같이 생각하세요. 선생님이 단순히 학생이 시험을 보고 통과했는지 실패했는지만 보는 것이 아니라, 먼저 수천 번의 연습 시험을 치르고, 학생이 혼란스러워했던 문제들을 걸러낸 뒤, 성공적인 시도들로만 구성된 완벽한 학습 가이드를 만드는 것과 같습니다. 그 후 학생은 오직 그 완벽한 가이드만을 공부하며, 더 빠르게 배우고, 시간을 덜 쓰며, 더 소란스럽고 산만한 교실에서도 더 잘 준비될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →