← 최신 논문
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

이 논문은 다중 교사 온폴리시 증류(multi-teacher on-policy distillation)와 새롭게 구축된 Uni-GUI 데이터셋을 활용하여 통합된 크로스 플랫폼 GUI 에이전트를 훈련시키는 새로운 프레임워크인 UI-MOPD를 소개하며, 이는 데스크톱과 모바일의 전문 지식을 효과적으로 통합하는 동시에 희소한 데이터 및 상이한 상호작용 관습과 관련된 과제를 극복한다.

원저자: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 디지털 비서가 마스터 셰프인 세상을 상상해 보세요. 하지만 여기 반전이 있습니다. 이 셰프는 동시에 완전히 다른 두 개의 주방에서 요리를 해야 합니다. 한쪽 주방은 거대한 화면, 마우스, 키보드가 있는 하이테크 데스크톱 컴퓨터입니다. 다른 한쪽은 터치스크로 작동하며 물리적인 버튼이 없는 매끈한 포켓 사이즈의 휴대폰입니다. 컴퓨터 주방에서 "뒤로 가기"는 창을 닫는 것을 의미할 수 있습니다. 하지만 휴대폰 주방에서 그것은 작은 "뒤로 가기" 화살표를 탭하는 것을 의미합니다. 만약 당신이 단순히 모든 레시피를 뒤섞고 운 좋게 잘 되기를 바라며 이 셰프에게 두 곳 모두에서 요리하는 법을 가르치려 한다면, 결과는 재앙이 될 것입니다. 셰프는 혼란에 빠져 마우스 사용법을 잊어버리고, 실수로 키보드를 스와이프하려고 시도할 것입니다. 이것이 바로 과학자들이 "GUI 에이전트(GUI agents)"—우리의 디지털 삶을 수행하기 위해 클릭하고, 타이핑하고, 스와이프하도록 설계된 스마트 컴퓨터 프로그램—를 통해 직면하고 있는 문제입니다.

오랫동안 이 에이전트들은 전문가와 같았습니다. 어떤 것은 컴퓨터에 능숙했고, 다른 것은 휴대폰에 능숙했지만, 둘 다를 다룰 수는 없었습니다. 연구자들은 이 두 전문가를 단순히 하나로 합쳐서 그 결합된 지식이 슈퍼 에이전트를 만들어내기를 기대하며 이를 해결하려 노력했습니다. 하지만 이 새로운 연구가 시사하듯, 그러한 "섞고 맞추는(mix-and-match)" 방식은 종종 경계선을 흐릿하게 만들어 에이전트를 두 가지 일 모두에 더 서투르게 만듭니다. 모두의 관심사는 이것입니다: 어떻게 하면 정신을 잃거나 기술을 놓치지 않고 데스크톱과 휴대폰 사이를 매끄럽게 전환할 수 있는 단일하고 통합된 에이전트를 구축할 것인가?

여기에 칭화 대학교, 샤오미 및 기타 유수의 기관 연구진이 제안한 영리한 새로운 방법인 UI-MOPD가 등장합니다. UI-MOPD를 단순한 믹서기가 아니라, 독특한 훈련 전략을 가진 뛰어난 코치라고 생각하십시오. 학생(새로운 통합 에이전트)에게 혼탁하게 섞인 지침을 암기하도록 강요하는 대신, 코치는 두 명의 전문 멘토인 "데스크톱 구루(Desktop Guru)"와 "모바일 구루(Mobile Guru)"를 배치한 역동적인 훈련 캠프를 설정합니다.

마법이 일어나는 방식은 다음과 같습니다. 학생 에이전트는 스스로 작업을 해결하려고 시도하며 자신만의 "롤아웃(rollouts, 작업 수행 시도)"을 생성합니다. 학생이 컴퓨터 작업 중일 때, 코치는 즉시 데스크톱 구루를 불러와 구체적이고 고품질의 조언을 제공합니다. 학생이 휴대폰 작업으로 전환하면, 코치는 모바일 구루로 교체합니다. 이것이 바로 **다중 플랫폼 온폴리시 증류(Multi-Platform On-Policy Distillation)**입니다. 핵심은 학생이 차이점을 평균 내려고 노력하는 대신, 적절한 시간에 적절한 전문가로부터 배우는 것입니다. 데스크톱 구루는 학생에게 스와이프하는 법을 가르치려 하지 않고, 모바일 구루는 학생에게 마우스 사용법을 가르치려 하지 않습니다. 그들은 "행동 앵커(behavioral anchors)" 역할을 하여, 학생의 행동이 현재 처한 환경의 특정 규칙에 충실하도록 유지합니다.

연구진은 이를 가능하게 하기 위해 Uni-GUI라는 거대하고 고품질인 데이터셋을 구축했습니다. 그들은 컴퓨터와 휴대폰 모두에서 작업이 수행되는 거의 10,000개의 고품질 작동 예시를 수집하기 위해 특별한 도구를 만들었습니다. 그들은 잘못된 시도들을 걸러내고 실제로 성공한 사례들만을 남겨두어, 선생님들이 학생에게 보여줄 완벽한 예시를 확보했습니다.

이 새로운 접근 방식을 테스트했을 때, 결과는 유망했습니다. 까다로운 컴퓨터 벤치마크인 OSWorld에서 이 새로운 에이전트는 **38.2%**의 성공률을 보였습니다. 모바일 벤치마크인 MobileWorld에서는 **12.0%**의 성공률을 기록했습니다. 이 수치들은 UI-MOPD가 단순히 데이터를 섞거나 모델을 병합하려 했던 이전 방법들보다 훨씬 뛰어나다는 것을 시사합니다. 예를 들어, 다른 방법들은 한쪽 플랫폼을 개선하는 대신 다른 쪽을 망가뜨릴 수 있지만, UI-MOPD는 양쪽 모두에서 동시에 성능을 높였습니다. 이 연구는 이러한 "전문가 코치" 방식이 에이전트가 서로 다른 기기의 특유한 기벽들을 학습하면서도 일반적인 지능을 유지하도록 도와주며, 초기 모델들을 혼란스럽게 했던 "평균화"의 함정을 피하게 해준다는 것을 보여줍니다.

요약하자면, 이 논문은 만약 당신이 당신의 노트북과 휴대폰을 모두 다룰 수 있는 스마트한 에이전트를 원한다면, 단순히 두 개를 뭉쳐놓지 말라고 제 제안합니다. 대신, 어떤 화면을 보고 있느냐에 따라 정확히 어떤 전문가의 말을 들어야 하는지 아는 스마트한 시스템을 부여하십시오. 이것은 당신의 디지털 비서가 단지 하나의 영역이 아닌, 진정으로 모든 디지털 영역의 마스터가 되는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →