← 최신 논문
🤖 AI

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

본 논문은 기존 방법들의 보상-그래디언트 불일치(reward-gradient misalignment) 및 결과 수준 감독(outcome-level supervision)의 한계를 극복하기 위해 미세한 궤적 수준의 품질 신호를 통합함으로써 GUI 에이전트 학습을 향상시키는 길이 인식 대조 학습 프레임워크인 LACL-GUI를 제안한다.

원저자: Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세계에서 컴퓨터는 단순히 간단한 명령을 따르는 것을 넘어, 인간처럼 복잡한 소프트웨어를 탐색하고, 적절한 버튼을 클릭하며, 양식을 작성할 수 있는 자율적인 비서 역할을 하도록 점점 더 많은 요구를 받고 있습니다. 이러한 디지털 작업자라고 불리는 GUI 에이전트는 컴퓨터 화면을 보고 그 안에서 일어나는 일을 이해할 수 있는 고급 인공지능 모델에 의존합니다. 수년 동안 이러한 에이전트를 교육하는 가장 효과적인 방법은 강화 학습이라고 불리는 방식이었습니다. 이 과정에서 에이전트는 과제를 수행하려고 시도하고, 마지막에 성공했는지 실패했는지를 나타내는 단순한 "예" 또는 "아니오" 신호를 받은 다음, 다시 시도하기 위해 자신의 행동을 조정합니다. 이러한 시행착오 방식은 인상적인 결과를 만들어냈지만, 연구자들은 컴퓨터가 그 최종적인 예/아니오 답변으로부터 학습하는 방식에 결함이 있다는 것을 발견했습니다. 표준적인 방법들은 종로 종종 어떤 구체적인 행동이 성공이나 실패를 이끌었는지에 대해 혼란을 겪으며, 이로 인해 학습 과정이 불안정해지거나 비효율적이게 됩니다. 이는 마치 학생이 긴 연습이 끝난 후에야 선생님으로부터 "잘했어" 또는 "다시 해봐"라는 말만 들을 뿐, 어떤 단계가 도움이 되었고 어떤 단계가 낭비였는지에 대해 정확한 지도를 받지 못한 채 복잡한 기술을 배우려는 것과 같습니다.

홍콩, 베이징, 에드먼턴의 연구진은 이 문제를 해결하기 위해 LACL-GUI(Length-Aware Contrastive Learning for GUI Agents)라고 불리는 새로운 접근 방식을 개발했습니다. 모든 성공적인 시도를 똑같이 좋은 것으로 취급하고 모든 실패한 시도를 똑같이 나쁜 것으로 취급하는 대신, 이들의 방법은 과제가 어떻게 수행되었는지 그 세부 사항을 더 자세히 살펴봅니다. 그들은 모든 성공이 다 같은 것이 아님을 깨달았습니다. 어떤 에이전트는 다섯 번의 빠르고 정확한 클릭으로 문제를 해결할 수도 있지만, 다른 에이전트는 화면을 배회하며 불필요한 움직임을 만드는 등 스무 단계를 거친 후에야 겨우 성공할 수도 있습니다. 마찬가지로, 실패도 항상 완전한 재앙은 아닙니다. 어떤 에이전트는 첫 단계에서 바로 막힐 수도 있고, 다른 에이전트는 거의 모든 길을 제대로 따라가다가 마지막에 단 한 번의 실수로 실패할 수도 있습니다. 연구진의 새로운 시스템은 에이전트가 더 짧고 효율적인 성공 경로를 선호하도록 가르치고, "아까운 실패(near-miss)"가 초기에 잘못된 길로 들어선 실패보다 실제로 더 가치 있는 학습 기회라는 점을 인식하도록 가르칩니다.

이를 달er하기 위해 연구진은 동일한 과제에 대한 서로 다른 시도들을 나란히 비교하는 시스템을 구축했습니다. 에이전트가 과제를 수행하려고 시도하면, 시스템은 성공한 시도와 그렇지 못한 시도들을 포함한 그룹을 수집합니다. 성공한 시도들의 경우, 시스템은 가장 짧은 시도를 식별하여 이를 기준으로 삼습니다. 그런 다음 시스템은 에이전트가 그 효율적인 사례를 더 닮도록 부드럽게 권장하며, 적은 단계로 과제를 완수하도록 보상하고 불필요한 움직임에 대해서는 벌점을 부여합니다. 실패한 시도의 경우, 시스템은 에이전트가 경로를 벗어나기 전까지 얼마나 멀리 갔는지를 살펴봅니다. 만약 에이전트가 오랫동안 올바른 경로를 따르다가 실수를 했다면, 시스템은 이를 "아까운 실패"로 간주하여 더 완만한 벌칙을 줍니다. 즉, 무언가를 배웠다는 점을 인정하는 것입니다. 반면, 에이전트가 즉시 경로를 벗어났다면 더 강한 벌칙을 부여합니다. 이는 기존 방식에서 사용되던 단순한 합격/불합격 판정보다 훨씬 더 미묘한 학습 신호를 생성합니다. 또한 시스템은 성공적인 시도들을 담은 특별한 메모리 뱅크를 유지하여, 새로운 실패 사례를 지금까지 본 최고의 성공 사례들과 비교함으로써 에이전트가 항상 명확한 목표를 향해 나아갈 수 있도록 합니다.

연구진은 문서 편집, 이메일 관리, 이미지 편집 소프트웨어 사용 등 다양한 실제 컴퓨터 작업이 포함된 OSWorld라는 포괄적인 벤치마크를 통해 이 새로운 방법을 테스트했습니다. 그들은 강력한 AI 모델을 에이전트의 중추로 사용했으며, 수백 가지의 서로 다른 과제를 해결하도록 훈련했습니다. 결과는 새로운 방법이 기존의 최선 기술들을 일관되적으로 능가한다는 것을 보여주었습니다. 더 큰 규모의 AI 모델에서, 이 새로운 접근 방식은 표준 방식에 비해 성공률을 거의 3%포인트 향상시켰는데, 이는 이 분야에서 상당한 진전입니다. 더 중요한 것은, 이 새로운 방법으로 훈련된 에이전트들이 단순히 더 자주 성공할 뿐만 아니라, 더 효율적이라는 점입니다. 성공했을 때 그들은 더 적은 단계를 거쳐 목표에 도달했으며, 불필요한 행동을 줄였습니다. 실패했을 때도 시스템은 완전한 손실과 아쉬운 실패를 더 잘 구분해 냈으며, 이를 통해 에이전트가 자신의 실수로부터 더 효과적으로 학습할 수 있게 했습니다.

이 연구는 더 나은 디지털 비서를 만드는 열쇠가 최종 결과 그 너머를 보는 데 있다는 것을 시사합니다. AI에게 결과뿐만 아니라 과정의 질을 감상하도록 가르침으로써, 연구진은 이러한 에이전트들이 학습할 수 있는 더 안정적이고 효과적인 방법을 만들어냈습니다. 이 방법은 에이전트의 모든 움직임을 지켜보는 인간 교사를 필요로 하지 않으며, 단지 시도 자체의 구조를 사용하여 학습을 유도합니다. 이러한 접근 방식은 미래에 더 정밀하고 경제적인 수준으로 복잡한 디지털 작업을 처리할 수 있는, 더 신뢰할 수 있고 효율적인 AI 에이전트를 구축하는 데 기여할 수 있습니다. 이 연구 결과는 이진법적인 성공과 실패의 세계에서도, 적절히 이해된다면 기계가 행동하는 방식을 극적으로 개선할 수 있는 풍부한 품질과 미묘함의 영역이 존재함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →