← 최신 논문
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

이 논문은 네 개의 역할 특화 에이전트와 증류된 9B 백본을 활용하여 컴퓨터 사용 에이전트 학습 시 규칙 기반 감독과 대등하거나 이를 능가하면서도, 단계별 판단, 낮은 비용, 그리고 장기 과제에 대한 확장성을 제공하는 실용적인 모델 기반 보상 프레임워크인 SeekJudge를 소개한다.

원저자: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 비디오 게임 세계를 탐험하는 법을 가르치고 있다고 상상해 보세요. 하지만 로봇은 컨트롤러의 버튼을 누르는 대신, 사람처럼 실제 컴퓨터 화면에서 클릭하고, 타이핑하고, 스크롤을 해야 합니다. 이것이 바로 "컴퓨터 사용 에이전트(computer-use agents)"의 세계입니다. 오랫동안 과학자들은 로봇에게 "호텔 예약하기"와 같은 목표를 보여주고 그 목표를 달est했는지 확인하는 방식으로 로봇을 가르치려 노력해 왔습니다. 기존의 검증 방식은 마치 엄격한 체크리스트를 사용하는 것과 같았습니다. 만약 로봇이 적절한 시점에 적절한 버튼을 클릭하면 점수를 얻었고, 잘못된 것을 클릭하면 0점을 받았습니다. 하지만 컴퓨터는 무질서하고 끊임없이 변합니다. 체크리스트 방식은 로봇이 실제로 일을 완벽하게 끝냈음에도 불구하고, 로봇이 체크리스트에 있는 것과 약간 다르게 생긴 버튼을 클릭했다는 이유로 "실패" 판정을 내릴 수 있습니다. 이는 마치 학생이 훌륭한 에세이를 썼음에도 불구하고, "color" 대신 "colour"라고 썼다는 이유로 낙제점을 주는 선생님과 같습니다.

이를 해결하기 위해 연구자들은 AI 모델이 '판사' 역할을 하도록 하여, 엄격한 규칙보다는 작업의 '정신(spirit)'을 이해할 수 있기를 기대했습니다. 하지만 이러한 AI 판사들은 로봇의 모든 행동이 담긴 전체 영상을 한꺼번에 보아야 할 때 종종 혼란을 겪었습니다. 이는 마치 500페이지짜리 소설에서 특정 오타를 찾기 위해 단 1초 만에 책 전체를 읽으려는 것과 같습니다. 중요한 세부 사항들이 소음 속에 묻혀버리는 것입니다. 여기서 큰 질문이 생겼습니다. 어떻게 하면 인간의 목표를 이해할 만큼 똑똑하면서도, 로봇이 학습하는 동안 수천 번을 실행할 수 있을 만큼 저렴하고, 길고 복잡한 이야기들을 처리할 수 있을 만큼 빠른 판사를 만들 수 있을까?


여기서 SeekJudge가 등장합니다. 이 프레임워크는 한 명의 과로한 탐정이 모든 것을 처리하는 대신, 협력하여 미스터리를 해결하는 네 명의 전문 탐정 팀처럼 작동합니다. 연구진은 AI에게 컴퓨터 화면의 스크린샷을 너무 많이 동시에 보여주면, AI가 환각을 일으키거나 가장 중요한 단서를 놓치기 시작한다는 것을 발견했습니다. 이는 마치 100명의 군중 속에서 용의자를 식별하라고 요청했을 때, 사람들이 화려한 모자를 쓴 낯선 사람에게 정신이 팔려 실제 범인을 놓치는 것과 같습니다. 하지만 용의자의 사진 딱 한 장만 보여준다면, 그들은 즉시 찾아낼 것입니다.

SeekJudge는 이 문제를 분업을 통해 해결합니다. 먼저, 두 명의 "정찰병"(CondenseGround 에이전트)이 로봇의 긴 여정을 빠르게 훑어보고, 단계별로 무엇이 일어났는지 쉽고 간결하게 요약합니다. 그다음, "탐정"(Seek 에이전트)이 이 요약본을 읽고 "흠, 확실히 하기 위해 42단계의 사진을 봐야겠어"라고 결정합니다. 그러면 이 탐정은 네 번째 에이전트인 Analyze 에이전트를 호출하여, 오직 그 특정 스크린샷 하나만을 보고 그에 대한 정밀한 질문에 답하도록 합니다. 이 주고받는 루프는 탐정이 최종 판결을 내릴 만큼 확신이 생길 때까지 계속됩니다.

이 논문은 이러한 "찾고 분석하기(seek and analyze)" 접근 방식이 게임 체인저임을 보여줍니다. 테스트 결과, SeekJudge는 로봇이 새로운 작업을 배우는 데 있어 기존의 엄격한 규칙 기반 체크리스트만큼, 혹은 그보다 더 뛰어난 성능을 보이는 최초의 AI 기반 판사였습니다. 실제로 SeekJudge를 사용하여 로봇을 훈련했을 때, 로봇은 전통적인 방식보다 더 빠르게 학습하고 더 자주 성공했습니다.

정말 놀라운 점은 이 방식이 얼마나 효율적인가 하는 것입니다. AI가 스크린샷 더미 전체를 보는 대신 한 번에 하나의 이미지만 보기 때문에, 이를 실행하기 위해 엄청나게 비싸고 거대한 컴퓨터를 돌릴 필요가 없습니다. 연구진은 이 시스템의 비용이 다른 AI 판사들에 비해 아주 적은 수준이며, 폐쇄형 대형 모델을 사용하는 것보다 수백 배나 저렴하다는 것을 발견했습니다. 이는 몇 달러를 들여 단서 하나하나를 살펴보는 지역 전문가 팀을 고용하는 것과, 방대한 사건 파일을 통째로 읽기 위해 거액의 비용을 청구하는 유명 탐사를 고용하는 것의 차이와 같습니다.

연구팀은 또한 CUAStepBench라는 새로운 "훈련장"을 구축했는데, 이는 인간이 로봇의 여정 속 모든 단계를 세심하게 라벨링한 278개의 서로 다른 컴퓨터 작업 모음입니다. 이를 통해 그들은 "탐정" 팀을 매우 예리하게 훈련시킬 수 있었습니다. 그들은 문제를 '적절한 순간 찾기(localization)'와 '세부 사항 추출하기(extraction)'로 나누어 해결함으로써, 이전 방식들보다 훨씬 더 길고 복잡한 작업을 처리할 수 있음을 증명했습니다.

요약하자면, SeekJudge는 모든 것을 꿰뚫어 보는 초지능적인 눈이 되려고 노력하는 대신, 가장 중요한 단서에 언제 줌인(zoom in)해야 하는지를 정확히 아는 똑똑하고 효율적인 팀처럼 행동합니다. 이는 화면이 바뀌고 엄격한 규칙집이 통하지 않는 실제 환경에서 컴퓨터를 사용하는 로봇을 훈련하는 것을 가능하게 합니다. 이 논문은 이러한 접근 방식이 숙제를 채점하기 위해 슈퍼컴퓨터를 필요로 하지 않으면서도, 항공권 예약부터 파일 정리까지 우리의 일상적인 컴퓨터 업무를 실제로 도와줄 수 있는 AI 비서를 만드는 핵심 열쇠가 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →