← 최신 논문
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

이 논문은 지식 증류된 궤적에 대한 지도 미세 조정(supervised fine-tuning)과 실제 환경에서의 견고한 보상 시스템을 결합한 강화 학습을 결합한 2단계 학습 패러다임을 통해 클라우드 콘솔 문서 검증에서 최첨단 성능에 근접한 성능을 달성하는 비용 효율적인 웹 에이전트 프레임워크인 AliyunConsoleAgent를 소개한다.

원저자: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 끊임없이 변화하는 테마파크(Cloud Console)의 매니저라고 상상해 보세요. 매일 테마파크에는 새로운 놀이기구가 추가되고, 매표소가 바뀌며, 안전 규칙이 업데이트됩니다. 한편, 가이드북(Documentation)은 다른 팀이 수동으로 천천히 업데이트하며 작성합니다.

문제점:
테마파크가 너무 빠르게 변하기 때문에 가이드북은 금방 구식이 되어버립니다. 책에는 "파란 버튼을 클릭하세요"라고 적혀 있을 수 있지만, 실제 테마파크에서는 그 버튼이 빨간색으로 바뀌었거나 터치스크린으로 대체되었을 수도 있습니다. 가이드북의 모든 지침을 실제 테마파크와 대조하여 확인하는 것은 악몽 같은 일입니다. 사람이 직접 하기에는 연간 수백만 시간이 소요될 것이며, 현재는 지침의 약 1%만을 확인하고 있습니다. 확인을 하지 못하면 고객들은 길을 잃고 좌절하게 됩니다.

기존의 해결책 (그리고 실패한 이유):
회사는 이 확인 작업을 위해 "초지능 로봇"(Frontier Proprietary Models)을 고용하려고 시도했습니다. 이 로봇들은 매우 똑똑해서 가이드북을 읽고 테마파크를 완벽하게 탐색할 수 있습니다. 하지만 이들은 비싸고(모든 확인 작업마다 박사급 인력을 고용하는 것과 같습니다), 위험합니다(보안 규칙을 위반하며 당신의 사적인 테마파크 지도를 보여줘야 하기 때문입니다). 필요한 수백만 번의 확인 작업을 수행하기에는 비용을 감당할 수 없습니다.

새로운 해결책: AliyunConsoleAgent
개발자들은 자신들의 서버에서 더 저렴하고 안전하게 실행할 수 있는 자신들만의 "학습 가능한 로봇"(320억 개의 파라미터를 가진 AI 모델)을 만들었습니다. 하지만 일반적인 로봇은 혼란스럽고 변화무쌍한 테마파크를 다루기에 충분히 똑똑하지 않습니다. 그래서 그들은 두 단계의 학습법을 사용했습니다:

1. "섀도잉(Shadowing)" 단계 (지도 미세 조정 - Supervised Fine-Tuning)

먼저, 초지능 로봇을 데려와서 새로운 로봇이 그들을 그림자처럼 따라 하게(shadow) 만들었습니다.

  • 비유: 숙련된 셰프(초지능 로봇)가 복잡한 요리를 만드는 상황을 상상해 보세요. 새로운 로봇은 마스터의 모든 칼질, 젓기, 양념하기 단계를 지켜보며 암기합니다.
  • 결과: 새로운 로봇은 테마파크를 탐색하는 기초적인 방법을 배웁니다. 꽤 잘하게 되었지만, 이는 여전히 단순히 복사하는 수준에 불과합니다. 만약 테마파크가 조금이라도 변하면, 로봇은 목표를 진정으로 이해하는 것이 아니라 단지 단계를 기억할 뿐이기에 혼란에 빠집니다.

2. "시행착오(Trial and Error)" 단계 (강화 학습 - Reinforcement Learning)

다음으로, 로봇이 직접 해보며 배울 수 있도록 시뮬레이션된 버전의 테마파크에 풀어놓았습니다.

  • 도전 과제: 실제 클라우드 환경에서 로봇은 바보라서 실패하는 것이 아니라, "테마파크"가 준비되지 않아서 실패하는 경우가 많습니다. 예를 들어, 로봇이 서버를 삭제하려고 시도했는데 아직 서버가 존재하지 않는 경우입니다. 만약 로봇이 이 일로 벌을 받는다면, 로봇은 (서버를 삭제하는 법을 몰라서가 아니라) 잘못된 교훈(서버를 삭제하는 데 서툴다는 것)을 배우게 됩니다.
  • 해결책 (고결정론적 롤아웃 - High-Determinism Rollout): 팀은 Terraform(인프라를 레고처럼 구축하는 도구)을 사용하여 특별한 "훈련장"을 구축했습니다. 로봇이 작업을 시도하기 전에, 이 시스템은 로봇이 올바른 움직임을 보였을 때 성공할 수 있도록 정확한 전제 조건들(예: 서버 구축, 네트워크 설정 등)을 자동으로 생성합니다.
  • 보상 시스템: 인간이 로봇을 채점하는 대신, **이중 채널 판사(Dual-Channel Judge)**를 사용합니다.
    1. 규칙 검사기: 이 모델은 공식 "감사 로그"(테마파크의 보안 카메라 영상)를 살펴보고 실제로 동작이 일어났는지 확인합니다. 서버가 삭제되었습니까? 예/아니오. 이는 100% 객관적입니다.
    2. 판사 패널: 명확한 로그가 없는 경우, 두 개의 다른 AI 모델이 판사 역할을 합니다. 이들은 두 모델이 모두 동의할 때만 "통과"를 줍니다. 이는 로봇이 하나의 판사를 속이거나 "꼼수"를 쓰는 것을 방지합니다.

결과

이러한 학습을 거친 후, 로봇은 단순한 추종자에서 자율적인 문제 해결사로 진화했습니다.

  • 이전: 가이드에 "자동 갱신을 끄십시오"라고 되어 있는데 스위치가 이미 꺼져 있다면, 로봇은 그냥 멈춰서 "할 수 없습니다"라고 말했습니다.
  • 이후: 로봇은 "잠깐, 이미 꺼져 있다면 끌 수가 없네. 먼저 '켜기'를 한 다음에 '끄기'를 해서 내가 제대로 수행했다는 것을 증명해야겠어"라고 생각합니다. 로봇 스스로 논리를 깨우친 것입니다.

핵심 요약:

  • 성능: 그들의 새로운 로봇(AliyunConsoleAgent-32B)은 비싼 "초지능 로봇"과 거의 대등한 성능을 보입니다 (차이는 1.8% 이내).
  • 비용: 실행 비용이 92% 더 저렴합니다.
  • 영향: 그들은 이 시스템을 사용하여 54,000개 이상의 지침을 감사했으며, 제품 팀이 수정할 수 있는 4,400개의 실제 오류를 찾아냈습니다.

요약하자면, 그들은 현지의 저렴한 로봇에게 천재를 섀도잉하게 하고, 그 후 완벽하게 준비된 훈련 체육관에서 연습하게 함으로써, 외부 요인 때문에 억울하게 벌을 받지 않고 실수로부터 배울 수 있도록 하여 저렴한 로봇이 천재처럼 생각하도록 가르쳤습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →