AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions
AutoRPA 는 비효율적인 LLM 기반 ReAct 에이전트와 전통적인 RPA 간의 간극을 해소하기 위해 상호작용 궤적을 자동으로 추출하여 견고하고 재사용 가능한 RPA 함수로 변환함으로써, 작업 해결 능력을 유지하면서 토큰 사용량과 실행 시간 비용을 크게 절감하는 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 다소 비싼 'LLM(대형 언어 모델)'이라는 이름의 개인 비서가 있다고 상상해 보세요. 이 비서는 컴퓨터나 휴대폰 화면을 처음 접하는 방법을 파악하는 데 탁월합니다. "비행기 표 예약하기"나 "메모 삭제하기"를 요청하면 화면을 보고 무엇을 해야 할지 생각한 뒤 올바른 버튼을 클릭하여 작업을 완료할 수 있습니다.
하지만 단점이 하나 있습니다: 반복적인 작업에 사용할 경우 속도가 느리고 비용이 많이 듭니다.
비행기 표를 예약하라고 요청할 때마다 처음부터 다시 '생각'해야 합니다. 화면을 읽고, 단계를 계획한 뒤 클릭합니다. 하루에 100 번씩 이 작업을 해야 한다면 100 시간 분량의 '생각'에 대한 비용을 지불하는 셈인데, 이는 시간과 돈의 낭비입니다.
반면, 이러한 똑똑한 비서가 등장하기 전에는 사람들이 '로봇 프로세스 자동화 (RPA)'를 사용했습니다. RPA 는 미리 녹화된 스크립트라고 생각하면 됩니다. 마치 "버튼 3 을 클릭한 뒤 '안녕하세요'를 입력한 다음 '저장'을 클릭한다"는 식으로 맹목적으로 행동하는 로봇과 같습니다. 실행 속도가 매우 빠르고 비용도 저렴합니다. 하지만 취약하다는 단점이 있습니다. 앱 디자이너가 '버튼 3'을 다른 위치로 옮기면 로봇은 적응하는 방법을 모르기 때문에 충돌합니다. 화면이 바뀔 때마다 사람이 직접 스크립트를 다시 작성해 주어야 합니다.
문제
우리는 로봇 (RPA) 의 빠르고 저렴한 속도와 비서 (LLM) 의 똑똑한 적응력을 모두 원합니다. 앱이 업데이트될 때마다 사람이 코드를 다시 작성하지 않아도 일상적인 반복 작업 (예: 매일 비행기 표 예약) 에 작동하는 해결책을 원합니다.
해결책: AutoRPA
이 논문은 어지러운 요리 시연을 완벽하고 재사용 가능한 레시피로 바꾸는 마스터 셰프와 같은 시스템인 AutoRPA를 소개합니다.
다음은 단계별 작동 방식입니다:
1. '탐색' (셰프가 지켜보는 단계)
먼저 AutoRPA 는 똑똑한 LLM 비서를 이용해 비행기 표 예약과 같은 작업을 한 번 또는 몇 번 수행하게 합니다. 비서는 화면을 보고 생각한 뒤 클릭합니다. 이것이 'ReAct' 단계입니다.
- 비유: 셰프가 수석 셰프가 처음으로 요리를 하는 모습을 지켜보며 모든 동작을 기록합니다.
2. '번역' (메모를 레시피로 바꾸기)
비서의 행동은 보통 '하드코딩'되어 있습니다 (예: "픽셀 좌표 144, 278 에서 버튼 클릭"). 화면이 이동하면 좌표가 틀어지기 때문에 이는 좋지 않습니다.
AutoRPA 는 이러한 행동을 다시 작성하는 특별한 번역 에이전트를 갖추고 있습니다. "144, 278 에서 클릭"이라고 말하는 대신 "'비행기 표 예약'이라고 적힌 버튼을 클릭"이라고 말합니다.
- 비유: 셰프는 수석 셰프의 어지러운 메모 ("오른쪽 상단의 빨간 점 누르기") 를 명확한 지시 ("빨간 '시작' 버튼 누르기") 로 다시 작성합니다. 이렇게 하면 주방 배치가 조금 바뀌더라도 레시피가 작동합니다.
3. '구축' (마스터 스크립트 만들기)
빌더 에이전트는 이렇게 번역되어 유연해진 지시들을 하나의 견고한 컴퓨터 프로그램 (RPA 함수) 으로 결합합니다. 다양한 시도 (궤적) 를 분석하여 변형을 처리하는 최선의 방법을 파악합니다.
- 비유: 셰프는 누구나 어디서든 그 요리를 완벽하게 만들 수 있는 최종 전문 레시피 카드를 작성합니다.
4. '하이브리드 수리' (안전망)
때로는 새로운 레시피에 버그가 있을 수 있습니다. 로봇이 코드를 실행하려다 실패하면 AutoRPA 는 그냥 포기하지 않습니다. 하이브리드 수리 전략을 사용합니다:
- 로봇을 일시 정지합니다.
- 똑똑한 LLM 비서를 다시 불러와 왜 실패했는지, 그리고 그 지점에서 어떻게 고칠지 파악하게 합니다.
- 비서의 수정 사항을 이용해 레시피를 업데이트합니다.
- 비유: 로봇이 토스트를 태우면 셰프가 나서 토스트를 고친 뒤, 로봇이 다음 번에 다시 태우지 않도록 레시피 카드를 업데이트합니다.
결과
이 논문은 Android 앱, 웹사이트, 시뮬레이션 웹 작업 등 세 가지 다른 환경에서 이를 테스트했습니다.
- 효율성: 새로운 AutoRPA 코드는 똑똑한 비서에게 매번 작업을 요청하는 것보다 실행 비용이 82% 에서 96% 까지 저렴합니다. AI 의 '생각' 화폐인 토큰 사용량을 대폭 절감합니다.
- 성공률: 생성된 코드가 안정적이며 작은 화면 변화에도 혼란을 겪지 않기 때문에, 단독으로 작동하는 똑똑한 비서만큼이나, 때로는 그보다 더 잘 작업을 해결합니다.
- 재사용성: 한 번 '유형'의 작업 (예: 비행기 표 예약) 을 위해 코드가 구축되면, 다시 생각할 필요 없이 수백 개의 구체적인 사례 (뉴욕 예약, 런던 예약 등) 에 재사용할 수 있습니다.
요약
AutoRPA는 똑똑한 AI 가 작업을 배우는 모습을 지켜보다가, 그 학습 내용을 유연하고 재사용 가능한 스크립트로 번역한 뒤, 그 스크립트가 완벽해질 때까지 다듬는 시스템입니다. 이는 두 가지 세계의 장점을 모두 제공합니다: 새로운 상황에 대처할 수 있는 지능과 반복 작업을 처리하는 로봇의 효율성입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.