OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL은 경량 프록시와 쿠버네티스 오케스트레이터를 통해 추론과 학습을 분리함으로써 다양한 환경에서 하네스 네이티브(harness-native) AI 에이전트의 엔드 투 엔드 학습을 가능하게 하며, 복잡한 도구 및 GUI 벤치마크에서 최첨단 성능을 달성하는 동시에 하네스 선택과 강화 학습이 에이전트 행동을 어떻게 형성하는지에 대한 통찰을 제공하는 오픈 소스 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 질문에 답하는 것을 넘어, 당신을 위해 실제로 무언가를 '수행'하는 세상을 상상해 보십시오. 컴퓨터가 코드를 작성하고, 항공권을 예약하거나, 디지털 파일을 정리할 수 있게 되는 것입니다. 이를 실현하기 위해 과학자들은 "AI 에이전트"를 구축했습니다. 이들은 생각하고, 계획하며, 도구를 사용할 수 있는 똑똑한 프로그램입니다. 하지만 여기서 까다로운 점은, 이 에이전트들이 진공 상태에서 작동하지 않는다는 것입니다. 이들은 메모리를 관리하고, 인터넷에 연결하며, 계산기나 웹 브라우저 같은 도구를 사용하는 것을 돕는 일종의 복잡한 제어실이나 특화된 조종석인 "하네스(harness)"가 필요합니다. 하네스를 조종사의 좌석, 에이전트를 조종사라고 생각한다면, 비디오 게임에서 조종사를 훈련시킨다고 해서 실제 747기를 날릴 수 있을 것이라 기대할 수는 없습니다. 실제 비행기에는 비디오 게임에서는 결코 보여주지 않았던 특정 버튼, 비상 프로토콜, 그리고 조종석 레이아웃이 존재하기 때문입니다.
오랫동안 큰 문제가 있었습니다. 바로 "비디오 게임"(단순한 훈련 환경)이 "실제 비행기"(실제 세상에서 사용되는 복잡한 하네스)와 일치하지 않는다는 점이었습니다. 연구자들은 에이전트를 쉽게 훈련할 수 있었지만, 이를 실제의 복잡한 하네스에 배치하면 에이전트들이 혼란에 빠지거나 실패하곤 했습니다. "OpenForge RL"이라는 제목의 이 논문은 바로 그 불일치 문제를 다룹니다. 이 논문은 디지털 조종사들을 언젠가 실제로 비행하게 될 실제 조종석 안에서 직접 훈련시키는 새로운 방법을 소개하며, 전체 훈련 시설을 마비시키지 않으면서도 동시에 수천 개의 서로 다른 "비행기"에서 연습할 수 있는 시스템을 제공합니다.
문제점: 비디오 게임에서의 훈련 vs 실제 비행기 조종
당신이 로봇에게 자동차를 수리하는 법을 가르치려 한다고 상상해 보십시오. 만약 엔진이 단순히 빨간 버튼이고 타이어가 파란 사각형인 단순한 비디오 게임에서 로봇을 훈련시킨다면, 로봇은 빨간 버튼을 누르고 파란 것을 잡는 법을 배울 것입니다. 하지만 그 로봇을 실제 엔진, 실제 타이어, 그리고 수만 가지의 다른 도구들이 있는 실제 차고지에 놓게 되면, 로봇은 얼어붙고 맙니다. 로봇은 실제의 복잡함을 다루는 법을 모릅니다.
이것이 지금까지 AI 에이전트들에게 일어나고 있던 현상입니다. 현대의 에이전트들은 강력하지만, 자신의 생각과 도구를 관리하기 위해 정교한 "하네스"(Claude Code나 Codex 같은 것)에 의존합니다. 이러한 하네스는 조종석과 같습니다. 상태 유지형 메모리(5단계 전의 일을 기억함), 다중 프로세스 워크플로우(여러 작업을 동시에 실행함), 그리고 복잡한 도구 연결을 갖추고 있습니다. 그러나 연구자들이 AI를 훈련시키는 표준적인 방식(강화 학습 사용)은 대개 단순하고 평평한 환경을 가정합니다. 그들은 에이전트를 하네스의 단순화된 버전을 사용하여 훈련시키려 하는데, 이는 "훈련-배포 불일치(train-deploy mismatch)"를 만듭니다. 이는 마치 조종사에게 실제 비행기의 비상 브레이크가 없는 시뮬레이터로 훈련시킨 다음, 브레이크가 고장 났을 때 실제 비행기를 착륙시키라고 기대하는 것과 같습니다.
해결책: OpenForge RL (클라우드 차고)
이 논문의 저자들은 거대한 클라우드 기반의 차고 역할을 하는 OpenForge RL 프레임워크를 구축했습니다. 실제의 복잡한 하네스를 단순한 훈련 상자에 억지로 맞추려 하는 대신, OpenForge RL은 그 반대로 합니다. 즉, 훈련 상자를 가져와서 실제 하네스로 내보내는 것입니다.
작동 방식은 다음과 같은 유쾌한 비유를 들어 설명할 수 있습니다.
- 원격 포드 (클라우드 차고): 클라우드에 떠 있는 소규모 자율 주행 차고 함대를 가지고 있다고 상상해 보십시오. 각 차고는 특정 "하네스"(특정 자동차 모델과 같은)를 담고 있는 컨테이너입니다. OpenForge RL은 "쿠버네티스 오케스트레이터"(매우 효율적인 차고 관리자라고 생각하십시오)를 사용하여 이러한 원격 차고들을 즉각적으로 수천 개씩 생성합니다.
- 프록시 (양방향 거울): 각 차고 내부에서 AI 에이전트는 과제를 해결하려고 시도합니다. 이때 "경량 프록시"가 양방향 거울 역할을 합니다. 이 프록시는 에이전트가 실제 하네스 및 실제 환경(실제 컴퓨터나 웹 브라우저 등)과 통신할 수 있게 해주면서도, 에이전트의 모든 움직임, 생각, 도구 클릭을 비밀리에 기록합니다.
- 훈련 루프: 프록시는 기록된 이 "비행 로그"를 veRL과 같은 표준 도구를 사용하는 메인 훈련 뇌로 보냅니다. 뇌는 이 실제 세계의 로그로부터 학습하여 에이전트의 뇌를 업데이트하고, 업데이트된 버전을 다시 원격 차고들로 보내 다시 시도하게 합니다.
핵격한 점은, 훈련이 실제 하네스 내부, 실제 환경 내에서 일어나지만, 그 수많은 다양한 환경을 관리하는 무거운 작업은 클라우드가 처리한다는 것입니다. 덕분에 연구자들은 "ZeroClaw", "OpenClaw", "Codex" 또는 시각적 GUI 에이전트(마우스와 키보드를 사용하는 에이전트)를 위한 새로운 훈련 코드를 매번 다시 작성할 필요 없이, 이 모든 것을 한꺼번에 사용하여 에이전트를 훈련할 수 있습니다.
결과: 실제 훈련이 더 효과적이다
연구팀은 두 가지 유형의 에이전트로 이 시스템을 테스트했습니다: Claw 에이전트(텍스트와 도구를 사용하여 이메일을 검색하거나 파일을 관리하는 등의 작업을 수행)와 GUI 에이전트(화면을 보고 웹 브라우저나 컴퓨터에서 버튼을 클릭하기 위해 마우스를 사용하는 에이전트).
그들은 수백만 개의 데이터를 사용하는 거대 모델들과 달리, 단 몇 백 개에서 몇 천 개의 과제만을 사용하여 이 에이전트들을 훈련시켰습니다. 결과는 인상적이었습니다:
- Claw 에이전트의 경우: 그들의 모델인 OpenForge-Claw는 ClawEval 벤치마크에서 31.7 (pass@3), QwenClawBench에서 33.7을 기록했습니다. 이는 비슷한 크기(약 300억 개의 파라미터)의 다른 오픈 소스 모델들보다 유의미하게 높은 수치였습니다. 실제로 이 모델은 몇 배나 더 큰 모델들보다 더 나은 성능을 보였습니다.
- GUI 에이전트의 경우: 그들의 모델인 OpenForge-GUI는 OSWorld-Verified에서 37.7, Online-Mind2Web에서 63.0, WebVoyager에서 72.3에 도달했습니다. 이는 매우 중요한 성과인데, GUI 작업은 에이전트가 화면을 "보고" 어디를 클릭할지 결정해야 하므로 매우 어렵기 때문입니다. OpenForge-GUI는 훨씬 더 크고 훨씬 더 많은 데이터로 훈련된 모델들과 대등하거나 오히려 능가하는 성능을 보여주었습니다.
"하네스"의 교훈: 모든 조종석이 똑같은 것은 아니다
가장 흥고한 발견 중 하나는 단순히 훈련이 잘 되었다는 점이 아니라, 서로 다른 하네스가 학습에 어떻게 영향을 미쳤는지였습니다. 저자들은 네 가지 다른 하네스(ReACT - 단순한 루프, ZeroClaw - 경량, OpenClaw, Codex - 매우 복잡함)에서 에이전트를 테스트했습니다.
그들은 어떤 하네스는 다른 하네스보다 배우기가 훨씬 더 어렵다는 사실을 발견했습니다.
- 더 단순하고 정렬이 잘 된 하네스(ZeroClaw와 같은)는 에이전트가 더 빠르게 배우고 더 나은 성능을 내도록 했습니다.
- 더 복잡한 하네스(Codex와 같은)는 마스터하기가 더 어려웠습니다. 에이전트들은 더 고전했으며, 강화 학습(RL)이 도움이 되기는 했지만, 단순한 하네스에 비해 얻은 이득이 작았습니다.
이는 "조종석" 설계가 파일럿의 훈련만큼이나 중요하다는 것을 시사합니다. 잘 설계된 하네스는 에이전트를 더 똑똑하고 신뢰할 수 있게 만듭니다.
RL이 실제로 에이전트에게 가르친 것
저자들은 또한 기본 훈련(SFT) 위에 강화 학습(RL)을 추가했을 때 에이전트들이 실제로 무엇을 배웠는지 자세히 살펴보았습니다. 그들은 RL이 단순히 일반적인 의미에서 에이전트를 "똑똑하게" 만든 것이 아니라, 특히 신뢰성을 향상시켰다는 것을 발견했습니다.
- 자기 검증(Self-Verification): 에이전트들은 자신의 작업을 스스로 확인하기 시작했습니다. 예를 들어, 파일을 생성했다면, 제대로 생성되었는지 확인하기 위해 파일을 다시 읽어볼 확률이 높아졌습니다.
- 도구 커버리지(Tool Coverage): 에이전트들은 익숙한 한두 가지 도구에만 머물지 않고 더 다양한 도구를 사용하기 시작했습니다.
- 오류 복구(Error Recovery): 이 부분이 까다로웠습니다. RL은 에이전트가 작은 실수를 했을 때 복구하는 데 도움을 주었지만, 오류 복구 능력은 여전히 취약했습니다. 훈련 후에도 에이전트가 큰 실수를 하면 이를 고치지 못하고 그냥 포기하는 경우가 많았습니다. 저자들은 이 특정 기술을 마스터하려면 특수한 데이터나 다른 훈련 방법이 필요할 수 있다고 제안합니다.
핵심 요약
OpenForge RL은 AI 에이전트를 훈련시키기 위해 실제 세계를 단순화할 필요가 없다는 것을 증명합니다. 클라우드 기반 시스템을 사용하여 훈련과 환경을 분리함으로써, 연구자들은 에이전트가 실제로 사용할 복잡하고 무질서한 실제 세계의 하네스 안에서 직접 훈련시킬 수 있습니다.
이 논문은 이러한 접근 방식이 연구자들이 단순히 더 유능할 뿐만 아니라, 특정 직무에서 더 신뢰할 수 있는 에이전트를 구축할 수 있게 해준다는 점을 시사합니다. 에이전트들이 여전히 복잡한 오류 복구에는 어려움을 겪고 있지만, "비디오 게임"이 아닌 "실제 조종석"에서 훈련할 수 있다는 능력은 큰 진전입니다. 이는 미래에 우리가 AI 에이전트를 단순한 시뮬레이션 속이 아니라, 우리가 매일 사용하는 실제 디지털 도구 속에서 진정으로 함께 일할 수 있는 동료로 맞이하게 될 것임을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.