← 최신 논문
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

본 논문은 코딩, GUI, 개인 비서 도메인에서 확장 가능하고 고성능인 에이전트 모델링을 가능하게 하는 경량 환경 계층(Orchard Env)과 전문화된 학습 레시피를 갖춘 오픈소스 프레임워크인 Orchard 를 소개하며, 이는 오픈소스 모델 간 최첨단 결과를 달성합니다.

원저자: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"오처드(Orchard)" 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어냅니다.

핵심 아이디어: AI 를 위한 보편적인 "놀이터" 구축

로봇이 복잡한 작업을 하도록 가르치고 싶다고 상상해 보세요. 예를 들어 고장 난 컴퓨터 프로그램을 수리하거나, 장바구니를 채우기 위해 웹사이트를 탐색하거나, 이메일을 관리하는 일입니다. 학습을 위해 로봇은 안전하고 격리된 "샌드박스(비디오 게임 레벨과 같은 환경)"에서 연습해야 합니다. 여기서 로봇은 무언가를 시도하고, 실수를 하며, 실제 세계를 망치지 않고 그 결과를 볼 수 있어야 합니다.

오랫동안 이러한 샌드박스를 구축하는 것은 장난감 하나하나마다 맞춤형 놀이터를 짓는 것과 같았습니다. 코딩 로봇을 테스트하고 싶다면 한 놀이터를 짓고, 쇼핑 로봇을 테스트하고 싶다면 처음부터 완전히 다른 놀이터를 지어야 했습니다. 이로 인해 연구는 느리고 비싸며 공유하기 어려웠습니다.

오처드(Orchard) 는 이러한 문제를 해결하기 위해 어떤 유형의 로봇 에이전트든 작동하는 하나의 보편적이고 고품질의 놀이터를 구축하는 새로운 오픈소스 프레임워크입니다. 연구자들은 이를 "오처드 환경(Orchard Env)"이라고 부릅니다.

오처드를 AI 연구자들을 위한 보편적인 멀티탭과 도구 벨트라고 생각하세요. 모든 기기마다 새로운 전원을 구축하는 대신, 모든 것과 호환되는 하나의 스마트한 전원 콘센트를 만든 것입니다. 이를 통해 연구자들은 샌드박스의 배관 작업에 걱정하기보다 AI 에게 어떻게 생각하게 할지에 집중할 수 있습니다.


세 가지 "레시피"(구현한 것들)

이 보편적인 놀이터를 활용하여 팀은 세 가지 특정 분야에서 AI 에이전트를 훈련시키기 위해 세 가지 다른 "레시피"를 개발했습니다. 그들은 단순히 부엌을 지은 것이 아니라, 세 가지 구별되고 맛있는 요리를 만드는 방법을 보여주었습니다.

1. 오처드-SWE: "주니어 개발자" 에이전트

  • 작업: 소프트웨어 코드의 버그 수정.
  • 도전 과제: 코딩은 어렵습니다. 때로는 AI 가 중간에 막히거나 실수를 하기도 합니다. 대부분의 훈련 방법은 "완벽한" 해결책만 보고 실패한 시도는 폐기합니다.
  • 오처드의 비법: 그들은 "크레딧 어시그먼트(Credit-Assignment)" 라는 기법을 사용했습니다. 수학 시험을 망친 학생을 상상해 보세요. 시험지를 그냥 버리는 대신, 선생님이 종이를 보고 "첫 세 단계는 정확했어! 그건 좋았어"라고 말합니다. 오처드는 AI 에게도 이렇게 합니다. 실패한 시도 중의 "좋은 부분"을 저장하고, AI 가 그 성공적인 단계들을 인식하도록 가르칩니다.
  • 결과: 그들은 성공과 "거의 성공"의 혼합물로부터 학습한 모델을 훈련시켰으며, 이는 훨씬 더 크고 비싼 모델만큼이나 코드를 수정하는 데 능숙합니다.

2. 오처드-GUI: "브라우저 탐색자" 에이전트

  • 작업: 웹사이트 클릭, 양식 작성, 제품 찾기 (예: 아마존에서 개 침대 찾기).
  • 도전 과제: 웹사이트는 시각적입니다. AI 는 스크린샷을 "보고" 어디를 클릭해야 할지 파악해야 합니다. 마치 도로 사진만 보여주고 운전하는 법을 가르치는 것과 같습니다.
  • 오처드의 비법: 그들은 40 억 개의 파라미터 (AI 기준으로는 매우 작은 규모) 만 가진 작고 효율적인 모델을 훈련시켰습니다. 연습 주기와 결과를 평가하는 "심판"(다른 AI) 을 혼합하여 사용했습니다. 수백만 개의 예시가 필요하지 않았습니다. 약 2,600 개의 작업을 신중하게 선별한 세트를 사용했습니다.
  • 결과: 이 작은 모델은 역사상 가장 강력한 오픈소스 브라우저 에이전트가 되었습니다. 구글과 오픈AI 같은 거대 기업들의 거대하고 비싼 시스템과 동등하게 (때로는 더 뛰어나게) 작동하여, 거대한 두뇌가 아니라 올바른 훈련이 있다면 충분함을 증명했습니다.

3. 오처드-클로: "개인 비서" 에이전트

  • 작업: 이메일 정렬, 캘린더 확인, 파일 정리와 같은 일상 생활 관리.
  • 도전 과제: 이러한 작업은 서로 다른 "도구"(이메일 앱, 캘린더 앱) 에서 발생합니다. 보통 한 도구에 훈련된 AI 는 다른 도구로 전환하면 혼란을 겪습니다.
  • 오처드의 비법: 그들은 AI 를 두 가지 다른 "제어판(하네스)" 을 동시에 사용하여 훈련했습니다. 마치 운전자가 수동 변속기와 자동 변속기 차량을 동시에 운전하도록 가르치는 것과 같습니다. 이는 AI 가 특정 차량의 페달이 아니라 운전이라는 개념을 배우도록 강요했습니다.
  • 결과: AI 는 매우 유연해졌습니다. 나중에 더 고급스러운 제어판으로 전환했을 때, 시스템이 고장 난 것이 아니라 오히려 작업 수행 능력이 향상되었습니다. 이는 버튼들을 외운 것이 아니라 기술을 진정으로 학습했음을 보여주었습니다.

왜 중요한가: "얇은 레이어" 혁명

이 논문은 AI 연구에서 가장 큰 병목 현상은 "두뇌"(모델) 가 아니라 "다리"(환경) 라고 주장합니다.

  • 이전: 연구자들은 모든 자동차마다 맞춤형 엔진을 구축했습니다. 새로운 엔진을 테스트하고 싶다면 전체 자동차를 새로 만들어야 했습니다.
  • 현재 (오처드): 오처드는 보편적인 차체입니다. 어떤 엔진(AI 모델) 이든 여기에 끼우면 작동합니다.
    • 저렴함: 표준 클라우드 기술로 실행되므로 기존 상용 서비스보다 약 10 배 저렴합니다.
    • 빠름: 충돌 없이 동시에 수천 개의 연습 세션을 실행할 수 있습니다.
    • 재사용 가능: 코딩 로봇을 위해 수집된 데이터는 쇼핑 로봇을 훈련시키는 데 재사용할 수 있습니다.

결론

오처드 논문은 이렇게 말합니다: "바퀴를 다시 발명하지 마세요."

모두에게 작동하는 깨끗하고 개방적이며 저렴한 "놀이터"를 만들면서, 그들은 오픈소스 AI 가 가장 큰 기술 거대 기업들과 경쟁할 수 있음을 보여주었습니다. 올바른 인프라와 실수에서 배우고 여러 도구를 훈련하는 것과 같은 스마트한 훈련 레시피를 통해, 작고 개방된 모델이 거대하고 폐쇄된 시스템만큼이나 복잡하고 현실적인 문제를 해결할 수 있음을 증명했습니다.

그들은 모든 코드, 데이터, 레시피를 대중에게 공개하여 "놀이터"를 모두에게 제공함으로써 AI 연구 전체 분야를 가속화하기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →