Cross-Benchmark Generalization in Long-Horizon Agents
이 논문은 외부 벤치마크 데이터나 보상 없이, 두 단계의 SFT 후 RL 파이프라인을 사용하여 다양한 장기적 과제(long-horizon tasks)에 대해 대규모 언어 모델을 사후 학습시키는 것이 신중한 목표 형성 및 상태 관리와 같은 전이 가능한 행동 전략을 함양함으로써 여러 미학습 벤치마크 전반에서 성능을 유의미하게 향상시킨다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
위대한 AI 탐정: 로봇에게 단순히 이용하는 법이 아닌, 생각하는 법을 가르치는 방법
당신이 아주 똑똑하지만 장난기 많은 학생에게 복잡한 미로를 푸는 법을 가르치고 있다고 상상해 보세요. 만약 당신이 그 학생에게 매우 예측 가능한 구조를 가진 단 하나의 특정 미로에서만 연습하게 한다면, 학생은 길을 찾는 법을 배우는 대신, "빨간 벽돌에서 왼쪽으로 돌면 항상 출구가 나온다"는 식의 암기를 해버릴지도 모릅니다. 이 학생은 항해(navigation)라는 기술을 배운 것이 아니라, 그 방에만 국한된 속임수를 배운 것입니다. 이것은 인공지능(AI) 세계, 특히 항공권 예약, 코드 작성, 또는 파일 정리와 같은 작업을 수행하도록 설계된 '에이전트(agent)'들에게 발생하는 거대한 문제입니다. 이러한 에이전트들은 컴퓨터가 점수를 계산하는 특정한 방식이나 지침의 기묘한 패턴과 같이, 테스트 환경에 존재하는 아주 작고 우연한 단서들을 이용(exploit)함으로써 훈련된 작업에 매우 능숙해지는 경우가 많습니다.
과학자들이 던지는 핵심 질문은 이것입니다: "우리는 AI에게 한 번도 본 적 없는 문제를 해결할 수 있는 데 도움이 되는 '진정한' 작업 방식을 가르칠 수 있을까?" 이는 연습 시험의 답을 외운 학생과, 수학을 너무나 잘 이해해서 완전히 새로운 유형의 문제도 풀 수 있는 학생의 차이와 같습니다. 이 논문은 바로 그 미스터리를 파헤칩니다. 논문은 다음과 같이 묻습니다. 만약 우리가 AI에게 일련의 사무 업무(캘린더 관리, 스프레드시트 사용 등)를 학습시킨다면, 이 AI가 완전히 다른 직무인 소프트웨어 엔지니어링(코드 수정 등)에도 더 능숙해질 것인가, 아니면 단순히 사무 업무의 단서들을 이용하는 법을 배운 것에 불과할 것인가?
실험: 디지털 인턴에게 사무실의 혼돈을 가르치기
Surge AI의 연구진들은 이 아이디어를 검증하기 위해 Qwen3.5라는 매우 크고 오픈 소스인 AI 모델을 활용하기로 했습니다. 이 모델을 아주 똑똑한 '디지털 인턴'이라고 생각해 보세요. 연구진은 이 인턴에게 스프레드시트 사용, 캘린더 관리, 웹 브라우징, 파일 처리 등 27가지의 서로 다른 전문 분야를 포함한 363개의 길고 복잡한 작업 세트를 학습시켜 보았습니다. 그들은 모델이 다양한 앱과 대화할 수 있도록 하는 거대한 도구 상자인 '모델 컨텍스트 프로토콜(Model Context Protocol, MCP)'을 사용했습니다.
결정적으로, 연구진은 이 인턴이 훈련 과정 중에 소프트웨어 엔지니어링 작업(예: 코드의 버그 수정)을 절대 접하지 못하도록 조치했습니다. 목표는 훌는 사무 보조원이 되는 법을 배우는 것이 우연히 인턴을 더 나은 코더로 만들 수 있는지 확인하는 것이었습니다. 이를 위해 두 단계의 훈련 방법을 사용했습니다. 먼저, 인턴에게 이러한 사무 업무를 해결하는 예시를 보여주었습니다(지도 미세 조정, Supervised Fine-Tuning). 그다음, 인턴이 스스로 작업을 수행하게 하고, 얼마나 잘 해냈는지에 따라 보상을 주어 최선의 작업 방식을 찾아내도록 독려했습니다(강화 학습, Reinforcement Learning).
결과: 놀라운 업그레이드
새롭게 훈련된 인턴을 테스트했을ের 때, 결과는 놀라울 정도로 긍정적이었습니다. 인턴은 코딩을 한 번도 연습하지 않았음에도 불구하고, 소프트웨어 엔지니어링 벤치마크 성능이 눈에 띄게 향상되었습니다. 구체적으로, 두 가지 주요 코딩 테스트인 SWE-Bench Pro와 Terminal-Bench 2에서 각각 5.8%포인트와 2.8%포인트 개선되었습니다. 또한 Toolathlon 및 BFCL-V4와 같은 다른 도구 사용 테스트에서도 성능이 향상되었습니다.
저자들은 이것이 마법의 해결책이나 완결된 문제는 아니라는 점을 주의 깊게 언급합니다. 실험을 단 한 번 수행했기 때문에, 이 수치가 다시 실행했을 때 변하지 않을 것이라고 100% 통계적으로 확신할 수는 없습니다. 하지만 모델이 훈련받지 않은 것을 포함하여 다섯 가지의 서로 다른 외부 테스트에서 성능이 향상되었다는 사실은, 무언가 실질적인 일이 일어났음을 시사합니다. 모델은 단순히 사무 업무를 암기한 것이 아니라, 더 나은 '작업 스타일'을 학습한 것으로 보입니다.
"어떻게": 네 가지 새로운 습관
이 논문에서 가장 흥리로운 부분은 단순히 점수가 아니라 그 '이유'입니다. 연구진은 훈련된 모델이 훈련되지 않은 모델과 비교하여 어떻게 행동하는지를 마치 탐정이 용의자의 알리바이를 비교하듯 면밀히 조사했습니다. 그들은 사무 업무와 코딩 작업 모두에서 나타나는 네 가지 구체적인 행동 변화를 발견했습니다.
- 더 나은 목표 설정: 훈련된 모델은 크고 무서운 작업을 작고 정확한 단계들로 나누는 데 더 능숙했습니다. 막연하게 추측하는 대신, 현재 상황을 살펴보고 정밀한 '지역적 목표(local goal)'를 형성했습니다. 예를 들어, 성장을 계산해야 한다면 단순히 공식을 추측하는 것이 아니라, 시작하기 전에 데이터를 정확히 이해하는 과정을 거쳤습니다.
- 더 나은 정신적 지도 구축: 모델이 새로운 정보에 직면했을 때, 모델은 마음속에 더 정확한 '작업 상태(working state)'를 구축했습니다. 파일이나 도구의 출력값을 보면, 이를 무시하거나 잊어버리는 대신 이를 사용하여 다음 움직임을 안내했습니다. 이는 마치 레시피를 맹목적으로 따르는 대신, 소금을 넣기 전에 실제로 소스의 맛을 보는 요리사와 같았습니다.
- 경로 유지: 문제가 발생했을 때(종종 발생하는 일입니다), 훈련된 모델은 큰 그림을 놓치지 않으면서 작은 실수를 바로잡는 데 더 뛰어났습니다. 만약 버그를 수정하다가 오타를 냈다면, 모델은 오타를 수정하면서도 여전히 프로그램이 계속 실행되어야 한다는 본래의 목표를 기억했습니다. 반면 훈련되지 않은 모델은 혼란에 빠져 프로그램 전체를 바꿔버리기도 했습니다.
- 작업 검증: 훈련된 모델은 "다 끝났다"라고 말하기 전에 자신의 작업을 검증할 가능성이 훨씬 높았습니다. 코딩 테스트에서 훈련된 모델은 자신의 변경 사항이 실제로 작동하는지 확인하기 위해 공식적인 테스트를 실행했지만, 훈련되지 않은 모델은 종종 자신이 맞다고 가정해 버렸습니다. 훈련된 모델의 테스트 실행 빈도는 37.5%에서 73.3%로 증가했습니다.
이것이 의미하는 바
이 논문은 AI에게 여러 가지 도구를 사용하는 복잡하고 긴 호흡의 작업을 통해 훈련시키면, 완전히 다른 분야로 전이될 수 있는 '작업 방식'을 가르칠 수 있다는 점을 시사합니다. 이는 누군가에게 지저ックス한 차고를 정리하는 법을 가르치는 것과 같습니다. 만약 그 사람이 체계적이고, 신중하며, 철저하게 일하는 법을 배운다면, 비록 책을 가지고 연습한 적은 없더라도 놀랍게도 도서관을 정리하는 일을 더 잘하게 될 수도 있습니다.
하지만 저자들은 한계에 대해서도 솔직하게 밝히고 있습니다. 그들은 모델이 더 열심히 노력하고 쉽게 포기하지 않도록 독려한 것만으로도 일부 개선이 일어날 수 있음을 인정합니다. 그들은 모델의 뇌 내부에서 이러한 습관이 정확히 어떻게 학습되었는지 증명하지 못했으며, 실험을 단 한 번만 수행했습니다. 그러나 증거는 희망적인 아이디어를 가리키고 있습니다. 만약 우리가 AI가 신중하게 생각하고 자신의 작업을 검증하도록 강제하는 훈련 환경을 설계한다면, 우리는 단순히 특정 테스트를 이용하는 데 능숙한 모델이 아니라, 진정으로 더 똑똑하고 적응력이 뛰어난 에이전트를 만들 수 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.