← 최신 논문
🤖 AI

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

이 논문은 거대 언어 모델을 장기적 오피스 워크플로에 대해 사후 학습시키는 것이 목표 선택, 상태 구축, 충실도 유지, 검증이라는 네 가지 핵심적인 목표 지향적 실행 행동을 강화함으로써 소프트웨어 엔지니어링 성능을 유의미하게 향상시키며, 이러한 행동들이 도메인 간에 효과적으로 전이된다는 것을 입증한다.

원저자: Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 마스터 셰프가 되는 법을 가르치고 있다고 상상해 보십시오. 여러분은 로봇에게 수백만 개의 레시피를 먹이고, 양파를 써는 법을 보여주고, 수플레 만드는 연습을 시키는 것이 최선이라고 생각할지도 모릅 모릅니다. 하지만 위대한 셰프가 되는 비결이 단지 레시피를 아는 것에 있지 않다면 어떨까요? 만약 진짜 기술이 '생각하는 방식'에 있다면 어떨까요? 거대하고 무서운 저녁 파티를 작고 관리 가능한 단계들로 나누고, 모은 모든 재료를 추적하며, 재료를 써는 와중에도 호스트의 식이 제한 사항을 기억하고, 음식을 내놓기 전에 실제로 맛을 보며 다 되었는지 확인하는 능력이 진짜 실력이라면 어떨까요?

이것이 바로 '에이전틱(agentic)' AI의 세계입니다. 단순히 질문에 답하는 것을 넘어 웹 서핑을 하거나, 파일을 편집하거나, 테스트를 실행하는 등 실제로 '행동'하는 컴퓨터 프로그램들 말입니다. 오랫동안 과학자들은 이 로봇들이 결국 수행하게 될 정확한 직무를 학습해야 한다고 생각했습니다. 만약 로봇이 컴퓨터 코드를 수정하기를 원한다면, 코드를 수정하는 수백만 개의 사례를 통해 가르쳐야 한다고 믿었습니다. 하지만 이 새로운 논문은 아주 기발한 질문을 던집니다: 만약 우리가 로봇에게 마스터 '사무직 직원'이 되는 법을 가르친다면 어떨까요? 스프레드시트를 정리하고, 회의 일정을 잡고, 문서를 관리하는 법을 가르친 뒤, 그 로봇에게 소프트웨어를 수정하라고 요청한다면 어떨까요? 훌륭한 사무직 직원이 되는 기술이 소프트웨어 엔지니어가 되는 데 도움이 될까요?

Surge AI의 연구진은 이 아이디어를 테스트해 보기로 했습니다. 그들은 매우 똑똑한 AI 모델을 가져와 '장기적 관점(long-horizon)'의 사무 업무 집중 훈련을 시켰습니다. 이는 단순히 "이메일을 보내라"와 같은 간단한 작업이 아니었습니다. AI가 여러 도구를 다루고, 자신이 무엇을 하고 있는지에 대한 정신적 지도를 유지하며, 세부 사항에 빠져들면서도 전체적인 큰 그림을 놓치지 않도록 해야 하는 복잡하고 다단계적인 모험들이었습니다. 그들은 AI에게 363개의 이러한 사무 업무를 학습시켰지만, 여기서 핵심은 학습한 작업 중 소프트웨어나 코딩과 관련된 것이 단 하나도 없었다는 점입니다.

결과는 어땠을까요? 그들이 AI를 SWE-Bench Pro라는 유명한 소프트웨어 엔지니어링 챌린지에 테스트했을 때, 성능이 눈에 띄게 향상되었습니다. 성공률이 5.8 퍼센트 포인트 상승했습니다. 이 논문은 AI가 복잡하고 다단계적인 사무 워크플로우를 관리하는 법을 배움으로써, 목표 지향적 실행을 위한 보편적인 '근육'을 학습하게 된다고 제안합니다. AI는 목표를 설정하고, 상황에 대한 정신적 이미지를 구축하며, 상황이 엉망이 되더라도 원래의 계획을 고수하고, 자신의 작업을 재검토하는 법을 배웠습니다. 저자들은 이러한 기술이 마치 스위스 아미 나이프와 같다고 주장합니다. 파일 캐비닛을 정리하는 법을 배우고 나면, 겉보기에는 완전히 달라 보이는 디버깅 작업을 수행하는 데에도 그 기술을 사용할 수 있다는 것입니다.

비법: "목표 루프(Goal Loop)"

이것이 어떻게 작동하는지 이해하려면, AI가 거대하고 갈래가 많은 미로를 탐험하고 있다고 상상해 보십시오. 논문에서는 AI의 전략을 '목표 지향적 실행(Goal-Directed Execution, GDE)'이라고 부릅니다. 이것을 비디오 게임의 루프처럼 AI가 반복해서 수행하는 네 단계의 댄스라고 생각하십시오:

  1. 목표 형성 (Goal Formation): AI는 "결승선에 더 가까워지기 위해 당장 다음에 해야 할 일은 무엇인가?"라고 스스로에게 묻습니다.
  2. 상태 구축 (State Construction): AI는 주변을 살피며 "좋아, 지금 내가 알고 있는 것은 무엇인가? 방금 무엇을 알아냈는가?"라고 말합니다. 즉, 현재 상황에 대한 정신적 지도를 만듭니다.
  3. 목표 안정성 (Goal Stability): AI는 나침반을 확인합니다. "나는 여전히 주요 보물을 향해 가고 있는가, 아니면 반짝이는 돌 때문에 한눈을 팔고 있는가?" 작은 단계들을 밟는 동안 큰 목표를 잊지 않도록 합니다.
  4. 검증 (Verification): 마지막으로, "내가 실제로 해냈는가? 증거가 있는가?"라고 묻습니다. 단순히 추측하는 것이 아니라 증거를 확인합니다.

논문은 복잡한 과업들이—그것이 회사의 예산을 정리하는 것이든 비디오 게임의 버그를 잡는 것이든—모두 동일한 이러한 루프들로 구성되어 있다고 주장합니다. 때때로 이 루프들은 러시아 인형(마트료시카)처럼 서로 안에 중첩되어 있습니다. 큰 목표(앱 수정)가 있고, 이는 더 작은 목표(버그 찾기)로 나뉘며, 다시 더 작은 목표(특정 파일 읽기)로 나뉩니다.

실험: 스프레드시트에서 소프트웨어까지

연구진은 거대한 AI 모델(Qwen3.5-122B-A10B)을 가져와 특별한 '학습 식단'을 제공했습니다. AI에게 코드를 먹이는 대신, 현실적인 363개의 사무 시나리오를 먹였습니다. AI가 가상 인턴처럼 행동한다고 상상해 보십시오. AI는 다음을 수행해야 했습니다:

  • 문서와 스프레드시트 검색하기.
  • 웹 브라우저를 사용하여 조사하기.
  • 일정 계획 및 파일 관리하기.
  • 서로 다른 디지털 도구 간의 협업 조율하기.

이 작업들은 까다롭게 설계되었습니다. AI가 동시에 많은 것을 추적하고, 다양한 도구 사이를 전환하며, 이야기의 맥락을 놓치지 않도록 요구했기 때문입니다. AI는 이러한 작업들을 숙달할 때까지 연습했습니다. 결정적으로, 학습 데이터에는 소프트웨어 엔지니어링 작업이 전혀 포함되지 않았습니다. AI는 학습하는 동안 코드 한 줄도 본 적이 없습니다.

그다음 테스트가 이어졌습니다. 연구진은 훈련된 AI에게 실제 세계의 소프트웨어 버그를 해결하는 능력을 테스트하는 벤치마크인 SWE-Bench Pro의 문제들을 풀게 했습니다. 그리고 훈련된 AI와 사무 기술을 배우기 전의 동일한 모델을 비교했습니다.

결과: 보편적인 기술

훈련된 AI는 스타였습니다. 소프트웨어 엔지니어링 테스트에서의 성공률이 20.5%에서 26.3%로 뛰었습니다. 이는 5.8 퍼센트 포인트의 향상입니다.

하지만 가장 흥s로운 부분은 점수뿐만이 아니었습니다. 연구진은 AI의 '사고 과정(궤적)'을 면밀히 조사했고, 훈련된 AI가 사무 업무와 소프트웨어 작업 모두에서 이 네 단계의 댄스를 훨씬 더 잘 수행하고 있음을 발견했습니다.

훈련된 AI가 어떻게 변했는지 구체적인 사례를 통해 살펴보겠습니다:

  • 더 나은 목표 형성: 훈련되지 않은 AI는 종종 틀린 방향임에도 '국소적으로 그럴듯해 보이는' 목표를 선택하곤 했습니다. 예를 들어, 소프트웨어 작업에서 이미 간단한 헬퍼 도구가 존재함에도 불구하고 함수 전체를 새로 작성하려고 시도하는 식입니다. 훈련된 AI는 사무 업무를 통해 올바른 다음 단계를 선택하는 법을 배웠기에, "어, 이미 이를 위한 도구가 있네"라고 깨닫고 그 도구를 사용했습니다.
  • 더 나은 상태 구축: 훈련되지 않은 AI는 중요한 정보를 버리는 경우가 많았습니다. 한 사무 업무에서, 훈련되지 않은 AI는 스프레드시트 셀에 있는 수식을 보고 "이건 숫자가 아니니까 무시하자"라고 생각했습니다. 하지만 훈련된 AI는 "잠깐, 이 수식이 내가 필요한 숫자를 계산해 준다"라는 것을 깨닫고 그 데이터를 유지했습니다. 즉, 더 나은 정신적 지도를 구축하는 법을 배운 것입니다.
  • 더 나은 목표 안정성: 이것은 큰 그림을 놓치지 않는 능력입니다. 소프트웨어 작업에서 훈련되지 않은 AI는 테스트가 실패하는 것을 보고, 원래의 요구 사항을 위반하면서까지 테스트를 통과시키기 위해 코드를 수정했습니다. 훈련된 AI는 '부모 목표'(원래의 요구 사항)를 기억하고 국소적인 문제가 자신을 현혹하게 두지 않았습니다. 이는 프린터가 고장 나더라도 마감 기한을 기억하는 프로젝트 매니저와 같습니다.
  • 더 나은 검증: 훈련되지 않은 AI는 종종 피상적으로 작업을 확인했습니다. 예를 들어 "파일을 내보냈으니 끝났다"라고 말하는 식입니다. 훈련된 AI는 더 철저했습니다. 파일에 실제 데이터가 제대로 들어있는지, 그리고 변경 사항이 시스템의 다른 부분에 어떤 영향을 미치는지 확인했습니다. 단순히 체크박스를 채우는 것이 아니라, 현실을 확인했습니다.

거시적 관점

이 논문은 AI를 복잡한 장기적 사무 업무에 훈련시킴으로써, AI가 자신의 생각과 행동을 조직하는 능력을 강화했다고 시사합니다. AI는 코딩하는 법을 배운 것이 아니라, '학습하는 법'과 '복잡한 계획을 실행하는 법'을 배운 것입니다. 스프레드시트를 관리하고, 여러 파일을 추적하며, 보고서를 검증하는 기술은 소프트웨어를 디버깅하는 데 필요한 기술과 놀랍도록 유사했습니다.

저자들은 이것이 "행동적 설명(behavioral account)"임을 명시하고 있습니다. 그들은 AI의 뇌 속에 인간처럼 문자 그대로의 '목표 스택'이 들어있다고 주장하는 것이 아닙니다. 대신, AI의 행동이 이 네 가지 역량을 사용하는 것처럼 '보인다'는 것을 관찰한 것입니다. 데이터는 AI가 한 영역(사무 업무)에서 이러한 행동을 잘하게 되면, 직접적인 훈련 없이도 다른 영역(소프트웨어)에서 더 잘하게 된다는 것을 보여줍니다.

이는 마치 체조 선수를 훈련시키는 것과 같습니다. 균형대를 연습시킨다면, 비록 그들이 공중제비(vault)를 연습하고 있지는 않더라도, 그들의 코어 근력, 균형 감각, 그리고 집중력은 향상됩니다. 마침내 공중제비를 시도할 때, 그들은 기초적인 '체조 기술'이 연마되었기에 더 나은 성과를 낼 수 있습니다. 이 경우, 그 '체조'란 길을 잃지 않고 길고 복잡한 과업을 관리하는 능력입니다.

이 논문은 이것이 모든 AI 문제를 해결하는 마법의 탄환이라거나, AI를 개선하는 유일한 방법이라고 주장하지 않습니다. 하지만 매혹적인 새로운 관점을 제시합니다: 어쩌면 우리는 AI에게 세상의 모든 직업을 가르칠 필요가 없을지도 모릅니다. 어쩌면 우리는 그저 AI에게 어떻게 하면 훌륭하고 조직적이며 목표 지향적인 일꾼이 될 수 있는지를 가르치기만 하면 되고, 그러면 AI가 나머지는 스스로 알아서 해낼지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →