← 최신 논문
🤖 AI

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

이 논문은 검증 가능한 보상을 활용한 강화 학습(RLVR)이 실시간 API나 인간의 피드백에 의존하지 않고도 합성된 Atlassian(Jira 및 Confluence) 환경에서 소규모 언어 모델의 복잡한 다단계 도구 호출 실행 능력을 크게 향상시켜 대부분의 시나리오에서 완벽에 가까운 성공률을 달성함을 입증하는 개념 증명을 제시한다.

원저자: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 박학다식한 사서(AI)를 상상해 보세요. 이 사서는 다음에 올 단어를 예측하는 데 아주 능숙합니다. 만약 당신이 "하늘은..."이라고 물으면, 그는 자신 있게 "푸르다"라고 말할 것입니다. 하지만 만약 당신이 그에게 복잡한 사무 시스템 내에서 실제로 무언가를 수행하도록, 예를 들어 "새 프로젝트 티켓을 생성하고 특정 페이지에 연결해 줘"라고 요청한다면, 그는 종종 실수를 저지릅니다. 그는 적절한 '말'은 할 줄 알지만, 엉뚱한 ID 번호를 잘못된 칸에 넣거나, 해당 칸이 존재하는지 먼저 확인하는 것을 잊어버리는 등 '세부 사항'에서 틀리곤 합니다.

이 논문은 그 사서에게 단순히 말하는 법이 아니라, 실제로 업무를 수행하는 법을 가르치는 방법인 RLVR(검증 가능한 보상을 이용한 강화 학습, Reinforcement Learning with Verifiable Rewards)이라는 특정 훈련법에 관한 것입니다.

다음은 이 실험의 내용을 일상적인 용어로 풀어서 설명한 것입니다.

1. 문제점: "오토파일럿(자동 조종)" vs "파일럿(조종사)"

거대 언어 모델(LLM)은 다음에 올 단어를 예측하는 오토파일럿처럼 훈련되었습니다. 이들은 이야기나 이메일을 쓰는 데는 탁월합니다. 하지만 기업용 사무실(구체적으로 Jira와 Confluence 같은 Atlassian 도구 사용 환경)에서의 성공은 예쁜 문장을 쓰는 것이 아니라, 정확한 데이터를 가지고 정확한 순서대로 정확한 버튼을 누르는 것에 달려 있습니다.

  • 기존 방식: 당신이 AI에게 "하위 작업(sub-task)을 생성해"라고 요청합니다. AI는 "네, 하위 작업을 생성하겠습니다"라고 말할 수는 있지만, 담당자를 지정하는 것을 잊거나 잘못된 프로젝트 코드를 사용합니다. 말은 유창하게 하지만, 작업은 실패합니다.
  • 목표: 저자들은 AI가 단순히 "다음 단어를 추측"하는 것을 멈추고, 비행 전 계기를 점검하는 "파일럿"처럼 행동하도록 훈련할 수 있는지 확인하고자 했습니다.

2. 해결책: "비디오 게임" 훈련장

AI를 실제 회사의 라이브 서버에서 연습하게 하는 것은 위험하고 느리기 때문에(리스크가 크기 때문에), 저자들은 Jira와 Confluence 시스템의 완벽한 디지털 트윈(비디오 게임 버전)을 구축했습니다.

  • 시뮬레이터: 이 "게임"은 실제 소프트웨어와 똑같이 보이고 작동하지만, 안전합니다. AI가 실수를 하더라도 아무것도 망가지지 않습니다.
  • 심판 (보상 시스템): 이것이 핵심 비결입니다. 보통은 사람이 AI의 결과물을 채점해야 합니다. 하지만 여기서는 엄격하고 자동화된 심판을 만들었습니다.
    • AI가 올바른 데이터를 올바른 칸에 넣었다면? 점수 획득.
    • AI가 페이지를 편집하기 전에 해당 페이지가 존재하는지 먼저 확인했다면? 보너스 점수.
    • AI가 존재하지 않는 도구를 사용하려고 하거나 필수 단계를 잊었다면? 감점.
    • 중요한 점은: 심판은 화면을 보기 위해 사람의 도움을 받을 필요가 없습니다. 그저 수학적 계산과 코드를 확인할 뿐입니다.

3. 훈련: 시행착오

그들은 두 가지 버전의 AI(더 작은 1.7B 모델과 더 큰 4B 모델)를 가져와 이 시뮬레이터에서 수천 번씩 플레이하게 했습니다.

  • AI는 작업(예: "페이지 생성")을 완료하려고 시도합니다.
  • 실패하면 낮은 점수를 받고, 다시 시도합니다.
  • AI는 서서히 배웁니다: "아, 부모 페이지를 먼저 확인했을 때 점수를 얻었구나. 프로젝트 코드를 잊어버려서 점수를 잃었구나."
  • 이것이 **강화 학습(Reinforcement Learning)**입니다. AI는 좋은 행동에는 보상을 받고, 나쁜 행동에는 벌칙을 받으며 배웁니다.

4. 결과: "괜찮은 수준"에서 "완벽함"으로

그들은 훈련 전후의 AI를 다섯 가지 사무 업무에 대해 테스트했습니다.

  • 훈련 전: AI는 단순한 작업에는 준수했지만, 복잡한 작업에는 형편없었습니다. 예를 들어, 새로운 Confluence 페이지를 생성하는 작업에서 훈련되지 않은 AI는 약 **35%**의 점수만 획득했습니다. 계속해서 작지만 치명적인 실수를 저질렀습니다.
  • 훈련 후: 훈련된 AI는 거의 완벽해졌습니다. 동일한 페이지 생성 작업에서 점수가 **100%**로 뛰었습니다.
  • 큰 성과: 훈련은 가장 어려운 작업(규칙과 데이터 필드가 가장 많은 작업)에서 가장 효과적이었습니다. AI는 이러한 시스템에 필요한 엄격한 "확인 후 실행(check-then-do)" 패턴을 익혔습니다.

5. 한계 (제약 사항)

저자들은 이 기술이 아직 무엇을 하지 못하는지에 대해서도 매우 솔직합니다.

  • 모든 것에 마법처럼 적용되지는 않습니다: 이 특정 작업들을 위해 "심판 규칙"을 직접 손으로 만들어야 했습니다. 단순히 이 기술을 세상의 모든 소프트웨어에 바로 적용할 수는 없습니다. 새로운 심판을 먼저 구축하지 않고서는 말이죠. 이는 마치 축구를 아주 잘 가르치지만 농구는 아직 배우지 못한 코치를 둔 것과 같습니다.
  • 한 가지 작업은 너무 쉬웠습니다: 특정 작업(티켓 상태 변경)의 경우, AI가 훈련 전에도 이미 완벽했기 때문에 훈련이 추가적인 가치를 더해주지 못했습니다.

결론

이 논문은 표준적인 AI를 가져와 안전한 시뮬레이션 사무 환경에 넣고, 엄격하고 자동화된 심판을 사용하여 복잡한 규칙을 따르는 법을 가르칠 수 있다는 것을 증명합니다. 이는 AI를 "말은 잘하지만 세부 사항에서 실패하는 수다쟁이 봇"에서, "업무를 완벽하게 완수하는 신뢰할 수 있는 직원"으로 변화시킵니다. 하지만 이를 위해서는 AI가 사용하고자 하는 각 특정 유형의 소프트웨어마다 맞춤형 "훈련 체육관"을 구축해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →