← 최신 논문
🤖 machine learning

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

이 논문은 적대적 솔버 캘리브레이션(adversarial solver calibration)을 사용하여 과제가 해결 가능하면서도 도전적인 '학습 가능 영역(learnable zone)'을 식별함으로써 효과적인 터미널 훈련 태스크를 합성하는 자율 시스템인 CalibForge를 소개하며, 이는 기존의 데이터 큐레이션 방식과 비교하여 여러 에이전트 벤치마크에서 상당한 성능 향상을 가져옵니다.

원저자: Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 디지털 작업실에서 물건을 고치는 법을 가르치려 한다고 상상해 보십시오. 당신은 로봇에게 도구 상자와 작업 목록을 주지만, 여기에는 함정이 있습니다. 만약 작업이 너무 쉬우면 로봇은 지루해하며 아무것도 배우지 못하고, 너무 어려우면 로봇은 즉시 포기하며 아무것도 배우지 못합니다. 학습을 위한 최적의 지점은 '골디락스(Goldilocks)'형 도전 과제입니다. 즉, 로봇이 정말 열심히 생각하면 풀 수 있지만, 주의력이 부족하거나 혼란스러우면 실패하게 되는 수준의 난이도입니다. 이것이 AI 에이전트를 훈련하는 핵심적인 퍼즐입니다. 어떻게 하면 이 학습 영역에 딱 맞춰진 거대한 작업 라이브러리를 만들 수 있을까요?

오랫동안 연구자들은 작업들이 실행 가능하고(executable), 명확한 정답이 있는지 확인하는 방식으로 이러한 작업 라이브러리를 구축하려고 노력해 왔습니다. 하지만 어떤 작업이 수행 가능하다는 사실만으로는 좋은 스승이 될 수 없습니다. 어떤 작업은 너무 단순해서 어떤 로봇이든 즉시 해결할 수 있고, 어떤 작업은 너무 망가져 있어서 어떤 로봇도 결코 해결할 수 없을 수도 있습니다. 큰 질문은 이것입니다: 어떻게 하면 로봇을 더 똑똑하게 만들 만큼 적절히 어려운 작업을 찾아낼 수 있을까요?

여기서 CalibForge라고 불리는 새로운 시스템이 등장합니다. CalibForge를 단순히 작업 생성기가 아니라, 로봇과 '적대적(adversarial)' 게임을 벌이는 익살스러운 게임 마스터라고 생각하십시오. CalibForge는 단순히 작업이 작동하는지 확인하는 것을 넘어, 다양한 '솔버(solver, 해결사)' 로봇들(매우 똑똑한 로봇부터 조금 덜 똑똑한 로봇까지)을 고용하여 그 작업을 시도하게 합니다. 만약 똑똑한 로봇은 해결하지만 덜 똑똑한 로봇은 실패한다면, 그 작업은 완벽합니다. 학습 영역에 있는 것이죠! 만약 모두가 해결한다면, 그 작업은 너무 쉬운 것이므로 CalibForge는 이를 더 어렵게 만듭니다. 만약 모두가 실패한다면, 그 작업은 망가진 것이므로 CalibForge는 이를 수정합니다. 이처럼 서로 다른 로봇들의 반응에 따라 작업을 끊임없이 미세 조정함으로써, CalibForge는 완벽하게 보정된 5,431개의 도전 과제 라이브러리를 구축합니다. 새로운 로봇들이 이 라이브러리로 훈련될 때, 그들은 실제 세계의 컴퓨터 문제를 해결하는 능력이 현저히 향상됩니다. 이는 '골디락스' 영역이 AI를 가르치는 데 있어 비결임을 증명합니다.

문제점: 너무 쉬운가, 너무 어려운가, 아니면 딱 적당한가?

인공지능의 세계, 특히 '터미널 에이전트'(컴퓨터 터미널에 명령어를 입력하여 코드를 수정하거나 서버를 관리하는 로봇) 분야에서 연구자들은 방대한 연습 문제 라이브러리를 구축해 왔습니다. 목표는 이 에이전트들이 복잡한 실제 엔지니어링 작업을 처리할 수 있도록 훈련하는 것입니다. 그러나 이 방식에는 결함이 있습니다.

대부분의 시스템은 다음 두 가지만 확인합니다:

  1. 수행 가능한가? (컴퓨터 환경이 올바르게 설정되었는가?)
  2. 정답이 있는가? (작업에 명확한 합격/불합격 테스트가 있는가?)

하지만 이것은 학생에게 "2+2는 무엇인가?"(너무 쉬움)와 "아직 발명되지 않은 방정식을 푸시오"(불가능) 중 하나인 수학 시험을 치르게 하는 것과 같습니다. 둘 다 학생의 학습에는 도움이 되지 않습니다. 논문은 작업이 **솔버 상대적 학습 가능성(solver-relative learnable)**을 갖추어야 한다고 주장합니다. 즉, 작업은 유능한 에이전트에 의해 해결될 수 있어야 하지만, 약한 에이전트에 의해서는 해결될 수 없어야 합니다. 작업은 에이전트의 능력 경계선 바로 위에 위치하여, 에이전트가 성공하기 위해 자신의 능력을 확장하도록 강요해야 합니다.

해결책: 적대적 게임 마스터

저자들은 끊임없이 움직이는 게임 마스터 역할을 하는 자율 시스템인 CalibForge를 개발했습니다. CalibForge는 단순히 작업을 작성하는 것이 아니라, **적대적 솔버 보정(Adversarial Solver Calibration)**이라는 과정을 통해 작업을 '보정(calibrate)'합니다.

마법이 일어나는 단계는 다음과 같습니다:

  1. 단서(The Clue): CalibForge는 "망가진 데이터베이스 수정하기"나 "유실된 데이터 복구하기"와 같은 막연한 아이디어에서 시작합니다.
  2. 초안(The Draft): '저자 에이전트(Author Agent)'(똑똑한 AI)가 지침, 가상 컴퓨터 환경, 그리고 작업 완료 여부를 확인하는 테스트를 포함한 전체 작업을 작성합니다.
  3. 스트레스 테스트(The Stress Test): 작업이 유지되기 전, Calib Forge는 일련의 '솔버 에이전트(Solver Agents)'들에게 작업을 보내 해결해 보도록 합니다.
  4. 보정 루프(The Calibration Loop): 이것이 핵심 비결입니다. CalibForge는 작업이 충분히 좋은지 결정하기 위해 두 가지 특정 전략을 사용합니다:
    • 다중 솔버 보정(Multi-Solver Calibration): 작업을 다양한 AI 모델 그룹에 보냅니다. 만약 모두가 해결한다면, 작업이 너무 쉬운 것이므로 CalibForge는 이를 더 어렵게 만듭니다. 만 만약 아무도 해결하지 못한다면, 작업이 망가진 것이므로 CalibForge는 이를 수정합니다. 작업은 **불일치(disagreement)**가 발생할 때만 유지됩니다. 즉, 최소 한 명의 솔버는 성공하고 최소 한 명의 솔버는 실패해야 합니다. 이는 작업이 '학습 영역'에 있음을 증명합니다.
    • 대조적 보정(Contrastive Calibration): 작업을 '강한 솔버'(매우 똑똑한 AI)와 '약한 솔버'(덜 유능한 AI)에게 보냅니다. 강한 솔버는 통과하고 약한 솔버는 실패할 때만 작업이 유지됩니다. 이는 작업이 똑똑한 모델에게는 도전이 될 만큼 어렵지만, 너무 어려워서 불가능한 수준은 아님을 보장합니다.

만약 작업이 이러한 엄격한 기준을 충족하지 못하면, CalibForge는 단순히 버리지 않습니다. 솔버들이 왜 실패했는지 혹은 왜 성공했는지를 살펴본 뒤, 다시 지침, 환경 또는 테스트를 재작성합니다. 이 루프를 작업이 완벽하게 보정될 때까지 최대 50회 반복합니다.

결과: 완벽한 도전 과제의 라이브러리

이 방법을 사용하여 CalibForge는 5,431개의 고도로 보정된 터미널 작업 데이터셋을 구축했습니다. 연구진은 이 데이터로 두 가지 서로 다른 AI 모델(300억 파라미터 모델 및 350억 파라미터 모델)을 훈련시켰습니다.

결과는 인상적이었습니다. CalibForge의 작업으로 훈련된 모델은 기존의 다른 데이터셋으로 훈련된 모델보다 성능이 크게 뛰어났습니다:

  • Terminal-Bench 2.0(터미널 에이전트를 위한 표준 테스트)에서 모델들은 **32.58%**와 **47.57%**를 기록하며 이전의 최고 기록을 큰 차이로 앞질렀습니다.
  • 개선 효과는 훈련 데이터에만 국한되지 않았습니다. 완전히 다른 실제 소프트웨어 엔지니어링 과제(SWE-bench ProDoc2Repo)에 대해 테스트했을 때, 모델들은 기본 버전 대비 각각 27.6830.04 퍼센트 포인트라는 엄청난 향상을 보여주었습니다.

이것이 중요한 이유

이 논문은 더 나은 AI 에이전트를 만드는 열쇠는 단순히 더 많은 데이터를 주는 것이 아니라, 올바른 종류의 데이터를 주는 것임을 시사합니다. 서로 다른 솔버들의 행동을 피드백 루프로 활용함으로써, CalibForge는 라이브러리의 모든 작업이 진정한 학습 기회가 되도록 보장합니다.

저자들은 단순히 더 많은 솔버 피드백을 추가하거나 단일 솔버를 사용하여 작업을 확인하는 것만으로는 충분하지 않다는 것을 명시적으로 보여줍니다. '골디락스' 효과, 즉 어떤 이에게는 어렵지만 다른 이에게는 쉬운 작업이 학습을 이끄는 동력이 됩니다. 이 접근 방식은 작업 생성 과정을 정적인 '작성 후 기대하기(write and hope)' 방식에서, 완벽한 난이도를 적극적으로 찾아내는 역동적이고 자기 교정적인 시스템으로 변화시킵니다.

요컨대, CalibForge는 만약 당신이 초지능 로봇을 훈련시키고 싶다면, 단순히 숙제 더미를 주는 것이 아니라, 로봇이 고민하고, 고군분투하며, 결국 성공하게끔 완벽하게 조율된 숙제 더미를 주어야 한다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →