DarwinX: Evolving Agent Harnesses Through Natural Selection
DarwinX는 보존 및 확장 계약(preserve-and-extend contract)과 재조합을 통해 LLM 에이전트 하네스를 진화시키는 개체군 기반 자연 선택 프레임워크를 도입하여, 기존 작업에 대한 퇴보 없이 또는 모델 재학습 없이도 다양한 벤치마크에서 상당하고 일반화 가능한 성능 향상을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑한 로봇이 하나 있다고 상상해 보세요. 하지만 이 로봇은 유리 상자 안에 갇혀 있습니다. 당신은 로봇의 뇌를 바꿀 수도 없고, 새로운 사실을 가르칠 수도 없습니다. 로봇은 시간 속에 얼어붙어 있습니다. 그럼에도 불구하고, 당신은 고장 난 코드를 수정하는 것부터 웹사이트를 탐색하는 것까지 천 가지의 서로 다른 퍼즐을 해결해야 합니다. 어떻게 하면 이 로봇을 더 낫게 만들 수 있을까요? 인공지능의 세계에서 이것은 '에이전트(agent)'의 과제입니다. 에이전트는 단순히 뇌(모델)만을 의미하는 것이 아니라, 그 뇌가 어떻게 행동할지를 알려주는 지침, 도구, 그리고 규칙의 집합인 '하네스(harness)'이기도 합니다. 뇌를 세상의 모든 레시피를 알고 있는 뛰어난 요리사라고 한다면, 하네스는 바로 그 요리사가 일하는 주방 그 자체입니다. 만약 주방이 엉망이라면, 요리사가 아무리 재능이 뛰어나더라도 재료를 떨어뜨리거나 수프를 태워버릴 것입니다. 과학자들은 스스로 개선되는 주방을 만들기 위해 노력해 왔지만, 대부분의 시도는 요리를 하면서 동시에 자신의 작업대를 고치려는 단 한 명의 요리사와 같았습니다. 그들은 종종 한 가지 문제(예: 양파를 더 빨리 써는 법)를 해결하지만, 실수로 다른 문제(예: 가스불을 끄는 것을 잊음)를 일으키곤 합니다.
여기서 Salesforce AI Research의 새로운 접근 방식인 DarwinX가 등장합니다. DarwinX는 AI 에이전트를 개선하는 과정을 마치 배양 접시 안에서 벌어지는 거대한 자연 선택 실험처럼 다룹니다. 혼자서 모든 것을 고치려는 한 명의 요리사 대신, DarwinX는 다양한 종류의 주방 설정을 가진 전체 인구 집단을 만듭니다. 이들에게 새로운 도구나 지침을 시도하게 하되, 엄격한 규칙을 적용합니다. 즉, 기존의 문제를 깨뜨리지 않으면서 새로운 문제를 해결할 수 있는 설정만을 남길 수 있다는 것입니다. 이는 단순히 운이 좋은 것이 아니라, 이미 알고 있던 것을 망가뜨리지 않으면서 더 많은 일을 해낼 수 있는 자가 살아남는 "적자생존" 게임과 같습니다. 이 논문은 AI의 뇌를 얼려둔 채 오직 이러한 "주방 설정"만을 진화시킴으로써, 시스템이 한 번도 본 적 없는 퍼즐에 대해서도 훨씬 더 복잡한 과제를 잘 해결할 수 있게 된다고 제안합니다.
완벽한 도구 벨트의 진화
DarwinX의 연구진은 간단한 질문을 던졌습니다: 만약 우리가 AI의 뇌를 다시 학습시키려 노력하는 대신, 그것이 사용하는 도구와 지침의 진화에 온전히 집중한다면 어떻게 될까? 그들은 이를 "하네스(harness)"라고 부릅니다. 여기에는 프롬프트(지침), 도구(계산기나 웹 브라우저 등), 그리고 제어 흐름(AI가 취하는 단계)이 포함됩니다.
이를 테스트하기 위해 그들은 디지털 배양 접시를 마련했습니다. 그들은 강력한 AI 모델을 가져와 뇌를 완전히 얼려버렸습니다. 그런 다음, 다양한 "하네스"(서로 다른 지침과 도구 세트)의 집단을 만들고 그것들이 진화하도록 내버려 두었습니다. 마법은 다음과 같이 일어났습니다:
1. "보존 및 확장" 계약 (The "Preserve-and-Extend" Contract)
당신이 정원사라고 상상해 보세요. 당신에게는 완벽한 토마토를 키우는 식물이 있습니다. 당신은 이 식물이 딸기도 키우길 원합니다. 서툰 정원사는 식물에게 딸기를 키우도록 강요하다가 실수로 토마토를 죽일 수도 있습니다. DarwinX는 "보존 및 확장" 계약이라는 엄격한 규칙을 사용합니다. 새로운 버전의 하네스는 새로운 과제(예: 딸기 키우기)를 해결하면서도 기존의 과제(토마토는 여전히 완벽해야 함)에서 퇴보하지 않는 경우에만 생존할 수 있습니다. 만약 어떤 새로운 아이디어가 한 문제를 해결하지만 다른 문제를 망가뜨린다면, 그 아이디어는 정원에서 잘려 나갑니다. 이는 AI가 이미 알고 있던 것을 잊지 않으면서도 점점 더 나아지도록 보장합니다.
2. "만약에"의 기록 보관소 (The Archive of "What-Ifs")
많은 진화 실험에서는 경로가 막다른 길로 이어지면 그것을 버립니다. 하지만 DarwinX는 다릅니다. 전체적으로는 실패했더라도, 그 모든 변형(variant)을 기록 보관소에 보관합니다. 왜일까요? 실패한 하네스라도 특정 문제를 해결하는 단 하나의 빛나는 기술을 가지고 있을 수 있기 때문입니다. 이 "패배자"들을 보관함으로써, DarwinX는 나중에 이들을 서로 조합하고 섞을 수 있습니다. 이는 마치 다리를 건설하려던 실패한 시도가 훌는 현수 케이블에 대한 훌륭한 아이디어를 가지고 있었음을 깨닫는 것과 같습니다. 그 케이블을 다른 다리 설계와 결합하면, 슈퍼 브리지를 만들 수 있습니다. 이러한 "재결합(recombination)"을 통해 시스템은 여러 서로 다른 혈통의 가장 좋은 부분들을 엮어 복잡한 기술을 구축할 수 있습니다.
3. 세 가지 유형의 단서 (The Three Types of Clues)
시스템은 무엇을 변경해야 할지 어떻게 알까요? 시스템은 AI의 뇌를 건드리지 않고도 세 가지 유형의 단서를 사용합니다:
- 실패 단서 (Failure Clues): AI가 실패할 때, 시스템은 왜 실패했는지 분석하고 해결책을 제안합니다.
- 교사 단서 (Teacher Clues): 인간이나 더 강력한 AI가 올바른 방법을 보여주면, 시스템은 그 방법을 복제합니다.
- 자기 단서 (Self-Clues): 시스템은 자신의 성공적인 시도와 실패한 시도를 비교하여 차이점을 파악합니다.
이러러한 단서들은 프롬프트를 수정하거나 새로운 도구를 추가하는 것과 같은 작은 하네스 편집으로 전환됩니다.
결과: 얼어붙은 뇌, 슈퍼 브레인
연구진은 쉬운 단계부터 매우 어려운 단계까지 네 가지 챌린지를 통해 테스트를 진행했습니다. 결과는 놀라울 정도로 강력했으며, 얼어붙은 모델도 하네스를 진화시킴으로써 훨씬 더 유능한 에이전트가 될 수 있음을 시사했습니다.
- 터미널 벤치 (코딩 과제): 89개의 코딩 과제 세트에서, 진화된 하네스는 GPT-5.5 모델의 성공률을 **75.5%**에서 **83.2%**로 끌어올렸습니다. 더 강력한 GPT-5.6 모델에서는 **84.7%**에 도달하여, 뇌 자체가 변하지 않았음에도 불구하고 세계 최고의 기존 에이전트들과 대등하거나 그들을 능가했습니다. 논문은 AI가 단순히 "운이 좋았던" 것이 아니라고 언급합니다. AI는 어려운 문제에는 시도 횟수를 두 배로 늘리고 쉬운 문제는 그대로 두는 방식으로, 정확히 자신이 어려워하는 과제에 더 많은 시간과 노력을 쏟는 법을 배웠습니다.
- "홀드아웃" 테스트 (일반화): 그 후, 진화된 에이전트를 한 번도 본 적 없는 41개의 새로운 과제에 대해 테스트했습니다. 진화된 하네스는 이 중 **68.3%**를 해결하며, 테스트한 다른 모든 기성 제품(off-the-shelf) 에이전트들을 앞질렀습니다. 이는 AI가 단순히 답을 암기한 것이 아니라 일반적인 기술을 학습했음을 시사합니다.
- "합성-실제" 도약 (The "Synthetic-to-Real" Leap): WebArena-Infinity라는 브라우저 기반 테스트에서, 시스템은 300개의 가짜 합성 과제로 진화한 후 1,260개의 실제 과제에 대해 테스트를 받았습니다. 성공률은 **43.5%**에서 **93.0%**로 급증했습니다. 이는 엄청난 성과인데, 이는 AI가 단순히 특정 테스트 제약을 우회하는 법이 아니라 브라우저를 올바르게 사용하는 법을 배웠음을 의미하기 때문입니다. 연구진은 결과를 감사한 결과, 진화된 에이전트가 "제약을 우회하는 것"(예: 테스트를 해킹하려고 시도하는 것)을 멈추고 정당한 방식으로 행동하기 시작했다는 것을 발견했습니다.
- 교차 벤치마크 전이 (The Cross-Benchmark Transfer): 마지막으로, 코딩 과제를 위해 진화된 하네스를 SWE-bench Verified(소프트웨어 엔지니어링)라는 완전히 다른 벤치마크에 적용했습니다. 새로운 학습 없이도 **84.2%**를 기록하며, 학습된 기술이 새로운 유형의 문제에도 전이될 수 있음을 증명했습니다.
무엇이 변했는가? "검증" 기술
논문은 AI의 뇌(정확히는 하네스)에서 실제로 무엇이 변했는지 깊이 파고듭니다. 밝혀진 바에 따르면, AI는 수학이나 역사에 대한 새로운 사실을 배운 것이 아닙니다. 대신, **검증(verification) 및 계약(contracts)**과 관련된 일련의 기술을 배웠습니다.
이전의 AI는 종-종 답을 추측하고 그것이 맞기를 바랐습니다. 하지만 진화된 AI는 다음을 학습했습니다:
- 계약 생성: 과제를 마치기 전에, 무엇이 "정답"인지에 대한 정의를 정확히 내립니다.
- 자기 검토: 출력값이 해당 계약에 부합하는지 확인하기 위해 도구를 실행합니다.
- 실수 수정: 만약 검증에 실패하면, 다시 루프를 돌아 다시 시도합니다.
이 "검증 묶음(verification bundle)"이 AI로 하여금 복잡한 소프트웨어 환경을 설정하거나 웹사이트를 길을 잃지 않고 탐색하는 것과 같은 어려운 다단계 과제를 수행할 수 있게 해주었습니다. 이것은 답을 찍는 학생과 자신의 답을 재차 확인하는 학생의 차이와 같습니다.
핵심 요점
DarwinX는 AI를 더 좋게 만들기 위해 항상 더 크고 똑똑한 뇌가 필요한 것은 아니라는 점을 시사합니다. 때로는 더 나은 지침과 도구를 진화시키는 것만으로도 충분합니다. AI의 "하네스"를 선택, 보관 및 재결합할 수 있는 살아있는 것으로 취급함으로써, 연구진은 더 신뢰할 수 있고, 더 유능하며, 제약을 우회하는 일이 적은 에이전트를 만들어냈습니다. 이 논문은 이러한 성과가 단순한 시뮬레이션이 아니라 실질적이고 측정 가능한 것이며, AI가 한 번도 접해보지 못한 과제에 직면했을 때도 유지된다는 점을 강조합니다. 이는 때때로 천재를 더 똑똑하게 만드는 가장 좋은 방법은 더 나은 도구를 제공하고 그것을 사용하는 법을 가르치는 것임을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.