← 최신 논문
🤖 machine learning

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo는 기존 방식의 불안정성을 해결하기 위해 과거의 경험을 동적으로 재교정하고 실행 가능한 탐색 방향을 추출함으로써, 제한된 예산 하에서도 추론 및 에이전트 벤치마크 전반에 걸쳐 우수한 성능과 더 매끄러운 진화 궤적을 달성하는 새로운 하네스 자기 진화 방법론이다.

원저자: Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 뇌(대규모 언어 모델, LLM)를 주었지만, 이 뇌가 실제로 작업을 수행하려면 몸과 규칙이 필요합니다. 이 "몸과 규칙"의 설정을 **하네스(harness)**라고 부릅니다. 하네스는 로봇의 운영 체제와 같아서, 로봇이 정보를 어떻게 찾아보고, 계산기나 코드 에디터 같은 도구를 어떻게 사용하는지, 그리고 방금 한 일을 어떻게 기억하는지를 결정합니다. 만약 하네스가 엉망이거나 혼란스러우면, 아무리 똑똑한 뇌를 가졌더라도 로봇은 비틀거릴 수밖에 없습니다.

오랫동안 좋은 하네스를 만드는 것은 마치 수작업으로 레이싱 카를 튜닝하는 것과 같았습니다. 전문가들은 무엇이 잘못되었는지 추측하고, 전선을 몇 개 수정하고, 테스트를 거친 뒤, 잘 되기를 기도해야 했습니다. 하지만 최근 과학자들은 로봇이 스스로 자신의 몸을 고칠 수 있다는 사실을 발견했습니다. 로봇은 변화를 시도하고, 그것이 효과가 있는지 확인하고, 결과를 기억한 뒤, 다시 시도할 수 있습니다. 이것을 **자기 진화(self-evolution)**라고 합니다. 아이디어는 이렇습니다. 만약 로봇이 자신의 과거 시도들을 기록한 일기를 계속 쓴다면, 실수를 통해 배우고 시간이 지남에 따라 더 나아질 수 있다는 것입니다. 하지만 여기에는 함정이 있습니다. 로봇에게 일기가 있다고 해서 그 일기를 읽는 법을 안다는 뜻은 아닙니다. 어제는 통했던 기술이 오늘 상황이 바뀌었다는 이유로 재앙이 될 수도 있습니다. 이 논문은 다음과 같은 질문을 던집니다. 어떻게 하면 로봇이 과거의 낡고 시대에 뒤떨어진 조언에 혼란을 느끼지 않고, 자신의 역사로부터 올바른 교훈을 얻도록 만들 수 있을까요?


문제점: 로봇의 혼란스러운 일기

강아지에게 공을 가져오도록 훈련시킨다고 상상해 보세요. 당신은 공을 던지고, 강아지는 달려가며, 때로는 공을 잡기도 하고 때로는 놓치기도 합니다. 당신은 모든 시도를 노트에 적습니다. 이제, 강아지가 새 목줄을 착용하거나, 바람이 다르게 불기 시작하거나, 테니스 공에서 삑삑이 장난감으로 바꿨다고 상상해 보세요. 만약 당신이 노트를 보고 "지난번에 강아지가 왼쪽으로 달릴 때 공을 놓쳤으니, 항상 오른쪽으로 달려야 해"라고 말한다면, 그것은 틀린 판단일 수 있습니다. 그 오래된 교훈은 새로운 상황에는 적용되지 않을 수도 있기 때문입니다.

이것은 AI 에이전트에게 정확히 일어나는 일입니다. 연구자들은 로봇이 자신의 전체 시도 기록을 살펴보며 자신의 "하네스"를 개선하려고 할 때, 종종 루프(loop)에 빠진다는 것을 발견했습니다. 로봇은 어떤 수정을 시도했다가 실패를 확인하고, 다른 것을 시도했다가 또 실패를 확인한 뒤, 갑자기 몇 주 전에 실패했던 방식으로 돌아가 버리곤 합니다. 로봇의 성능은 완만한 언덕을 오르는 대신 롤러코스터처럼 급등락합니다. 연구자들은 로봇이 두 가지 주요 문제로 고통받고 있다는 것을 깨달았습니다:

  1. "이게 아직도 유효한가?" 문제: 로봇은 자신의 예전 교훈이 여전히 유효한지 확인하지 않았습니다. 로봇의 코드가 변경되었음에도 불구하고, 모든 과거의 성공이나 실패를 마치 지금 당장 일어나고 있는 일인 것처럼 취급했습니다.
  2. "다음에 무엇을 해야 하는가?" 문제: 설령 로봇이 교훈을 기억하더라도, 정확히 어느 부분을 고쳐야 하는지, 혹은 어떻게 고쳐야 하는지 알지 못했습니다. 이는 마치 "공을 놓쳤다"라는 말만 듣고, "손의 움켜쥐는 힘을 조절해야 한다"라는 구체적인 지침을 듣지 못한 것과 같습니다.

해결책: DREvo (스마트한 사서)

이를 해결하기 위해 저자들은 DREvo라는 새로운 방법을 만들었습니다. DREvo를 로봇의 일기를 관리하는 매우 체계적인 사서라고 생각하면 됩니다. 단순히 로봇에게 종이 뭉치를 건네주는 대신, DREvo는 정보를 정리하고, 그것이 여전히 관련이 있는지 확인하며, 로봇에게 다음에 무엇을 할지에 대한 명확하고 구체적인 지침을 줍니다.

DREvo는 세 가지 재미있는 단계로 작동합니다:

1. "라벨 메이커" (함수 수준의 증거 앵커링 - Function-Level Evidence Anchoring)
기존 방식에서 로봇의 일기는 거대하고 엉망인 텍�스트 덩어리였습니다. DREvo는 이 덩어리를 작고 라벨이 붙은 조각들로 자릅니다. 로봇이 행한 모든 변화를 살펴보고 이를 특정 "함수"(예: 특정 도구나 메모리 규칙)에 태깅합니다. 이는 엉망인 레시피 북을 가져와서 각 재료의 변화를 정확히 어느 단계에 속하는지 라벨을 붙이는 것과 같습니다. 이렇게 하면 로봇이 학습하고 싶을 때, 과거의 교훈이 자신의 몸 중 정확히 어느 부분을 말하는 것인지 알 수 있습니다.

2. "신선도 체크" (상태 의존적 증거 재보정 - State-Dependent Evidence Recalibration)
이 부분이 가장 중요합니다. 로봇이 과거의 교훈을 사용하기 전에, DREvo는 두 가지 질문을 던집니다. "이 교훈은 여전히 신뢰할 수 있는가?" 그리고 "이 교훈이 현재 로봇의 몸에 적합한가?"

  • 신뢰성: 이 교훈이 이전에 사용될 때마다 매번 작동했는가, 아니면 단지 운 좋게 맞았던 것인가?
  • 신선도: 로봇의 코드가 이 교훈을 배웠을 때와 여전히 유사한가? 만약 로봇이 자신의 "움켜쥐는 힘(grip)"(코드 구조)을 바꿨다면, 움켜쥐기에 관한 오래된 교훈은 더 이상 작동하지 않을 수 있습니다.
    DREvo는 모든 교훈에 "점수"를 부여합니다. 교훈이 오래되었거나 로봇이 너무 많이 변했다면 점수가 낮아져 로봇이 이를 무시하게 만듭니다. 만약 교훈이 신선하고 신뢰할 수 있다면 점수는 높게 유지됩니다.

3. "코치의 휘슬" (역할 조건부 탐색 의도 추출 - Role-Conditioned Search Intent Distillation)
마지막으로, DREvo는 단순히 로봇에게 사실의 목록을 주는 것이 아니라, 게임 플랜을 제공합니다. 높은 점수를 받은 교훈들을 바탕으로, DREvo는 다음 시도를 위한 특정 "역할"을 로봇에게 부여합니다:

  • Exploit (활용): "이 기술은 예전에 아주 잘 작동했어! 다시 해봐!"
  • Avoid (회피): "이 기술은 지난번에 충돌을 일으켰어! 하지 마!"
  • Retest (재테스트): "이것에 대해서는 확신할 수 없어. 지금도 작동하는지 주의 깊게 시도해 보자."
  • Explore (탐색): "좋은 단서가 없어. 완전히 새로운 것을 시도해 보자."
    이 과정은 로봇의 막연한 "더 잘하고 싶다"는 느낌을 "메모리 도구를 '활용(Exploit)' 전략을 사용하여 고쳐라"와 같은 명확하고 실행 가능한 명령으로 바꿔줍니다.

연구 결과

연구진은 화학 퍼즐 풀기부터 의료 증상 진단, 컴퓨터 코드 수정, 가상 터미널 탐색에 이르기까지 다섯 가지 서로 다른 과제를 대상으로 DREvo를 테스트했습니다. 그들은 DREvo를 스스로 진화하려는 다른 로봇들 및 인간이 설계한 하네스를 가진 로봇들과 비교했습니다.

결과는 매우 유망했습니다. 제한된 시도 횟수(즉, 로봇이 영원히 연습하도록 내버려 두지 않은 상태) 내에서, DREvo는 모든 카테로리에서 최고의 하네스를 찾아냈습니다.

  • 의료 진단 작업에서 DREvo는 **89.2%**의 정확도에 도달하여, 두 번째로 좋은 방법보다 2.4 퍼센트 포인트 앞섰습니다.
  • 법률 추론 작업에서 **49.0%**를 기록하여, 그다음 방법보다 4.0 퍼센트 포인트 앞섰습니다.
  • 화학 반응 예측에서 **25.0%**를 기록하여, 차순위 방법보다 9.0 퍼센트 포인트 높았습니다.
  • 에이전트 작업(코드 수정이나 컴퓨터 터미널 사용 등)의 경우, DREvo는 다른 방법들에 비해 추론 작업에서는 평균 16.2%, 에이전트 작업에서는 **13.8%**의 성능 향상을 보였습니다.

가장 중요한 점은 연구진이 DREvo의 발전이 매우 매끄럽다는 것을 관찰했다는 것입니다. 다른 로봇들의 점수가 급격히 오르내리는(퇴보와 회복을 반복하는) 반면, DREvo의 정확도는 꾸준히 상승했습니다. 또한 DREvo는 자신의 "사고 공간(컨텍스트)"을 약 2.9K 토큰 정도로 작게 유지하면서도, 다른 방법들보다 성능은 더 좋으면서도 훨씬 적은 양의 데이터(다른 방법들은 5.3K 토큰 이상이 필요함)를 사용했습니다.

요약

이 논문은 로봇에게 단순히 과거의 이력을 주는 것만으로는 충분하지 않다는 점을 시사합니다. 진정으로 학습하기 위해서는, 로봇이 과거의 교훈이 여전히 적용되는지 확인하고, 그 교훈을 명확하고 구체적인 지침으로 번역할 수 있는 시스템이 필요합니다. DREvo는 바로 그 시스템으로서, 시행착오의 엉망인 역사를 매끄럽고 신뢰할 수 있는 개선의 경로로 바꾸어 줍니다. 이는 우리가 과거의 경험을 어떻게 사용하는지에 대해 똑똑하게 대처함으로써, 무제한의 연습 시간 없이도 AI 에이전트가 훨씬 더 빠르고 안정적으로 진화하도록 도울 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →