← 최신 논문
🤖 AI

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

이 논문은 메모리 기반 자기 개선 에이전트의 성능이 미지정성(underspecification)으로 인해 평가 분산과 작업 순서에 매우 민감하다는 것을 입증함으로써 이들의 취약성을 폭로하며, 이를 통해 더욱 엄격한 평가 프로토콜과 강화된 인간 감독을 옹호한다.

원저자: Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단순히 스크립트를 따르는 것이 아니라, 자신의 실수를 통해 배우고 무엇이 효과적이었고 무엇이 그렇지 않았는지를 기록한 일지를 작성하여 미래의 업무를 더 잘 수행할 수 있도록 하는 디지털 비서가 있다고 상상해 보십시오. 이것이 바로 웹 브라우저와 같은 복잡한 디지털 세계를 탐색하고 시간이 흐름에 따라 기술을 연마하도록 설계된 인공지능의 한 형태인 '자기 개선형 에이전트(self-improving agents)'의 약속입니다. 인간이 새로운 도전 과제가 생길 때마다 매번 재프로그래밍하는 대신, 이 시스템들은 과거의 작업으로부터 얻은 교훈을 저장하는 텍스트 기반의 메모리 뱅크를 유지하며 다음 행동을 안내합니다. 그 희망은 이들이 궁극적으로 일상적인 업무를 자동화하고, 새로운 상황에 적응하며, 인간이 놓칠 수 있는 해결책을 발견하는 것입니다. 하지만 이러한 시스템이 현실 세계에서 신뢰를 얻기 위해서는 반드시 신뢰할 수 있어야 합니다. 만약 에이전트가 실수를 저질렀을 때, 그것이 단발적인 오류로 끝나야 하며, 그 오류가 눈덩이처럼 불어나 시스템이 잘못된 교훈을 학습하게 만들고 예측하기 어려운 방식으로 반복적인 실패를 초래해서는 안 됩니다.

세일즈포스 AI 리서치(Salesforce AI Research)의 연구팀은 이 약속을 엄격하게 검증해 보기로 했습니다. 그들은 이러한 자기 개선형 에이전트를 구축하는 데 사용되는 두 가지 대중적인 방법을 가져와, 기존의 평가 방식보다 훨씬 더 강력한 스트레스 테스트를 실시했습니다. 단순히 한 번의 실험을 실행하고 결과를 보고하는 대신, 결과가 얼마나 변하는지 확인하기 위해 동일한 작업 세트를 여러 번 반복 실행했습니다. 또한 이전 연구들이 사용했던 '쉬운 것에서 어려운 것으로' 진행되는 깔끔한 단계적 구성을 제거하기 위해 작업이 나타나는 순서를 뒤섞었습니다. 그들이 발견한 것은 취약성의 모습이었습니다. 에이전트들은 기대했던 것처럼 꾸준하고 신뢰할 수 있는 학습자가 아니었습니다. 사실, 스스로를 개선하려는 시도 자체가 오히려 이들을 덜 안정적으로 만들고, 작은 오류를 큰 성능 변화로 증폭시키는 경우가 많았습니다.

연구진은 이러한 에이전트들의 성능이 우연에 놀라울 정도로 민감하다는 것을 발견했습니다. 동일한 실험을 세 번 실행했을 때, 결과는 종종 크게 달랐습니다. 어떤 경우에는 최선의 실행과 최악의 실행 사이의 격차가 10% 포인트에 달하기도 했습니다. 이는 밑바탕이 되는 기술과 작업이 동일함에도 불구하고, 에이전트가 한 번의 시도에서는 눈부시게 성공했다가 다음 시도에서는 처참하게 실패할 수 있음을 의미합니다. 자기 개선 메커니즘이 켜졌을 때, 이러한 불안정성은 종종 더 악화되었습니다. 시스템은 처음 몇 개의 작업으로부터 학습하지만, 초기 단계가 무작위적인 확률의 영향을 받았기 때문에 저장된 '교훈'이 약간 어긋날 수 있습니다. 이러한 작은 무작위 편차들은 시간이 지나면서 누적되어, 에이전트를 동료들과는 매우 다른 경로로 이끌게 됩니다. 연구진은 거의 4분의 3의 테스트 케이스에서 자기 개선 루프를 추가하는 것이 성능을 더 일관되게 만드는 것이 아니라 오히려 변동성을 높여 에이전트의 행동을 더 예측 불가능하게 만든다는 점에 주목했습니다.

또 다른 주요 발견은 이러한 에이전트들이 작업에 마주하는 순서에 크게 의존한다는 것이었습니다. 이전 연구들은 대부분 작업을 단순한 것에서 어려운 것으로 배치하여 일종의 숨겨진 훈련 가이드 역할을 하게 했습니다. 에이전트들은 어려운 문제로 부드럽게 유도되는 환경에서는 학습을 잘하는 것처럼 보였습니다. 그러나 연구진이 순서를 뒤섞어 무작위 순서로 작업을 제시하자, 에이전트들의 성능은 떨어졌습니다. 이들은 점점 나아지는 대신, 메모리가 전혀 없는 상태보다도 더 낮은 성과를 보였습니다. 이는 에이전트들이 진정으로 일반적인 기술을 배우는 것이 아니라, 단순히 특정 사건의 순서를 암기하고 있었음을 시사합니다. 그 순서가 깨졌을 때 에이전트들은 적응에 어려움을 겪었으며, 이는 그들의 '지능'이 취약하며 특정하고 인위적인 설정에 묶여 있음을 드러냈습니다.

이러한 현상이 왜 발생하는지 이해하기 위해, 연구진은 에이전트들이 메모리 뱅크에 작성하는 노트들을 면밀히 살펴보았습니다. 그들은 에이전트들이 세상에 대한 지침이 불완전하기 때문에 종종 잘못된 것을 배우고 있다는 사실을 발견했습니다. 예를 들어, 에이전트들은 표준 웹 브라우저 환경에서 작동하고 있어 코드를 실행할 수 없음에도 불구하고, 문제를 해결하기 위해 컴퓨터 코드나 API를 사용하라는 지침을 받는 경우가 있었습니다. 에이전트들은 이러한 불가능한 전략을 메모리에 기록했고, 이를 반복해서 사용하며 실패의 루프에 빠졌습니다. 마찬가지로, 작업이 모호할 때 에이전트들은 과도하게 깊이 생각하여 실패 원인에 대해 정교하지만 틀린 설명을 만들어냈고, 이를 미래의 관련 없는 문제에 적용하려고 했습니다. 심지어 한 에이전트는 지도 웹사이트가 로드되지 않자 이동 시간을 추정하기 위해 복잡한 수학 공식을 사용하기 시작했고, 이를 일시적인 현상임에도 불구하고 영구적인 전략으로 '학습'하기로 결정했습니다.

연구팀은 에이전트들에게 환경과 게임의 규칙에 대한 더 상세한 정보를 제공함으로써 이러한 문제를 해결하려고 시도했습니다. 그들은 작업이 실패한 이유에 대한 구체적인 피드백을 제공하고 실제로 가능한 동작이 무엇인지 명확히 했습니다. 이는 도움이 되었습니다. 이러한 세부 사항을 추가했을 때 에이전트들의 성능은 향상되었고, 무작위 작업 순서로 인한 성능 저하도 약 3분의 1 정도 줄어들었습니다. 그러나 상당한 격차는 여전히 남아 있었습니다. 더 명확한 규칙을 제공하더라도, 에이전트들은 가장 까다로운 무작위 조건에서는 여전히 어려움을 겪었습니다. 이는 명확한 규칙을 제공하는 것이 도움이 되기는 하지만, 이 시스템들이 왜 그렇게 취약한지에 대한 더 깊고 규명되지 않은 이유가 존재함을 시사합니다. 에이전트들은 여전히 '잘못된 교훈'을 배울 위험이 있으며, 이는 연쇄적인 실패로 이어질 수 있습니다.

이 연구는 이러한 시스템을 개발하고 테스트할 때 더 신중한 접근 방식이 필요하다는 결론을 내립니다. 연구진은 에이전트가 현실 세계에 준비되었는지 판단하기 위해 단 한 번의 실행 테스트나 깔끔하게 정렬된 작업 목록에 의존해서는 안 된다고 주장합니다. 대신, 우리는 무질서하고 예측 불가능한 조건 하에서 스트레스 테스트를 실시해야 하며, 여러 차례의 실행에 걸쳐 어떻게 수행되는지를 보고해야 합니다. 또한 그들은 인간의 감독이 필요함을 강조합니다. 에이전트는 불완전한 정보로부터 잘못된 전략을 배울 수 있기 때문에, 인간이 개입하여 잘못된 교훈을 찾아내고, 에이전트가 돌이킬 수 없는 피해를 입히기 전에 이를 바로잡을 수 있는 방법이 반드시 있어야 합니다. 앞으로 나아갈 길은 단순히 더 똑똑한 에이전트를 만드는 것이 아니라, 현실 세계의 불확실성을 견디며 무너지지 않을 만큼 견고한 시스템을 구축하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →