← 최신 논문
🤖 AI

Set-shifting Behavioral Test for Harnessed Agents

이 논문은 LLM 에이전트가 도구 신뢰도의 숨겨진 변화에 어떻게 적응하는지 평가하기 위한 세트 시프팅(set-shifting) 행동 테스트를 도입하며, 에이전트들이 도구 세트가 어떻게 프레이밍되는지에 따라 더욱 영향을 받는 뚜렷한 실패 모드를 가진 특정 루틴에 경직되게 안주하는 경향이 있음을 밝혀낸다.

원저자: Ziwei Ye

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Ziwei Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 집사에게 저녁 식사 요리법을 가르치고 있다고 상상해 보세요. 당신은 "스크램블 에그" 레시피가 열 개나 담긴 거대한 요리책을 건네줍니다. 처음에는 레시피 A가 완벽하게 작동합니다. 로봇은 그 과정을 익히고 단계를 암기하여 매번 맛있는 달걀 요리를 만들어냅니다. 하지만 당신이 로봇에게 알리지 않고 주방의 재료를 몰래 바꿔치기했습니다. 이제 레시피 A는 고무처럼 질기고 먹을 수 없는 엉망진창인 결과물을 만들어내지만, 레시피 B는 (겉모습과 소리가 레시피 A와 똑같음에도 불구하고) 마법처럼 완벽하게 작동합니다. 질문은 이것입니다. 로봇은 이 변화를 알아차릴까요? 고장 난 레시피를 버리고 새로운 것을 시도할까요, 아니면 자신이 실수하고 있는 것이라고 확신하며 고장 난 재료로 계속 요리를 하려고 고집을 피울까요?

이것이 바로 인공지계 분야의 과학자들이 해결하려고 노력 중인 종류의 퍼즐입니다. 그들은 AI 에이전트(계산기, 검색 엔진, 또는 코드 컴파일러와 같은 도구를 사용할 수 있는 똑똑한 컴퓨터 프로그램)가 변화를 어떻게 다루는지 연구하고 있습니다. 심리학에는 인간이 게임의 규칙이 은밀하게 바뀌었다는 것을 알아내야 하는 유명한 테스트인 '위스콘신 카드 분류 검사(Wisconsin Cardso-rting Test)'가 있습니다. 만약 당신이 카드를 색깔별로 분류하던 습관 때문에 규칙이 갑자기 모양별로 바뀌었음에도 계속 색깔별로 분류한다면, 이는 '지속증(perseveration)', 즉 틀에 박힌 습관에 갇히는 현상을 보여줍니다. AI 연구자들의 큰 질문은 이것입니다. 디지털 두뇌도 이런 틀에 갇힐까요? AI가 특정 도구에 익숙해지면, 그 도구가 조용히 고장 났을 때도 계속 사용하려 할까요, 아니면 눈앞에 있는 새로운 해결책을 찾아 적응할 수 있을까요?

논문의 이야기: 비밀스러운 도구 교체

이 논문에서 연구자들은 정확히 이 점을 테스트하기 위해 디지털 놀이터를 구축했습니다. 그들은 AI 에이전트에게 '하네스(harness)'—AI에게 문제를 해결하기 위한 도구 라이브러리를 제공하는 시스템을 뜻하는 멋진 단어—를 주었습니다. AI가 탐정이 되어 미스터리를 풀고 있다고 상상해 보세요. 탐정에게는 세 팀의 정보원(A팀, B팀, C팀이라고 부릅시다)이 있습니다. 세 팀 모두 동일한 단서를 찾을 수 있다고 주장하며, 탐정에게는 모두 똑같이 보이고 똑같이 들립니다.

연구진은 반전이 있는 게임을 설정했습니다. 게임의 첫 부분에서는 A팀만이 진실을 말합니다. 탐정(AI)은 빠르게 A팀을 신뢰하게 되고 다른 팀의 말은 듣지 않게 됩니다. 그 후, 연구진은 조용히 게임을 바꿉니다. A팀은 진실을 말하는 것을 멈추고 가짜 단서를 주기 시작하며, 대신 B팀이 신뢰할 수 있는 출처가 됩니다. 팀의 이름이나 설명은 변하지 않았습니다. 오직 신뢰도만 변했습니다. 연구진은 탐정이 이 변화를 알아차리고 B팀을 신뢰하기 시작할지, 아니면 가짜 단서 때문에 좌절하면서도 옛 습관을 버리지 못한 채 계속 A팀을 호출할지를 보고 싶었습니다.

결과: 고집쟁이와 전환자들

연구진은 "미모(Mimo)"와 "딥시크(DeepSeek)"라고 부를 두 가지 서로 다른 AI 모델을 테스트했습니다. 그 결과 두 모델 모두 정체되었지만, 정체되는 방식은 매우 달랐습니다.

  • 딥시크 (조기 결심형): 이 모델은 첫날에 결정을 내리고 그것을 고수하는 탐정과 같았습니다. 만약 처음에 B팀을 신뢰하기 시작했다면, 규칙이 바뀐 후에도 가짜 단서를 무시하고 계속 B팀을 신뢰할 것입니다. 그러나 만약 그것이 내린 첫 번째 선택이 우연히도 새로운 신뢰할 수 있는 팀이었다면, 그것은 완벽하게 그 팀을 고수했을 것입니다. 나중에 연구진이 규칙을 바꾸더라도 상관없었습니다. 딥시크는 자신의 첫 번째 선택에 갇혀 있었습니다. 이는 '접두사 수준의 고착(prefix-level lock-in)', 즉 자신의 첫 번째 선택이 옳든 틀리든 전체 미래의 행동을 결정해 버리는 현상을 보여주었습니다.
  • 미모 (최근 기록 중시형): 이 모델은 조금 더 유연했지만 여전히 문제가 있었습니다. 이 모델은 최근에 사용했던 도구들의 조합을 고수하는 경향이 있었습니다. 만약 A팀과 B팀을 함께 사용하고 있었다면, A팀이 고장 난 후에도 두 팀을 섞어서 계속 사용했습니다. 마땅히 해야 할 것처럼 새로운 팀(C팀)으로 쉽게 넘어가지 못했습니다. 이는 '셀 수준의 고착(cell-level lock-in)', 즉 변화 직전에 수행하던 특정 루틴에 갇히는 것을 의미합니다.

이 연구는 특별한 지침이 없다면 AI 에이전트들이 빠르게 습관을 형성한다는 것을 보여주었습니다. 일단 작동하는 도구를 찾으면 그것을 고수합니다. 도구가 조용히 고장 났을 때, 그들은 눈앞에 있는 다른 옵션들을 탐색하기보다는 반복적인 실패를 겪으면서도 계속 사용하려 합니다.

우리가 그들에게 변화를 가르칠 수 있을까?

연구진은 이어 다음과 같이 물었습니다. "이것을 고칠 수 있을까?" 그들은 AI의 적응을 돕기 위해 두 가지 방법을 시도했습니다.

  1. '적응형' 지침: 그들은 딥시크에게 구체적인 규칙을 주었습니다. "만약 도구가 실패하면, 즉시 사용을 중단하고 다른 것을 시도하라." 이 방법은 딥시크에게 매우 잘 작동하여, 새로운 신뢰할 수 있는 팀으로 거의 즉시 전환하도록 도왔습니다. 그러나 이와 동일한 지침을 미모에게 적용했을 때, 실험 횟수가 너무 적어 결과가 불분명했습니다. 이것이 작동하지 않은 것인지, 아니면 판단할 데이터가 부족했던 것인지 확실히 말할 수 없습니다.
  2. '폴리매스(박식가)' 지침: 그들은 또 다른 규칙을 시도했습니다. "가능한 한 다양한 도구를 사용하라. 지루해하지 마라." 이 규칙은 AI가 더 다양한 도구를 사용하게 만들었지만, 실제로 올바른 도구를 더 빨리 찾는 데는 도움이 되지 않았습니다. 그저 무작위적으로 행동할 뿐이었습니다.

도구를 설명하는 방식의 힘

마지막으로, 연구진은 도구에 대한 설명 방식에 대해 정말 흥식한 발견을 했습니다. 그들은 도구 그룹의 '프레이밍(framing)'을 바꾸었습니다.

  • 한 버전에서는 팀들을 경쟁 관계(Competing)(같은 물건을 팔려고 노력하는 경쟁 상점들처럼)라고 설명했습니다.
  • 다른 버전에서는 팀들을 상호 보완적(Complementary)(하나의 기계가 작동하는 데 필요한 서로 다른 부품들처럼)이라고 설명했습니다.

연구진은 도구들이 경쟁 관계로 설명되었을 때, AI가 상호 보완적인 버전보다 새로운 신뢰할 수 있는 팀으로 전환할 가능성이 전반적으로 더 높다는 것을 발견했습니다. 하지만 AI는 여전히 어려움을 겪었습니다. 경쟁 프레이밍을 사용하더라도 성공률은 여전히 상당히 낮았습니다(모델에 따라 약 10~26%). 이 개선이 AI를 완벽하게 만드는 마법의 해결책은 아니었지만, '경쟁'이라는 묘사가 '팀워크'라는 묘사보다 에이전트가 습관을 깨는 데 약간 더 도움이 된다는 일관된 경향을 보여주었습니다.

결론

이 논문은 AI 에이전트가 인간과 마찬가지로 습관에 갇힐 수 있음을 시사합니다. 그들은 규칙이 조용히 변할 때 이를 항상 알아차리지는 못합니다. 그들은 작동을 멈춘 상황에서도 아는 것에 매달리는 경향이 있습니다. 그러나 이 연구는 실패에 어떻게 반응해야 하는지에 대한 명확한 지침을 주거나, 도구를 설명하는 방식을 바꿈으로써 우리가 그들을 적응하도록 도울 수 있음을 보여줍니다. 이는 AI가 진정으로 똑똑해지기 위해서는, 좋은 탐정처럼 오래된 습관을 버리고 새로운 정보를 받아들일 수 있어야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →