← 최신 논문
🤖 AI

Unpredictability dissociates from structured control in language agents

본 논문은 언어 에이전트에서 확률적 예측 불가능성이 이유, 기억, 자기 상태를 행동 선택과 연결하는 구조적 제어 메커니즘을 대체할 수 없음을 입증하며, 이는 이러한 구조적 구성 요소에 대한 표적 병변이 일관되게 성능을 저하시키는 반면 고확률성 변형은 광범위한 벤치마크에 걸쳐 구조적 행동-장 연결을 재현하지 못하기 때문이다.

원저자: Jia Xiao

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jia Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

큰 질문: "혼돈"과 "통제"는 같은 것일까?

인형극을 보고 있다고 상상해 보세요.

  • 시나리오 A: 인형극 배우는 명확한 계획으로 실을 당깁니다. 인형은 특정 이유 (줄거리의 기억, 멈추기로 한 결정, 따를 규칙) 로 움직입니다.
  • 시나리오 B: 인형은 돌풍에 휩쓸려서 이리저리 날아다닙니다. 그것은 격렬하고 예측 불가능하게 움직이지만, 계획도, 기억도, 다음에 어디로 갈지에 대한 이유도 없습니다.

오랫동안 사람들은 컴퓨터 프로그램 (AI 에이전트) 이 격렬하고 예측 불가능하게 행동한다면, 그것은 스스로 "생각"하거나 "통제"하고 있다고 가정했습니다. 이 논문은 다음과 같이 묻습니다: 그것이 사실일까요?

연구자들은 아니다라고 말합니다. AI 가 예측 불가능하다 (바람에 날리는 인형처럼) 고 해서 구조화된 통제를 가지고 있다는 (인형극 배우처럼) 뜻은 아닙니다. 사실, 진정한 통제는 기억, 추론, 그리고 "거부" (억제) 할 수 있는 능력과 같은 특정 내부 "기관"을 필요로 합니다.

실험: "병변" 실험실

이를 증명하기 위해 연구자들은 "제어판"을 가진 인간처럼 행동하는 특수 AI 에이전트를 구축했습니다. 그들은 마치 뇌의 일부를 제거하여 어떤 일이 일어나는지 확인하는 외과 의사의 "병변" 연구처럼, 에이전트 뇌의 특정 부분을 켜거나 끌 수 있었습니다.

그들은 에이전트의 두 가지 주요 버전을 가졌습니다:

  1. "구조화된" 에이전트: 이 에이전트는 모든 도구가 켜져 있었습니다. 무언가를 선택한 이유를 설명하는 이유 (Reason) 모듈, 과거 사건을 기억하는 기억 (Memory) 모듈, 목표를 추적하는 자기 상태 (Self-State) 모듈, 그리고 나쁜 선택을 막는 거부 (Veto) 모듈을 갖추고 있었습니다.
  2. "혼돈" 에이전트: 이 에이전트는 이유, 기억, 자기, 거부 모듈이 꺼져 있었습니다. 대신, 예측 불가능하게 격렬하게 추측하도록 "온도" (무작위성) 를 높였습니다.

비유:
구조화된 에이전트는 요리를 하다가 소금을 넣거나 요리를 멈추기로 결정하며 레시피를 따르는 요리사라고 생각하세요.
혼돈 에이전트는 최대 속도로 돌아가는 믹서기라고 생각하세요. 그것은 재료를 여기저기 흩뿌립니다 (예측 불가능하지만), 아무것도 "요리"하는 것이 아닙니다. 단지 혼란을 일으킬 뿐입니다.

그들이 발견한 것

연구자들은 이 에이전트들을 7 가지 다른 유형의 작업 (이야기하기, 선택하기, 사실 기억하기 등) 에 투입하고 74,000 건 이상의 상호작용을 확인했습니다. 다음과 같은 일이 발생했습니다:

1. 혼돈은 통제가 아니다
"혼돈" 에이전트는 실제로 훨씬 더 예측하기 어려웠습니다. 그것은 더 많이 뛰어다녔습니다. 그러나 통제된 에이전트처럼 행동하지는 못했습니다. 목표를 기억하지 못했고, 새로운 이유에 따라 마음을 바꾸지 못했으며, 실수를 막을 수도 없었습니다.

  • 결과: 예측 불가능하다는 것이 에이전트를 더 똑똑하게 만들거나 더 통제하게 만들지 않았습니다. 단지 무작위적으로 만들었을 뿐입니다.

2. "사후 (Post-Hoc)" 트릭
어떤 사람들은 "아마도 혼돈 에이전트가 스스로를 통제하고 있는 것일지도 모른다. 단지 선택을 한 후에 이유를 적을 뿐이다"라고 주장할 수 있습니다.
이를 테스트하기 위해 연구자들은 혼돈 에이전트가 행동한 후에 이유, 기억, 거부 결정을 적도록 강요하여 마치 통제하는 것처럼 보이게 했습니다.

  • 결과: 행동한 이유에 대한 이야기를 쓰도록 강요받았을지라도, 혼돈 에이전트의 행동은 그 이야기와 실제로 일치하지 않았습니다. "이유"는 실제 행동의 원인이 아니라 장식품에 불과했습니다.

3. "유한 행동" 테스트
완벽하게 확실히 하기 위해, 그들은 모든 화려한 텍스트를 제거하고 최종 결정 (예: "옵션 A 선택" 또는 "중지") 만을 살펴보았습니다. 그들은 에이전트들에게 비밀 테스트를 주었습니다: "내가 이유를 바꾸면 너도 선택을 바꿔야 한다. 가짜 이유를 주면 무시해야 한다."

  • 결과: 구조화된 에이전트는 통과했습니다. 이유가 바뀌면 선택을 바꾸고 가짜 이유는 무시했습니다. 혼돈 에이전트는 처참하게 실패했습니다. 그것은 논리나 기억의 규칙을 따를 수 없었습니다.

"눈가리개" 확인

편견이 없었는지 확인하기 위해 세 명의 인간 전문가가 어떤 에이전트가 어떤 것인지 모른 채 1,200 개의 예를 살펴보았습니다. 그들은 구조화된 에이전트만이 실제로 "통제"하고 있다는 데 거의 완벽하게 동의했습니다 (96% 일치).

한계 (논문이 말하지 않은 것)

이 논문은 주장하는 내용에 대해 매우 신중합니다. 다음과 같은 것은 아닙니다:

  • AI 는 결코 통제될 수 없다는 것.
  • 무작위성이 쓸모없다는 것.
  • 이것이 세상의 모든 AI 에 적용된다는 것.

대신, 다음과 같이 말합니다: 구축한 특정 유형의 AI 에이전트에서, 단순히 AI 를 더 무작위적 (확률적) 으로 만드는 것이 진정한 구조화된 통제를 만들어내지는 못했습니다. "합리적 결정"을 대신하기 위해 "무작위 추측"을 사용할 수는 없습니다.

결론

AI 가 진정으로 통제될 수 있도록 하려면—기억하고, 추론하고, 스스로를 멈출 수 있도록 하려면—그 특정 부분들을 구축해야 합니다. 단순히 "무작위성 조절기"를 높여서 똑똑해지는 방법을 알아내기를 기대할 수는 없습니다. 예측 불가능성은 지능과 같지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →