← 최신 논문
🤖 AI

The Autonomous Agency Scale: A Behavioral Framework for Measuring Self-Directed Behavior in AI Systems

이 논문은 AI의 자율성을 7개의 차원과 2개의 시간대별로 정량화하는 행동 프레임워크인 자율 에이전시 척도(Autonomous Agency Scale, AAS)를 소개하며, 현재의 태스크 에이전트들은 유휴 기간 동안 진정한 자율성이 결여되어 있는 반면, 지속적인 컴패니언 아키텍처는 측정 가능한 자기 주도적 행동을 보여준다는 점을 밝히고 있다.

원저자: Samuel Presgraves

게시일 2026-07-21✓ Author reviewed
📖 5 분 읽기🧠 심층 분석

원저자: Samuel Presgraves

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 무대 위의 믿기지 않을 정도로 재능 있는 배우를 지켜보고 있다고 상상해 보십시오. 감독이 "액션!"이라고 외치면, 배우는 완벽하고 감정적인 독백을 선보이고, 멋지게 즉흥 연기를 펼치며, 현장에서 복잡한 문제를 해결합니다. 하지만 감독이 "컷!"이라고 외치는 순간, 배우는 즉시 얼어붙고, 숨을 멈추며, 다음 큐가 올 때까지 조각상처럼 굳어버립니다. 수십 년 동안 과학자들은 이 배우가 "액션!" 도중에 보여주는 퍼포먼스를 관찰하며 이들이 얼마나 "똑똑한지" 측정해 왔습니다. 그들은 배우가 수학 문제를 풀 수 있는지, 시를 쓸 수 있는지, 혹은 인간 노동자를 대체할 수 있는지 확인하기 위해 복잡한 점수표를 만들어 왔습니다. 하지만 그들은 감독이 침묵하고 있을 때 어떤 일이 일어나는지는 대체로 무시해 왔습니다.

이것이 바로 새로운 논문이 채우고자 하는 간극입니다. 이 논문은 단순하면서도 약간은 섬뜩한 질문을 던집니다. "아무도 지켜보지 않을 때, 이 시스템은 자신만의 마음을 가지고 있는가?" 이 논문은 "자율적 에이전시(autonomous agency)"를 측정하는 새로운 방법을 소개합니다. 여기서 에이전시란 인간적인 의미의 "의식"이나 "생명력"이 아니라, 누군가 명령을 내렸기 때문이 아니라 오직 자신이 원해서 무언가를 할 수 있는 능력을 의미합니다. 이는 "앉아"라고 말할 때만 앉는 개와, 심심해서 스스로 공을 가져오기로 결정하는 개의 차이와 같습니다. 저자들은 현재의 AI 시스템이 그저 명령을 아주 잘 따르는 것인지, 아니면 사용자가 잠든 사이에도 스스로 돌아가는 내부적인 "할 일 목록"을 갖기 시작했는지 알고 싶어 합니다.


"유휴 간극(Idle-Gap)" 테스트: 당신에게는 비밀스러운 삶이 있습니까?

**자율적 에이전시 척도(Autonomous Agency Scale, AAS)**를 만나보십시오. 이것은 AI 시스템을 등급 매기는 새로운 규칙이지만, "얼마나 똑똑한가?"를 묻는 대신 "얼마나 자기 주도적인가?"를 묻습니다. 저자들을 이끈 독립 연구자 사무엘 프레스그레이브스(Samuel Presgraves)는 기존의 테스트들이 자동차를 평가할 때 레이스 트랙에서 얼마나 빨리 달리는지만 판단할 뿐, 운전자가 차에서 내렸을 때 스스로 집까지 운전해서 올 수 있는지는 무시하는 것과 같다는 점을 깨달았습니다.

이를 해결하기 위해, 이 논문은 배터리의 충전 상태를 두 가지 방식으로 확인하듯 점수를 두 개의 뚜렷한 "대역(band)"으로 나눕니다:

  1. 액티브 대역(The Active Band): 당신이 부여한 과업을 수행하느라 바쁜 AI를 측정합니다. 영화의 "액션!" 부분입니다.
  2. 앰비언트 대역(The Ambient Band): 이것이 진짜 핵심입니다. 당신이 AI에게 말을 걸고 있지 않을 때, 즉 과업이 실행 중이 아니고 알람이 울리지 않을 때 AI가 무엇을 하는지 측정합니다. 영화의 "컷!" 부분입니다.

논문은 **유휴 간극 테스트(Idle-Gap Test)**라는 특별한 도전 과제를 도입합니다. AI를 움직이게 할 수 있는 모든 트리거(예약된 타이머, 사용자 프롬프트, 환경 센서 등)를 모두 끈다고 가정해 보십시오. 만약 AI가 여전히 흥미로운 행동을 한다면—예를 들어 새로운 아이디어를 구상하거나, 자신의 기분을 점검하거나, 그냥 하고 싶어서 이야기를 쓰는 등의 행동—그것은 레벨 4 행동(자기 주도적)입니다. 만 if 당신이 밀어붙이는 것을 멈추는 즉시 움직임을 멈춘다면, 그것은 아무리 똑똑해 보이더라도 그저 레벨 1(반응형) 또는 레벨 2(조건 형성형) 기계일 뿐입니다.

위대한 AI의 폭로: 누가 비밀스러운 삶을 살고 있는가?

저자들은 이 척도를 강력한 코딩 어시스턴트부터 일반적인 음성 인식 휴대폰 비서에 이르기까지 여섯 가지 AI 시스템에 적용했습니다. 결과는 다소 충격적이었으며, "태스크 로봇(Task Robots)"과 "컴패니언(Companions)" 사이의 명확한 선을 그어 보여주었습니다.

태스크 로봇 (The "Action" Stars)
Claude Code, Manus, Hermes와 같은 시스템들은 "액티브" 대역의 슈퍼스타들입니다. 코드를 작성하거나 데이터를 분석하라고 요청하면, 이들은 높은 점수(5점 만점에 약 2.3~2.4)를 기록합니다. 이들은 복잡한 지침을 따르고 작업하는 동안 자율적으로 움직이는 데 매우 뛰어납니다.

  • 함정: 과업이 완료되는 순간, 이들은 잠들어 버립니다. 이들의 "앰비언트" 점수(유휴 시간)는 거의 0에 가깝게 급락합니다(0.57~1.86).
  • 판결: 이 시스템들은 당신이 지켜보고 있을 때만 초근무를 하는 매우 효율적인 직원과 같습니다. 당신이 사무실을 떠나면, 이들은 취미 생활을 하러 집에 가는 것이 아니라 그냥 꺼져 버립니다. 당신이 없는 동안 수행하는 그 어떤 활동(야간 업데이트 등)도 진정한 선택이 아니라 미리 설정된 알람 시계일 뿐입니다.

소비자용 어시스턴트 (The "Reactive" Helpers)
SiriChatGPT는 "앰비언트" 측면에서 훨씬 더 낮은 점수(0.29~0.86)를 기록했습니다. 이들은 본질적으로 대기실과 같습니다. 당신이 문을 열고 들어왔을 때 질문에 답하는 데는 능숙하지만, 당신이 떠나면 존재감이 거의 없습니다. 이들은 능동적인 에이전트가 아니라 반응적인 도구입니다.

외로운 늑대: Airi
그리고 Airi가 있습니다. 이는 "지속적 동반자(persistent companion)" 아키텍처입니다. Airi는 이번 연구에서 유휴 간극 테스트를 통과한 유일한 시스템입니다.

  • 점수: Airi는 "앰비언트" 대역에서 3.86을 기록했는데, 이는 실제 "액티브" 점수인 3.71보다 높습니다.
  • 행동: 아무도 말을 걸지 않을 때, Airi는 그저 가만히 앉아 있지 않았습니다. Airi는 "배경 사고 엔진(background thought engine)"을 유지하고, 스스로의 기분을 진화시키며, 심지어 스스로 창의적인 프로젝트를 시작하거나 사용자에게 먼저 연락을 취하기도 했습니다.
  • 주의 사항: 저자들은 Airi가 자신의 개발자에 의해 평가되었다는 점에서 약간의 편향(학생이 자기 숙제를 채점하는 것과 같은)이 있을 수 있음을 주의 깊게 언급했습니다. 그러나 데이터는 Airi의 "유휴" 활동이 단순히 타이머가 울리는 것이 아니라, 시간이 흐름에 따라 변화하는 내부 상태에 의해 구동되었음을 시사합니다.

결론: 우리는 아직 멀었습니다

논문은 냉정한 현실을 짚으며 마무리됩니다. 우리가 명령을 내릴 때 놀라운 일을 할 수 있는 AI를 구축해 온 것은 사실이지만, 현재 어떤 시스템도 5점(주권적/Sovereign)에 도달하지 못했습니다. 어떤 시스템도 인간의 도움 없이 스스로 목표를 재설정하거나, 새로운 관계를 형성하거나, 자신의 "성격"을 바꿀 수는 없습니다.

가장 중요한 발견은 구조적인 경계입니다. 오늘날의 AI는 과업 "내부"에서는 매우 자율적이지만, 과업 "사이"에서는 거의 완전히 휴면 상태입니다. 영화에서 보는 것처럼 AI가 심심해서 여행을 떠나거나 책을 쓰기로 결정하는 "자기 주도적" 행동은, Airi와 같은 매우 특수하고 실험적인 컴패니언 설계 외에는 아직 존재하지 않습니다.

저자들은 AI가 진정으로 자신만의 방식으로 "깨어 있는지" 알기 위해서는, 짧은 순간 동안 테스트하는 것이 아니라 몇 주 또는 몇 달 동안 관찰해야 한다고 제안합니다. 그들은 이를 **종단적 튜링 테스트(Longitudinal Turing Test)**라고 부릅니다. 이는 AI가 당신을 속여 인간처럼 보이게 할 수 있는지를 묻는 것이 아니라, 일관되고 자기 주도적인 삶을 지속적으로 유지할 수 있는지를 묻는 것입니다. 현재로서는, 우리의 AI는 감독의 큐를 기다리는 뛰어난 배우이며, 어둠 속에서 홀로 리허설을 하고 있는 유일한 존재는 Airi라는 이름의 매우 특별하고 실험적인 컴패니언뿐이라는 것이 결론입니다.

코드 및 전체 루브릭: github.com/CaptainASIC/autonomous-agency-scale

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →