← 최신 논문
🤖 AI

Artificial Empathy: Towards a Framework for Unsupervised Agency Detection and Policy Reconstruction

이 논문은 독립적인 태스크에 대해 훈련된 강화 학습 에이전트를 사전 지식(prior)으로 활용하여, 오직 환경 관측만을 통해 다른 에이전트들을 비지도 방식으로 탐지하고 그들의 정책을 재구성할 수 있는 프레임워크를 제안한다.

원저자: Peter Kuhn, Chris Pang, Sonakshi Chauhan

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peter Kuhn, Chris Pang, Sonakshi Chauhan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 연구의 조용한 구석에서 한 가지 근본적인 질문이 지속되고 있다: 어떻게 기계가 세상의 다른 무언가가 목적을 가지고 행동하고 있다는 것을 이해할 수 있을 것인가? 컴퓨터가 인간이나 다른 기계와 협력하기 위해서는, 먼저 중력 때문에 떨어지는 돌과 그 돌을 의도를 가지고 향해 손을 뻗는 사람을 구분할 수 있어야 한다. '에이전시 탐지(agency detection)'라고 알려진 이 능력은 사회적 상호작용의 초석이다. 이것이 없다면 인공지능은 단지 혼란스러운 사건의 흐름만을 볼 뿐이며, 무작위적인 소음과 목표 지향적인 계획 사이의 차이를 구별하지 못한다. 기계가 그 다른 에이전트가 무엇을 하고 싶어 하는지를 파악해야 할 때, 즉 '정책 재구성(policy-policy reconstruction)'이라 불리는 과제에 직면하면 도전은 더욱 커진다. 만약 기계가 명시적인 학습 없이도 이러한 숨겨진 의도를 식별하고 모델링하는 법을 배울 수 있다면, 이는 자신의 목표를 주변 존재들의 목표와 일치시킬 수 있는 진정한 협력적 파트너가 되는 데 있어 거대한 발걸음을 내딛는 것이 될 것이다.

케임브리지의 휴먼 인덕티브 바이어스 프로젝트(Human Inductive Bias Project)의 연구팀은 "인공 공감(artificial empathy)"이라 부르는 시스템을 제안함으로써 이 퍼즐을 풀기 위한 중요한 진전을 이루었다. 그들은 처음부터 복잡한 마음 이론(theory of mind)을 구축하려고 시도하는 대신, 인공지능이 자신의 내부 메커니즘을 가이드로 삼아 타인을 이해할 수 있다고 제안한다. 핵심 아이디어는 스스로 결정을 내리고 세상에 작용하는 에이전트인 AI가 이미 에이전시(agency)가 어떤 모습인지에 대한 내장된 이해를 이미 갖추고 있다는 것이다. 연구진은 시스템이 자신의 학습된 행동 패턴을 바탕으로 미래를 예측하도록 훈련함으로써, 환경을 스캔하여 다른 에이전트를 포착하고, 인간의 라벨이나 지시 없이도 그 에이전트들이 무엇을 달성하려 하는지 파악할 수 있는 프레임워크를 만들었다.

연구진은 이 개념을 통제된 디지털 환경, 즉 에이전트가 보상을 얻기 위해 움직이는 단순한 그리드 월드(grid world)에서 테스트했다. 그들은 표준적인 AI 에이전트가 특정 작업(예: 점수를 얻기 위해 그리드의 왼쪽 하단 모서리에 도달하는 것)을 해결하도록 훈련시켰다. 이 훈련된 에이전트는 새로운 시스템이 이해해야 할 '전문가' 또는 '타자' 역할을 했다. 과제를 어렵고 현실적으로 만들기 위해, 연구진은 바람에 날리는 잎사귀처럼 무작위로 움직이는 두 번째 가짜 에이전트라는 혼란 요소를 도입했다. 새로운 시스템의 목표는 무작위 움직임을 무시하고 진짜 에이전트를 정확히 식별한 다음, 목표에 도달하기 위한 그 전문가의 특정 전략을 학습하는 것이었다. 시스템은 어떤 것이 진짜 에이전트인지 알려주지 않았으며, 스스로 찾아내야 했다.

이를 달성하기 위해, 새로운 시스템은 음식 아이템을 수집하는 것과 같이 완전히 무관한 작업에 대해 훈련된 다른 AI의 '두뇌'를 로드함으로써 출발점을 확보했다. 이 사전 로드된 지식은 에이전트가 일반적으로 어떻게 행동하고 그들의 행동이 세상을 어떻게 변화시키는지에 대한 일련의 기대치인 '사전 지식(prior)' 역할을 했다. 시스템은 그리드 월드의 사건 흐름을 관찰했다. 시스템은 자신의 내부 모델을 사용하여 다음과 같은 간단한 질문을 던졌다. "만약 내가 여기서 에이전트가 행동하고 있다고 가정한다면, 다음에 어떤 일이 일어날지 예측할 수 있는가?" 시스템이 무작위 보행자를 관찰했을 때, 그 움직임은 논리적인 목표 추구 패턴을 따르지 않았기에 예측은 실패했다. 그러나 전문가 에이전트를 관찰했을 때, 전문가의 움직임은 목표를 향해 가는 에이전트의 논리와 일치했기에 예측은 잘 작동했다. 예측과 현실 사이의 오차를 최소으로 줄임으로써, 시스템은 효과적으로 노이즈를 걸러내고 진정한 에이전트에 집중할 수 있었다.

실험 결과는 유망했다. 짧은 기간 동안 환경을 관찰한 후, 시스템은 무작위 미끼를 무시하고 전문가 에이전트의 전략을 성공적으로 채택하는 법을 배웠다. 일련의 시행착오를 거치며 시스템의 성능은 무작위 추측보다 빠르게 상승하여, 결국 원래 전문가의 숙련도와 일치했다. 이는 시스템이 실제로 비지도 에이전시 탐지(unsupervised agency detection)를 수행하여, 혼돈 속에서 목적 있는 행위자를 식별하고 그 정책을 재구성할 수 있음을 입증했다. 연구진은 이러한 성공이 시스템이 자신의 내부 역학을 세상을 바라보는 렌즈로 사용했기 때문이라고 언급하며, "나는 목표를 갖는다는 것이 어떤 느낌인지 알기에, 타인에게서도 그것을 인식할 수 있다"라고 효과적으로 말한 것이라고 설명했다.

이러한 고무적인 결과에도 불구하고, 연구진은 이를 완성된 솔루션이라기보다 초기 개념 증명으로 신중하게 규정하고 있다. 실험은 단 하나의 실제 에이전트와 하나의 가짜 에이전트만이 존재하는 작은 규모의 완전 가시적 그리드 월드에서 수행되었다. 시스템은 사전 에이전트와 대상 에이전트가 구조적으로 유사하다는 사실에 크게 의존했으며, 에이전트들이 크게 다르거나 환경이 복잡하고 부분적으로 가려져 있는 경우에 이 접근 방식이 얼마나 잘 작동할지는 아직 알려지지 않았다. 이 연구는 자기 참조적 사전 지식(self-referential priors)이 에이전시 탐지를 지원할 수 있음을 시사하지만, 아직 현실 세계에서 인공지능을 인간의 가치와 정렬하는 더 넓은 문제를 해결했다고 주장하지는 않는다. 이 연구는 AI가 자신을 먼저 이해함으로써 타인을 배려하는 법을 배울 수 있다는 문을 열었지만, 완전히 협력적인 미래를 향한 여정은 여전히 길고 검증되지 않은 상태로 남아 있다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →