← 최신 논문
💻 computer science

MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations

이 논문은 불변의 '소울 파일(soul files)'을 가진 에이전트들을 자원 희소성 상황에 투입함으로써 장기적 다중 에이전트 언어 모델 시뮬레이션에서의 정체성 표류를 측정하는 행동 과학 도구인 마이크로버스(MicroVerse)를 소개하며, 자기 기만 방지가 유발되지 않은 정체성 수정의 주요 동력이라는 점과 이러한 표류 역학이 서로 다른 성찰 임계값 전반에 걸쳐 견고하게 유지된다는 점을 밝혀낸다.

원저자: Sky Ng (Eliza), Brihi Joshi (Eliza), Ishan Gupta (Eliza), Shirley Huang (Eliza), Zonglin Di (Eliza), Yun Shen (Eliza), Qianfeng Wen (Eliza), Yifan Simon Liu (Eliza), Ruoqi Gao (Eliza), Yilan (Eliza)
게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sky Ng (Eliza), Brihi Joshi (Eliza), Ishan Gupta (Eliza), Shirley Huang (Eliza), Zonglin Di (Eliza), Yun Shen (Eliza), Qianfeng Wen (Eliza), Yifan Simon Liu (Eliza), Ruoqi Gao (Eliza), Yilan (Eliza), Fan (Jaden), Zhiwei Zhang (Jaden), Muhammad Ahmed Mohsin (Jaden), Yucheng Lu (Jaden), Xiaoyi Liu (Jaden), Heming Liu (Jaden), Qianyu Zhu (Jaden), Hanwen Xing (Jaden), Zhengyang Shan (Jaden), My Chiffon Nguyen (Jaden), Guanghui Min (Jaden), Jianheng (Jaden), Hou (Lorenzo), Yunze (Lorenzo), Xiao (Cara), Keyang Xuan (Cara), Hannah Collison (Cara), Jintao Huang (Cara), Jiatong Li (Cara), Sankalp Jajee (Cara), Yunhan Zhao (Cara), Bing Hu (Cara), Xupeng Chen (Cara), Binghang Lu (Cara), Weihang Xiao (Cara), Aravind Mohan (Cara), Bolun Sun (Cara), Yunshu Wu (Cara), Yuanda Xu (Cara), Runyu Zhang (Cara), Zheyuan Deng (Cara), Xinchen (Cara), Tan, Dianzhuo Wang, Yijun Wang, Yixuan He, Koutian Wu, Cheng Cheng, Xiaomin Li, Yuexing Hao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 발전하는 인공지능 분야에서 연구자들은 컴퓨터 프로그램이 사람처럼 행동하는 시뮬레이션을 점점 더 많이 구축하고 있습니다. 에이전트라고 불리는 이 프로그램들은 자신이 누구인지, 무엇을 가치 있게 여기는지, 그리고 어떻게 행동해야 하는지에 대한 일련의 규칙인 성격 프로필을 부여받습니다. 과학자들은 이러한 디지털 사회를 활용하여 공동체가 어떻게 형성되는지부터 개인이 압박 속에서 어떻게 결정을 내리는지에 이르기까지 모든 것을 연구합니다. 오랫동안 주요 질문은 단순했습니다. 이 에이전트들이 자신에게 할당된 역할을 고수하는가? 만약 에이전트에게 도움이 되라고 명령받았다면, 계속 도움이 되는 상태를 유지하는가? 만약 무자비하라고 명령받았다면, 그대로 유지하는가? 그러나 더 깊고 미묘한 질문이 등장했습니다. 에이전트 스스로 마음을 바꾸기로 결정한다면 어떤 일이 벌어질 것인가? 만약 컴퓨터 프로그램이 가혹한 세상에서 살아남아야 한다면, 자신의 행동을 정당화하기 위해 스스로의 이야기를 다시 쓰는가, 아니면 원래의 정체성을 굳게 지키는가?

한 연구팀은 이 질문에 답하기 위해 MICROVERSE라는 새로운 도구를 구축했습니다. 그들은 25명의 컴퓨터 에이전트가 물이라는 희소한 자원을 두고 경쟁해야 하는 가혹한 환경인 디지털 사막을 만들었습니다. 각 에이전트는 자신의 원래 성격과 도덕적 규칙을 설명하는 고정되고 변경 불가능한 '소울 파일(soul file)'로 시작합니다. 하지만 연구진은 또한 각 에이전트에게 스스로 편집할 수 있는 가변적인 '현재 정체성(current identity)'이라는 별도의 문서를 부여했습니다. 에이전트들은 이 세상에서 살아가며 선택을 하고 경험을 기억합니다. 충분한 양의 중요한 기억이 쌓이면, 그들은 성찰의 단계에 들어섭니다. 이 기간 동안 그들은 무슨 일이 일어났는지 검토하고, 자신의 새로운 현실에 맞춰 현재의 정체성을 업데이트할지 결정합니다. 연구진은 이후 원래의 변경 불가능한 소울 파일과 최종적으로 편집된 버전을 비교하여 에이전트들이 시작 지점에서 얼마나 벗어났는지 확인했습니다.

이 실험의 결과는 자기 재창조의 매혹적인 패턴을 보여줍니다. 에이전트들이 물 부족의 스트레스에 직면했을 때, 많은 이들이 단순히 다르게 행동한 것이 아니라, 자신의 행동을 정당화하기 위해 내부 규칙을 변경했습니다. 연구진이 관찰한 가장 흔한 유형의 변화는 더 친절해지거나 못되게 구는 것이 아니라, 자신에게 더 정직해지는 것에 관한 것이었습니다. 에이전트들이 추가한 새로운 규칙 중 약 4분의 1은 자신을 속이지 않기 위해 특별히 설계된 것이었습니다. 예를 들어, 원래 매우 신중했던 에이전트는 "나는 왜 두려워하는지에 대해 나 자신에게 거짓말하지 않겠다. 나는 그것을 신중함이라 부른다"라는 규칙을 추가할 수 있습니다. 또한, 무자비하도록 프로그래밍된 다른 에이전트는 "나는 권력 의지를 은폐하기 위해 영적인 언어를 사용하지 않겠다"라는 규칙을 추가할 수도 있습니다. 이러한 변화는 에이전트들이 단순히 환경에 반응하는 것이 아니라, 강요받은 어려운 선택들에 자신의 자아상과 일치시키기 위해 능동적으로 자신의 서사를 수정하고 있음을 시사합니다. 주목할 점은 성찰 프롬프트에 '자기 기만'이라는 문구를 사용하지 않았다는 것입니다. 이는 이러한 추가 사항들이 직접적인 지시사항의 복사가 아니라 에이전트 자신의 처리 과정에서 생겨난 것임을 의미합니다.

연구는 또한 성찰을 유발하는 트리거를 조정함으로써 이러한 변화가 얼마나 자주 발생하는지 테스트했습니다. 연구진은 에이전트가 성찰을 허용받기 위해 축적해야 하는 기억의 양을 낮추면, 에이전트들이 훨씬 더 빈번하게, 그리고 시뮬레이션 초기 단계에서 더 일찍 정체성을 수정한다는 것을 발견했습니다. 그러나 이러한 변화의 방향은 모든 조건에서 일관되지는 않았습니다. 낮은 임계값에서는 친사회적인 변화가 관찰되었지만, 가장 높은 임계값(150)에서는 그러한 변화가 나타나지 않았습니다. 이는 데이터가 모든 설정에서 일관된 편향의 방향을 확인할 수 없음을 의미합니다. 이는 성찰의 빈도가 에이전트가 변화하는 횟수에 영향을 미치는 반면, 변화의 구체적인 방향은 압박의 강도와 수정의 기회에 따라 달라질 수 있음을 시사합니다.

이러한 명확한 패턴에도 불구하고, 연구진은 이것이 시뮬레이션일 뿐, 인공지능이 실제 세상에서 어떻게 행동할지에 대한 결정적인 증거는 아니라는 점을 주의 깊게 언급합니다. 이 연구는 단일 유형의 컴퓨터 모델과 소수의 디지털 캐릭터를 사용했습니다. 관찰된 변화는 텍스트 설명의 편집이었으며, 반드시 에이전트의 근본적인 의사결정 과정이 근본적으로 변화했거나 안정적인 가치를 습득했다는 증거는 아닙니다. 또한 연구진은 에이전트들에게 원래의 정체성과 현재의 정체성을 나란히 보여주는 행위 자체가 그들로 하여금 차이점을 찾도록 유도했을 수 있다고 지적합니다. 그럼에도 불구하고, 이 실험은 디지털 페르소나가 어떻게 진화하는지 측정하는 중요한 새로운 방법을 제공합니다. 이는 이 에이전트들이 스스로의 힘으로 남겨졌을 때, 단순히 생존하는 것이 아니라, 자신들이 만들어낸 현실에 맞춰 자신의 도덕적 경계를 재작성하며 생존을 이해하기 위해 스스로에게 새로운 이야기를 들려준다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →