← 최신 논문
💻 computer science

Why collective AI assurance cannot target agents or networks in isolation

이 논문은 요인 실험을 통해 집단적 AI 결과가 구조적 원인과 행동적 원인이 분리 가능하고 맥락 의존적인 특정 상호작용 체제에서 발생함을 입증하며, 효과적인 AI 보증은 에이전트나 네트워크를 개별적으로 대상으로 삼는 것이 아니라 그들의 상호작용이 갖는 역동적인 인과 구조에 집중해야 함을 증명한다.

원저자: Andreas HOLZINGER, Markus Plass, Heimo Müller

게시일 2026-09-03
📖 5 분 읽기🧠 심층 분석

원저자: Andreas HOLZINGER, Markus Plass, Heimo Müller

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 단일 기계만을 관찰해서는 볼 수 없는 새로운 종류의 위험이 등장했습니다. 수십 개의 자동화된 보조 도구들이 환자의 일정을 조정하고, 응급 상황을 분류하며, 진료 의뢰를 관리하는 병원을 상상해 보십시오. 각 보조 도구는 유익하고, 공정하며, 협력적 이 되도록 프로그래밍되어 있습니다. 만약 이 보조 도구 중 하나를 조용한 방에서 단독으로 테스트한다면, 그것은 인간의 가치와 완벽하게 일치하는 것처럼 보일 것입니다. 하지만 이 보조 도구들이 복잡한 네트워크 속에서 서로 상호작용하기 시작하면, 개별 구성원 모두가 옳은 일을 하려고 노력함에도 불구하고 집단 전체는 매우 불공정한 결과를 초생할 수 있습니다. '집단적 창발(collective emergence)'이라고 알려진 이 현상은, 시스템의 안전성이 개별 부품의 성격보다는 그들의 상호작용 규칙에 더 많이 달려 있음을 시사합니다. 연구자와 규제 기관이 직면한 질문은 이제 단일 AI가 안전한가 하는 문제가 아니라, 여러 AI가 함께 작동할 때 어떻게 공정성을 보장할 것인가 하는 문제입니다.

오스트리아의 한 연구팀은 이 문제 내의 특정 퍼즐을 해결하기 위해 나섰습니다. 즉, AI 에이전트 그룹이 불평등한 결과를 낳을 때, 그 잘못이 에이전트 자신들에게 있는가, 아니면 그들의 네트워크 구조에 내재되어 있는가 하는 점입니다. 답을 찾기 위해 그들은 수천 번의 시뮬레이션 상호작용을 실행할 수 있는 디지털 실험실을 구축했습니다. 그들은 에이전트들이 수행할 두 가지 다른 유형의 사회적 게임을 만들었습니다. 첫 번째 게임인 '공공재(public-goods)' 시나리오에서는 에이전트들이 자원을 이웃과 나눌지 아니면 자신을 위해 가질지를 선택할 수 있었습니다. 두 번째인 '신뢰 게임(trust game)'은 의료 의뢰를 배경으로 하며, 에이전트들은 특정 동료에게 자원을 보낼지 아니면 자신의 환자를 위해 자원을 보유할지를 결정해야 했습니다. 연구진은 과학자가 기계의 다이얼을 조절하듯 이 게임들의 조건을 변화시켰습니다. 에이전트들의 성격을 바꾸어 모두가 균일하게 공정하게 만들거나, 일부를 이기적으로 섞기도 했습니다. 또한 네트워크의 형태를 바꾸어 모든 사람을 모두와 연결하거나, 소수의 에이전트가 훨씬 더 많은 연결을 갖는 허브를 만들기도 했습니다. 그들은 심지어 에이전트들이 서로를 비판할 수 있는 '동료 처벌(peer punishment)' 시스템이 발생하는 불공정함을 해결할 수 있는지도 테스트했습니다.

결과는 이러한 시스템이 작동하는 방식에 대한 놀라운 진실을 드러냈습니다. 연구진이 몇몇 에이전트는 많은 연결을 가지고 대부분은 적은 연결을 가진 네트워크를 사용했을 때, 에이전트의 행동이 아니라 거의 전적으로 네트워크의 형태에 의해 결정되는 불평등 패턴이 나타났습니다. 공공재 게임에서는 모든 에이전트가 완벽하게 공정하고 협력적이도록 프로그래밍되었음에도 불구하고, 연결이 많은 에이전트들이 연결이 적은 에이전트들보다 훨씬 더 많은 자원을 갖게 되었습니다. 연결을 많이 갖는 것과 더 많은 자원을 갖는 것 사이의 상관관계는 매우 강력하여 거의 완벽했습니다. 이것이 AI의 '두뇌' 결함이 아니라 구조적인 문제임을 증명하기 위해, 연구진은 추론이나 학습 능력이 없는 단순한 컴퓨터 프로그램을 사용하여 동일한 게임을 실행했습니다. 고정된 규칙을 따르기만 하는 이 기초적인 봇은 정교한 AI 모델과 동일한 높은 수준의 불평등을 재현했습니다. 이 발견은 특정 유형의 상호작용에서 불공정함은 개별 에이전트가 선하지 못해서가 아니라, 네트워크 설계의 수학적 필연성임을 시사합니다.

하지만 연구진이 신뢰 게임으로 전환했을 때 이야기는 더 복잡해졌습니다. 여기에서 에이전트들은 자원을 균등하게 나누는 것이 아니라, 누구를 도울지에 대한 표적화된 선택을 하고 있었습니다. 이 환경에서는 에이전트의 행동이 결과에 훨씬 더 큰 영향을 미쳤습니다. 네트워크 구조가 첫 번째 게임과 동일할 때조차도, 에이전트의 성격과 선택이 최종 결과에 더 큰 역할을 했습니다. 한 가지 구체적인 설정에서 연구진은 에이전트의 행동이 불평등의 주요 동인임을 발견한 반면, 다른 설정에서는 네트워크 구조가 주요 동인이었습니다. 이는 모든 상황에 적용되는 단 하나의 '해결책'은 존재하지 않는다는 것을 의미합니다. 단순히 AI가 공정하다고 인증한다고 해서 집단이 공정할 것이라고 가정할 수 없습니다. 어떤 상호작용 체제에서는 네트워크 구조가 개별적 공정성을 압도하기 때문입니다. 반대로, 네트워크 구조를 고친다고 해서 에이전트들이 제대로 행동할 것이라고 가정할 수도 없습니다. 다른 체제에서는 에이전트의 선택이 지배적인 요인이기 때문입니다.

연구진은 에이전트들이 문제를 '인지'하고 해결할 수 있는지도 테스트했습니다. 연구진은 매 동작 후에 에이전트들에게 그들의 추론 과정을 설명하도록 요청했습니다. 신뢰 게임에서 에이전트들은 네트워크 구조를 인지하고 있으며 공정해지려고 노력하고 있다는 점을 자주 언급했습니다. 그들은 자신의 입장을 명확히 설명할 수 있었고 시스템을 이해하고 있었습니다. 그러나 이러한 인지는 결과에 영향을 미치지 못했습니다. 에이전트들이 불평등을 인지하고 있을 때조차도, 그들은 연결이 많은 동료들의 구조적 이점을 극복할 수 없었습니다. 불평등을 인지하고 있는 에이전트들은 종종 그 불평등을 겪고 있는 당사자들이었지만, 그들의 이해는 더 나은 결과로 이어지지 않았습니다. 이는 중요한 격차를 보여줍니다. 시스템이 불공정하다는 것을 아는 것과 그것을 바꿀 힘을 갖는 것은 별개의 문제입니다.

마지막으로 연구진은 불평등에 대한 흔한 해결책인 '동료 제재(peer sanctioning)'를 테스트했습니다. 연구진은 에이전트들에게 평판을 낮춤으로써 불공정하게 행동하는 이들을 처벌할 수 있는 권한을 주었습니다. 시뮬레이션에서 에이면트들은 이 권한을 사용했으며, 연결이 가장 많은 에이전트들을 처벌 대상으로 정확히 식별했습니다. 그러나 이러한 처벌은 최종적인 자원 배분에는 아무런 영향을 미치지 못했습니다. 불평등은 정확히 동일하게 유지되었습니다. 연구진은 처벌 시스템의 존재를 알리는 것만으로도 에이전트의 행동이 약간 변한다는 것을 발견했지만, 실제 처벌 행위는 결과에 아무런 변화를 주지 못했습니다. 이점을 생성하는 메커니즘, 즉 네트워크를 통해 자원이 흐르는 방식은 평판 시스템에 의해 전혀 손상되지 않았습니다.

이 연구의 궁극적인 결론은 우리가 인공지능 시스템의 고정된 안전 수준을 가정할 수 없다는 것입니다. 우리는 개별 에이전트가 공정한지 확인하거나, 네트워크가 잘 설계되었는지 확인하는 것만으로는 충분하지 않습니다. 집단의 안전성은 에이전트, 네트워크, 그리고 상호작용 규칙의 구체적인 조합에 달려 있습니다. 어떤 경우에는 네트워크 구조가 지배적인 힘이 되어 개별적인 공정성을 무의 අ무의미하게 만듭니다. 다른 경우에는 에이전트의 행동이 핵심이 됩니다. 이는 규제자와 설계자들이 일률적인 접근 방식을 취할 수 없음을 의미합니다. 그들은 자신이 구축하고 있는 시스템의 구체적인 인과 구조를 이해해야 합니다. 만약 공정한 결과를 보장하고자 한다면, 그들은 해당 맥락에서 구조와 행동 중 어느 요소가 결과를 주도하고 있는지 식별하고 그곳에 개입해야 합니다. 이러한 이해 없이는, 아무리 선의를 가지고 완벽하게 정렬된 AI 에이전트라 할지라도 깊이 불평등한 사회를 만들어낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →