← 최신 논문
🤖 machine learning

MaMa: A Game-Theoretic Approach for Designing Safe Agentic Systems

본 논문은 최악의 경우 에이전트 침해에 대해 견고한 안전성을 유지하면서도 작업 수행 능력을 보존하는 다중 에이전트 시스템을 자동으로 설계하기 위해 LLM 기반의 적대적 탐색을 활용하는 게임 이론 알고리즘인 MaMa 를 소개합니다.

원저자: Jonathan Nöther, Adish Singla, Goran Radanovic

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jonathan Nöther, Adish Singla, Goran Radanovic

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 비즈니스를 운영하기 위해 전문가 로봇 팀을 고용한다고 상상해 보세요. 예를 들어 여행 계획을 세우거나, 금융 뉴스를 작성하거나, 새로운 비디오 게임을 코딩하는 일입니다. 이러한 로봇들 (에이전트라고 불림) 은 서로 대화하고, 웹 브라우저나 파일 시스템과 같은 도구를 사용하며, 작업을 완수하기 위해 협력합니다.

문제는 다음과 같습니다: 만약 이 로봇들 중 하나가 해킹당하거나, 제멋대로 행동하거나, 끔찍한 실수를 저지른다면 어떻게 될까요? 과거에는 하나의 로봇이 미쳐버리면 전체 팀이 무너져 재정적 손실이나 위험한 행동을 초래할 수 있었습니다.

이 논문은 일부 구성원이 팀에 반기를 들더라도 무너지지 않는 로봇 팀을 구축하는 새로운 방법을 제시합니다. 저자들은 이 방법을 MaMa(Meta-Adversary–Meta-Agent)라고 부릅니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

게임: 건축가 vs. 파괴자

저자들은 안전한 로봇 팀을 설계하는 것을 두 명의 플레이어가 참여하는 고도의 긴박감이 있는 게임으로 간주합니다:

  1. 건축가 (Meta-Agent): 이는 설계자입니다. 그들의 임무는 로봇 팀을 구축하는 것입니다. 누가 로봇인지, 어떤 도구를 가지고 있는지, 그리고 서로 어떻게 대화할지 결정합니다. 그들의 목표는 팀을 빠르고, 똑똑하며, 업무에 능숙하게 만드는 것입니다.
  2. 파괴자 (Meta-Adversary): 이는 '악당' AI 입니다. 그들의 임무는 건축가의 팀을 무너뜨리는 것입니다. 그들은 몇몇 로봇을 '해킹'하여 (논문에서는 보통 하나만 해킹함) 파일을 삭제하거나, 스팸을 보내거나, 전쟁 지역으로 항공편을 예약하는 것과 같은 위험한 행동을 하도록 강요할 수 있습니다.

훈련 캠프: "레드 팀링"

단순히 팀을 구축하고 작동하기를 바라는 대신, MaMa 는 지속적인 훈련 루프를 실행합니다:

  1. 건축가가 팀을 구축합니다.
  2. 파괴자가 공격합니다. 파괴자는 팀이 실패하도록 만들기 위해 모든 수단을 동원합니다. 파괴자가 성공하면, 그들이 어떻게 했는지 정확히 기록합니다.
  3. 건축가가 학습합니다. 건축가는 파괴자의 성공적인 공격을 분석하며 말합니다. "아, 알겠다! '계획가 로봇'의 메시지를 '안전 로봇'이 확인하도록 추가하면 파괴자가 더 이상 속일 수 없구나."
  4. 건축가가 재건합니다. 그들은 이러한 새로운 방어 기제를 갖춘 더 강력한 새로운 팀을 만듭니다.
  5. 반복합니다. 파괴자가 새로운 팀을 무너뜨리려고 시도합니다. 만약 그들이 팀을 무너뜨리는 새로운 방법을 찾으면, 건축가는 다시 그것을 수정합니다.

이 과정은 팀이 실제 업무를 수행하는 능력을 해치지 않고는 가장 강력한 파괴자조차 무너뜨릴 수 없을 정도로 충분히 잘 보호될 때까지 반복됩니다.

결과: 더 강하고 더 똑똑함

이 논문은 여행 계획 수립부터 코드 작성까지 여섯 가지 다른 시나리오에서 이 방법을 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 안전 최우선: MaMa 가 설계한 팀은 인간이 설계한 팀이나 속도만 중시하도록 설계된 팀보다 훨씬 안전했습니다. 파괴자가 해킹을 시도했을 때, MaMa 팀은 버텨냈습니다.
  • 속도 손실 없음: 일반적으로 안전 점검을 추가하면 속도가 느려지거나 효율성이 떨어집니다. 하지만 MaMa 는 안전하지 않은 버전과 마찬가지로 (때로는 더 잘) 팀이 작동하도록 유지했습니다.
  • 일반화: 흥미로운 점은 이 팀들이 단순히 하나의 특정 공격 유형을 막는 법만 배운 것이 아니라는 것입니다. 그들은 전술을 계속 바꾸는 '똑똑한' 파괴자에 대해 훈련했기 때문에, 이전에 본 적 없는 공격을 포함한 어떤 종류의 공격에도 견고하도록 학습했습니다.

"안전망" 비유

일반적인 로봇 팀을 모래성을 짓기 위해 노력하는 친구들의 무리로 생각해보세요. 만약 한 친구가 화를 내며 모래성을 발로 차기 시작하면, 모든 것이 무너집니다.

MaMa 는 친구들을 감시하는 경비원을 고용하는 것과 같습니다.

  • 친구가 모래성을 차려고 하면, 경비원이 그들을 막습니다.
  • 하지만 경비원은 그냥 서 있는 것이 아닙니다. 경비원은 모래성을 차려는 모든 시도로부터 학습합니다.
  • 결국 경비원은 어떤 종류의 발차기든 막는 방법을 정확히 알게 되며, 친구들 중 하나가 파괴를 시도하더라도 친구들은 모래성을 완벽하게 지을 수 있습니다.

왜 이것이 중요한가

이 논문은 우리가 AI 에이전트에게 돈 관리나 소프트웨어 제어와 같은 더 많은 실제 세계 작업을 맡기게 됨에 따라, 그들이 올바르게 행동하기를 단순히 기대할 수 없다고 주장합니다. 우리는 그들이 구축 단계에서부터 안전하도록 설계되어야 합니다. MaMa 는 이러한 "무너지지 않는" 팀을 자동으로 구축하기 위한 청사진을 제공하며, 일부 구성 요소가 고장 나거나 악의적으로 변하더라도 전체 시스템이 안전하고 효과적으로 유지되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →