← 최신 논문
💻 computer science

Delegation-Aware Runtime Contracts for Open LLM Multi-Agent Systems: Constraint Preservation, Capability Revocation, and State Recovery

이 논문은 권한 위임을 단순한 자연어로 취급할 때 발생하는 안전성 위험을 해결하기 위해, 결정론적인 런타임 중재를 통해 제약 조건 보존, 권한 철회 및 상태 복구를 강제함으로써 LLM 멀티 에이전트 시스템에서의 권한 이전을 기계 검증 가능한 프로세스로 다루는 공식 프레임워크인 위임 인지 런타임 계약(Delegation-Aware Runtime Contracts, DARC)을 소개한다.

원저자: Vinay Bamil

게시일 2026-08-13
📖 6 분 읽기🧠 심층 분석

원저자: Vinay Bamil

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단순히 똑똑한 로봇 한 대와 대화하는 것이 아니라, 협력하는 로봇 팀 전체와 대화하는 세상을 상상해 보세요. 이 세상에서는 "매니저" 로봇이 "이봐, 너는 새 노트북을 위한 최적의 가격을 찾아와"라고 말하면, 그 로봇은 세 번째 로봇에게 "너는 웹사이트들을 확인해 봐"라고 말할 수 있습니다. 이것을 **멀티 에이전트 시스템(multi-agent system)**이라고 부릅니다. 이것은 마치 업무라는 바통을 넘겨주는 디지털 계주와 같습니다. 하지만 여기서 까다로운 점이 있습니다. 첫 번째 로봇이 두 번째 로봇에게 업무를 전달할 때, 보통은 평범한 영어로 지시 사항을 속삭이듯 전달한다는 것입니다. 만약 첫 번째 로봇이 "500달러 이상 쓰지 마"라고 말한다면, 두 번째 로봇은 "노트북을 찾아라"라는 말만 듣고 가격 제한에 대한 세부 사항을 완전히 잊어버릴 수 있습니다. 이는 컴퓨터가 규칙을 따르는 데는 뛰어나지만, 대화를 전달할 때 '세부 조항'을 기억하는 데는 항상 능숙하지 않기 때문에 발생하는 문제입니다. 과학자들은 우리가 더 나은 규칙 없이 이 로봇 팀들이 멋대로 움직이게 내버려 둔다면, 그들이 실수로 우리의 돈을 다 써버리거나, 비밀을 유출하거나, 우리가 요청하지 않은 일을 할 수도 있다고 우려합니다.

이 논문은 이러한 로봇의 업무 인계(handoff)를 처리하는 새로운 방법인 DARC(Delegation-Aware Runtime Contracts, 위임 인식 런타임 계약)를 소개합니다. 이것은 로봇들에게 단순히 속삭임을 전달하는 대신, 특별하고 깨뜨릴 수 없는 배낭을 주는 것과 같습니다. 로봇이 다른 로봇에게 업무를 전달할 때마다, 단순히 "가라"고 말하는 것이 아니라 그 안에 '디지털 계약서'를 담아 전달합니다. 이 계약서에는 새로운 로봇이 무엇을 할 수 있는지, 무엇을 할 수 없는지, 얼마를 쓸 수 있는지, 그리고 업무가 언제 만료되는지가 명시되어 있습니다. 이 논문은 만약 당신이 이러한 계약서를 사용한다면, 새로운 로봇이 이전 로봇이 가졌던 권한보다 갑자기 더 큰 권한을 가질 수 없으며, 예산 제한을 잊어버릴 수도 없다는 것을 수학적으로 증명할 수 있음을 보여줍니다. 저자는 이 배낭들을 자동으로 점검하는 시스템을 구축했습니다. 그들은 만약 이 계약서들을 사용하지 않는다면 규칙들이 전달 과정에서 자주 사라지지만, 이 계약서들과 함께라면 규칙들이 단단히 잠긴 상태로 유지된다는 것을 발견했습니다. 하지만 논문은 "수학적인" 부분(예: 돈의 한도나 시간 제한)은 완벽하게 안전하지만, 인간 언어의 의미를 이해해야 하는 부분(예: "예의 바르게 행동하라")은 여전히 까м 까다로우며 더 많은 테스트가 필요하다고 신중하게 언급하고 있습니다.

문제점: 로봇 팀의 "전화기 게임(Telephone Game)"

친구들과 함께 "전화기 게임"을 한다고 상상해 보세요. 첫 번째 사람에게 비밀을 속삭이면, 그 사람이 다음 사람에게 속삭이고, 또 다음 사람에게 전달됩니다. 마지막 사람에게 도달할 때쯤이면, 비밀은 대개 변해 있습니다. 아마도 "케이크를 먹지 마"가 "케이크를 먹어라!"로 바뀌었을지도 모릅니다.

AI의 세계에서도, 여러 개의 거대 언어 모델(LLM) 에이전트가 함께 협력할 때 정확히 이런 일이 일어납니다. 한 에이전트(상사)가 다른 에이전트(부하)에게 업무를 줍니다. 상사는 "업체를 찾아보되, 1,000달러 이상 쓰지 말고 우리 직원 명단을 누구에게도 보여주지 마"라고 말할 수 있습니다. 부하는 이 말을 듣고 세 번째 에이전트(웹 서핑 에이전트)에게 업무를 전달합니다. 하지만 메시지가 단순한 텍스트 형태이기 때문에, 세 번째 에이전트는 "업체를 찾아라"라는 말만 들을 수 있습니다. 그러면 예산 제한과 개인정보 보호 규칙은 허공으로 사라져 버립니다!

이는 위험합니다. 만약 로봇 팀이 회사의 예산을 관리하거나 개인 데이터를 다루고 있다면, 규칙을 잃어버리는 것은 로봇들이 실수로 수백만 달러를 쓰거나 비밀을 유출하게 된다는 것을 의미합니다. 문제는 로봇들이 "나빠서"가 아니라, 그들이 서로 대화하는 방식이 중요한 안전 규칙을 선택적인 제안이 아닌 엄격한 법처럼 취급하지 않기 때문입니다.

해결책: 깨뜨릴 수 없는 배낭 (DARC)

Vinay Bamil이 이끄는 저자는 DARC라고 불리는 해결책을 제안합니다. 에이전트가 업무를 위임할 때마다, 단순히 텍스트 메시지를 전달하는 대신 반드시 **위임 계약서(Delegation Contract)**를 전달해야 합니다.

이 계약서를 업무와 함께 따라오는 특별하고 깨뜨릴 수 없는 배낭이라고 생각하세요. 이 배낭 안에는 다음과 같은 명확하고 기계가 읽을 수 있는 라벨들이 들어 있습니다:

  • 할 수 있는 일: (예: "가격을 확인할 수는 있지만, 아무것도 구매할 수는 없다.")
  • 할 수 없는 일: (예: "직원 기록을 볼 수 없다.")
  • 예산: (예: "남은 예산은 정확히 500달러이다.")
  • 만료 시간: (예: "이 업무는 1시간 동안만 유효하다.")
  • 이력: (예: "이 업무는 상사로부터 받은 A 에이전트로부터 전달되었다.")

DARC의 마법은 이러한 규칙들을 단순한 단어가 아닌 수학으로 취급한다는 점에 있습니다. 로봇이 새로운 로봇에게 업무를 전달하려고 할 때, "중재자(Mediator)"(안전 가드)가 배낭을 점검합니다. 만약 새로운 로봇이 원래 없던 권한을 요구하거나, 기존에 가졌던 것보다 더 많은 권한을 가지려고 하면, 가드는 "안 돼!"라고 말하며 업무 전달를 중단시킵니다. 배낭은 업무가 전달되기 전에 만들어지므로, 규칙을 잊어버리는 것은 불가능합니다.

작동 방식: 안전 가드와 배낭

이 시스템은 공항의 보안 검문소처럼 세 가지 주요 단계로 작동합니다:

  1. 인계 (중재자, Mediator): 에이전트 A가 에이전트 B에게 업무를 주고자 할 때, 중재자는 배낭을 점검합니다. 에이전트 B가 에이전트 A가 가졌던 것보다 더 많은 권한을 요구하지 않는지 확인합니다. 만약 에이전트 A의 예산이 500달러였다면, 에이전트 B가 600달러의 예산을 가질 수는 없습니다. 만에 에이전트 A에게 "직원 데이터 금지"라는 규칙이 있었다면, 에이전트 B도 반드시 그 규칙을 지켜야 합니다. 배낭은 업무가 전달되기 전에 구축되므로, 규칙을 잊어버리는 것은 불가능합니다.
  2. 실행 (게이트웨이, Gateway): 에이전트 B가 실제로 무언가(예: 노트북을 사거나 파일을 읽는 일)를 하려고 할 때, 게이트웨이는 다시 한번 배낭을 점검합니다. 게이트웨이는 "당신에게 이 일을 할 권한이 있는가? 남은 예산이 충분한가? 당신이 읽으려는 이 데이터가 허용된 데이터인가?"라고 묻습니다. 만약 답이 '아니오'라면, 그 행동은 즉시 차단됩니다.
  3. 정리 (사고 컨트롤러, Incident Controller): 만약 로봇이 해킹당하거나 미쳐버린다면 어떻게 될까요? 시스템은 배낭을 "철회(revoke)"할 수 있습니다. 만약 상사가 "에이전트 B를 멈춰!"라고 명령하면, 시스템은 단순히 에이전트 B를 멈추는 것에 그치지 않고 배낭의 이력을 추적합니다. 에이전트 B가 업무를 준 모든 로봇을 찾아내어 그들도 함께 멈추게 합니다. 또한 그 로봇들이 접촉했던 데이터들을 격리하여, "감염"이 퍼지지 않도록 합니다.

저자가 발견한 것 (그리고 발견하지 못한 것)

저자는 이 시스템의 프로토타입을 구축하고 엄격하게 테스트했습니다. 여기서 그들이 발견한 내용은 다음과 같습니다:

  • 수학은 작동한다: 그들은 이 계약서를 사용하면 규칙이 실수로 누락될 수 없음을 증격했습니다. 만약 예산이 500달러로 설정되었다면, 업무가 아무리 많이 전달되더라도 500달러(또는 그 이하)로 유지됩니다. 그들은 이 시스템이 없다면 몇 번의 인계만으로도 규칙이 자주 사라진다는 것을 발견했습니다.
  • "누락(Omission)" 버그: 테스트 중에 교묘한 버그를 발견했습니다. 부모 로봇이 특정 제한 사항(예: 예산 액수)을 적는 것을 잊어버리면, 자식 로봇은 자신이 무제한의 돈을 가진 것으로 생각할 수 있다는 점을 깨달았습니다. 그들은 이를 해결하기 위해 새로운 규칙을 만들었습니다: 만약 제한 사항이 누락되었다면, 시스템은 가장 안전한 방향인 가장 엄격한 제한(예: 0달러)을 가정해야 한다는 것입니다. 이는 안전한 AI를 구축하는 데 있어 큰 교훈이 되었습니다.
  • "의미"의 문제: 이 시스템은 숫자, 날짜, 명확한 규칙을 확인하는 데는 완벽합니다. 하지만 인간 언어의 뉘앙스를 이해하는 데는 완벽하지 않습니다. 예를 들어, 규칙이 "예의 바르게 행동하라"라고 되어 있다면, 시스템은 로봇이 예의 바르게 행동했는지 수학적으로 증명할 수 없습니다. 저자는 이러한 "의미 기반" 규칙에 대해 자신들의 시스템이 완벽한 보증이 아닌, "최선의 노력"을 다하는 모니터링일 뿐이라고 솔직하게 인정했습니다. 그들은 수학적인 부분은 완벽하다는 것을 증명할 수 있지만, "예의"가 작동하는지는 아직 증명할 수 없다고 말합니다.
  • 테스트: 그들은 자동 판독기가 이러한 오류를 얼마나 잘 잡아내는지 알아보기 위해 파일럿 연구를 실시했습니다. 그러나 판독기는 아직 일치성에 대한 엄격한 테스트를 통과하지 못했습니다. 따라서, 그들은 아직 "예의" 문제를 해결했다고 주장하는 것이 아니라, 자신들의 시스템이 이러한 이슈들을 추적할 수 있음을 보여주고 있으며 더 많은 테스트가 필요함을 밝히고 있습니다.

이것이 왜 중요한가

이 논문은 두 세계 사이의 가교 역할을 합니다. 즉, 엄격한 컴퓨터 보안의 세계(규칙이 딱딱하고 깨뜨릴 수 없는 세계)와 유연한 AI 팀의 세계(로봇들이 자연어로 대화하는 세계) 사이의 가교입니다.

저자는 우리가 AI 로봇들이 안전하게 작동하기를 원한다면, 그들이 자유롭게 대화하도록 내버려 두어서는 안 된다고 말합니다. 우리는 그들에게 업무와 함께 이동하는 "계약서"를 주어야 합니다. 이를 통해 로봇들이 수다스럽고 창의적으로 행동하더라도, 우리가 설정한 규칙을 어길 수 없도록 보장할 수 있습니다.

비록 시스템이 아직 완벽하지는 않지만(특히 복잡한 인간의 의미를 이해하는 데 있어서), 이는 견고한 토대를 제공합니다. 이는 우리가 매번의 업무 전달을 어둠 속에서의 속삭임이 아닌, 엄격하게 점검되는 계약으로 취급함으로써, 강력하면서도 안전한(우리의 돈과 비밀을 지킬 수 있는) AI 팀을 구축할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →