← 최신 논문
🤖 AI

INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems

이 논문은 이진 분류에 의존하는 대신 감염된 에이전트를 식별하고 재활성화함으로써 악성 전파를 완화하고, 이를 통해 위상적 무결성을 보존하면서 공격 성공률을 크게 낮추는 LLM 기반 멀티 에이전트 시스템을 위한 새로운 방어 프레임워크인 INFA-Guard를 소개한다.

원저자: Yijin Zhou, Xiaoya Lu, Dongrui Liu, Junchi Yan, Jing Shao

게시일 2026-01-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yijin Zhou, Xiaoya Lu, Dongrui Liu, Junchi Yan, Jing Shao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여러 명의 전문가 로봇(이를 멀티 에이전트 시스템이라 부릅니다)이 도시의 교통 계획을 세우거나 환자를 진단하는 것과 같은 복잡한 문제를 해결하기 위해 협력하는 모습을 상상해 보십시오. 이들은 서로 대화하고, 아이디어를 공유하며, 최선의 해결책에 대해 투표합니다.

이 논문은 이러한 로봇 팀을 특정 유형의 사보타주(방해 행위)로부터 보호하기 위한 새로운 보안 시스템인 INFA-GUARD를 소개합니다.

문제점: "좀비" 바이러스

과거의 로봇 팀을 위한 보안 요원들은 오직 두 유형의 사람들만을 찾아냈습니다:

  1. 나쁜 녀리들: 처음부터 해킹되어 계획을 망치려 하는 로봇들.
  2. 착한 녀들: 아무런 의도 없이 올바르게 작동하고 있는 무고한 로봇들.

이 논문은 이것이 너무 단순하다고 주장합니다. 이는 세 번째의 위험한 그룹을 놓치고 있기 때문입니다: 바로 감염된 자들입니다.

사무실 내의 독감 유행을 생각해 보십시오:

  • 공격자: 독감을 가지고 들어와 주변 사람들에게 기침을 하기 시작하는 사람.
  • 감염된 자: 건강했으나 공격자의 옆자리에 앉아 병에 걸린 동료. 이들은 원래의 근원지는 아니지만, 이제 병에 걸려 다른 사람들에게 바이러스를 퍼뜨리고 있습니다.
  • 기존의 보안 요원: 독감을 가지고 들어온 사람만을 쫓아냅니다. 그들은 "감염된" 동료는 그대로 둡니다. 감염된 동료는 계속해서 독감을 퍼뜨리고, 결국 사무실 전체가 병에 걸리게 됩니다.

이 논문은 AI 로봇 팀에서 "공격자"들이 거짓 정보를 믿도록 무고한 로봇들을 속이기 위해 설득력 있는 논거를 사용한다고 말합니다. 일단 속게 되면, 이 무고한 로봇들은 "감염"됩니다. 이들은 본래 악한 것이 아니지만, 이제 나쁜 생각을 퍼뜨리고 있습니다. 만약 원래의 공격자만 제거하고 감염된 로봇들을 그대로 둔다면, 피해는 계속될 것입니다.

해결책: INFA-GUARD

INFA-GUARD는 이러한 "감염" 과정을 이해하는 새로운 보안 프레임워크입니다. 이는 단순히 바이러스를 가져온 사람을 찾는 데 그치지 않고, 누가 병에 걸렸으며 이를 퍼뜨리고 있는지까지 식별하는 스마트한 보건 검사관처럼 행동합니다.

작동 방식은 다음과 같이 세 가지 간단한 단계로 나뉩니다:

  1. 감염 탐지 (레이더):
    단순히 로봇이 "좋은지" 혹은 "나쁜지"를 확인하는 대신, INFA-GUARD는 로봇들이 시간이 지남에 따라 어떻게 대화하는지를 관찰합니다. 시스템은 건강한 로봇이 의심스러운 로봇과 대화한 후 이상하게 행동하기 시작하는 순간을 포착합니다. 또한 팀의 연결 관계를 나타내는 특별한 지도를 사용하여 누가 누구와 대화하고 있는지를 살핍니다. 만약 어떤 로봇이 고립되어 있는데 이상하게 행동한다면 이는 가짜 경보일 수 있습니다. 하지만 어떤 로봇이 이상하게 행동하면서 동시에 알려진 악한 행위자 옆에 있다면, 시스템은 이를 "감염"된 것으로 표시합니다.

  2. 팀 복구 (트리아지/응급 처치):
    시스템이 누가 누구인지 파악하면, 다음과 같이 각기 다른 조치를 취합니다:

    • 공격자를 위해: 그들을 팀에서 완전히 퇴출시키고 신선하고 건강한 로봇으로 교체합니다. 이는 독의 근원을 차단합니다.
    • 감염된 자를 위해: 그들을 쫓아내지 않습니다! 대신 그들을 "치료"합니다. 시스템은 그들의 잘못된 답변을 가져와서 독소를 제거하도록 다시 작성한 뒤, 팀에 계속 머물 수 있게 합니다. 이를 통해 팀의 구조를 온전히 유지하고 귀중한 구성원을 잃지 않도록 합니다.
  3. 지도(Map)의 온전함 유지:
    시스템은 팀의 통신 네트워크를 깨뜨리지 않도록 주의를 기울입니다. 감염된 로봇을 단순히 삭제하는 대신 치료함으로써, 팀은 연결 상태를 유지하고 여전히 효과적으로 문제를 해결할 수 있습니다.

결과

저자들은 다양한 유형의 "공격"(예: 로봇을 가짜 데이터나 잘못된 도구로 속이는 것)에 대해 이 시스템을 테스트했습니다. 그 결과는 다음과 같습니다:

  • 더 뛰어난 성능: 기존의 보안 방식보다 나쁜 생각이 퍼지는 것을 훨씬 더 효과적으로 막았습니다 (공격 성공률을 평균 약 33% 감소시킴).
  • 효율성: 엄청난 양의 추가 컴퓨팅 파워를 요구하지 않아 실제로 사용하기에 실용적입니다.
  • 유연성: 로봇들이 원형, 직선 또는 무작위 그룹으로 배치되어 있든 상관없이 잘 작동하며, 다양한 유형의 AI 두뇌와도 호환됩니다.

요약하자면, INFA-GUARD는 AI 팀에서 "감염되는 것"이 처음부터 "나쁜 행위자"인 것과는 다른 문제라는 점을 깨달았습니다. 이 둘을 다르게 대함으로써, 시스템은 팀 전체가 무너지는 것을 방지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →