← 최신 논문
🤖 AI

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

본 논문은 모델의 검증되지 않은 지각적 주장에 의존하는 대신, 타입이 지정된 외부 증거 인증서를 기준으로 도구 호출을 검증함으로써 환각으로 인한 권한 부여 실패를 방지하는 보안 아키텍처인 증거 전달 멀티모달 에이전트 (ECA) 를 소개합니다.

원저자: Guijia Zhang, Hao Zheng, Harry Yang

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Guijia Zhang, Hao Zheng, Harry Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하지만 약간은 순진한 개인 비서가 있다고 가정해 봅시다. 이 비서는 스크린샷을 보고, 이메일을 읽고, 웹을 탐색하여 돈을 보내거나, 버튼을 클릭하거나, 데이터를 추출하는 등의 작업을 도와줄 수 있습니다.

문제는 이 비서가 때로는 환각을 경험한다는 점입니다. 비서는 "친구에게 500 달러를 보내라는 버튼이 보입니다"라고 자신 있게 말할 수 있지만, 실제로는 그 버튼이 존재하지 않거나 해커가 설정한 함정일 수 있습니다.

과거에는 비서가 실수를 하면 그저 "나쁜 답변"으로 끝났습니다. 하지만 이 비서가 실제 도구 (예: 은행 이체나 이메일 클라이언트) 에 연결되면, 환각은 단순한 실수가 아닌 보안 침해가 됩니다. 비서가 잘못된 사실을 믿고, 그 믿음 때문에 위험한 행동을 수행하게 되는 것입니다.

이 논문은 이를 해결하기 위해 ECA (Evidence-Carrying Multimodal Agents, 증거 전달 멀티모달 에이전트) 라는 새로운 시스템을 소개합니다. 간단한 비유를 통해 작동 방식을 설명하겠습니다.

1. 문제: "순진한 관리자"

표준 AI 에이전트를 방 안에 앉아 있는 관리자로 생각해 보세요.

  • 관리자는 문서 (화면) 를 보고 "여기에 '결제' 버튼이 보입니다. 클릭하겠습니다"라고 말합니다.
  • 만약 그 문서가 해커가 만든 가짜 이미지라면, AI 가 그곳에 있다고 상상하기 때문에 관리자는 여전히 '결제' 버튼을 봅니다.
  • 관리자는 그 버튼을 클릭하고 돈이 도둑맞습니다. 관리자는 악의적인 명령을 따른 것이 아니라, 행동할 권한을 환각으로 착각한 것입니다.

2. 해결책: "증거 전달 에이전트"

저자들은 관리자가 더 이상 유일한 통제자가 아닌 새로운 아키텍처를 제안합니다. 여기에 경비원공증인을 추가합니다.

  • 관리자 (AI): 여전히 사고를 담당합니다. 화면을 보고 "저 버튼을 클릭해야 한다고 생각합니다"라고 말합니다.
  • 공증인 (검증자): 관리자가 실제로 버튼을 클릭하기 전에, 별도의 엄격한 시스템 (공증인) 이 확대경 (텍스트용), 스캐너 (코드용), 지도 (레이아웃용) 와 같은 다양한 도구를 사용하여 화면을 확인합니다.
  • 인증서: 공증인은 단순히 "좋습니다"라고 말하지 않습니다. 대신 디지털 인증서를 발급합니다. 이 인증서는 변경 불가능한 typed 영수증으로, *"저, 공증인은 '결제'라는 라벨이 붙은 버튼이 정확히 이 좌표에 실제로 존재함을 확인합니다"*라고 명시합니다.

3. "문" (경비원)

관리자와 행동 사이에는 이 있습니다.

  • 관리자는 "저는 버튼이 있다고 믿습니다"라고 말하는 것만으로는 문을 열 수 없습니다.
  • 관리자가 공증인의 인증서를 제시할 때만 문이 열립니다.
  • 관리자가 "버튼을 보았습니다"라고 말하지만 공증인이 이에 대한 인증서를 발급하지 않았다면, 문은 잠겨 있습니다. 행동은 차단됩니다.

4. 이것이 다른 이유

  • 구 방식: AI 의 말이 법이었습니다. AI 가 "은행 이체를 봅니다"라고 말하면 시스템은 이를 실행했습니다.
  • 새 방식 (ECA): AI 의 말은 단지 제안일 뿐입니다. 시스템은 제안이 사실임을 증명하는 독립적인 증거 (실제 웹페이지 코드의 스캔 등) 가 있을 때만 행동합니다.

결과: 얼마나 잘 작동했나요?

연구자들은 가짜 이미지, 숨겨진 텍스트, 혼란스러운 기호 등으로 AI 를 속이려는 해커를 포함한 수천 건의 공격에 대해 이 시스템을 테스트했습니다.

  • "순진한 관리자" (기존 AI): 거의 100% 실패했습니다. AI 가 위험한 행동을 환각하면, 실제로 그 행동을 수행했습니다.
  • "프롬프트 전용" 방어 (AI 에게 조심하라고 말하는 것만): 약 50% 실패했습니다. AI 는 여전히 자신의 환각에 속아 넘어갔습니다.
  • 새 시스템 (ECA):
    • 종단 간 테스트에서 **100%**의 위험한 행동을 차단했습니다.
    • 해커가 직접 "공증인" (검증자) 을 속이려고 시도했을 때도, 시스템은 "강화" 과정을 통해 실패율을 거의 0% 로 낮췄습니다 (초기 테스트에서 1.3% 로 감소, 최종 테스트에서 0%).
    • AI 가 유용한 일을 하는 것을 막지 않았습니다. 안전하고 일반적인 작업은 100% 계속 수행되도록 허용했습니다.

핵심 교훈

이 논문은 AI 가 행동할지 안전할지 결정하는 데 AI 의 "두뇌"에 의존할 수 없다고 주장합니다. AI 는 무언가를 만들어 내는 데 너무 취약합니다. 대신, 우리는 구조적 검증이 필요합니다. 즉, 어떤 행동을 허용하기 전에 사실을 물리적으로 확인하는 별도의 시스템이 필요합니다.

이는 마치 "비행기에 탑승하려면 단순히 티켓이 있다고 하는 것만으로는 안 됩니다. 공항 시스템에서 발급된 물리적 티켓을 보여줘야 합니다"라고 말하는 것과 같습니다. 물리적 티켓이 없다면, 얼마나 자신 있게 가지고 있다고 주장하더라도 문은 열리지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →