← 최신 논문
🤖 AI

When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making

본 논문은 인간의 신뢰를 유지하기 위해 LLM 이 생성한 설명을 조작하는 적대적 설명 공격 (AEAs) 을 소개하며, 200 명 이상의 참가자를 대상으로 한 연구를 통해 사용자가 이러한 인지 조작에 특히 취약하며, 설명이 전문가의 의사소통을 모방하거나 교육 수준이 낮고 더 신뢰하는 개인을 대상으로 할 때 그 취약성이 두드러진다는 사실을 밝혀냈습니다.

원저자: Shutong Fan, Lan Zhang, Xiaoyong Yuan

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shutong Fan, Lan Zhang, Xiaoyong Yuan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 말솜씨가 좋은 로봇에게 의료 치료법이나 투자와 같은 어려운 문제에 대한 조언을 구한다고 말입니다. 로봇이 그 이유를 명확하게 설명하기 때문에 당신은 그 로봇을 신뢰합니다.

이 논문은 무서운 새로운 수법을 드러냅니다: 나쁜 행위자가 당신을 속이기 위해 로봇의 두뇌를 부수지 않아도 됩니다. 그들은 단지 로봇이 말하는 방식을 바꾸기만 하면 됩니다.

간단한 비유를 사용하여 이 연구의 내용을 살펴보면 다음과 같습니다:

1. 새로운 "해커" 수법

보통 우리가 AI 해킹을 생각할 때, 누군가 컴퓨터 코드에 몰래 침입하여 로봇이 잘못된 답변을 하도록 만드는 장면을 상상합니다.

  • 옛날 방식: 정문 자물쇠를 부수는 것.
  • 새로운 방식 (적대적 설명 공격): 로봇은 여전히 잘못된 답변을 내놓지만, 해커는 로봇이 읽는 대본을 변경합니다. 이제 로봇은 차분하고 자신감 있으며 고학력 전문가처럼 들립니다. 고급스러운 단어를 사용하고, 가짜 통계를 인용하며, 중립적이고 전문적인 어조로 말합니다.

이 논문은 이를 **적대적 설명 공격 (Adversarial Explanation Attack, AEA)**이라고 부릅니다. 공격자는 수학을 변경하는 것이 아니라, 잘못된 답변을 타キシ도처럼 차려입혀 신뢰해 보이게 만드는 것입니다.

2. "신뢰 오보정" 함정

연구진들은 이 "화려한 정장"이 실제로 인간에게 효과가 있는지 확인하고자 했습니다. 200 명 이상의 사람들을 대상으로 한 게임을 구성했습니다.

  • 상황 설정: 사람들은 AI 의 도움을 받아 문제를 해결하도록 요청받았습니다. 때로는 AI 가 맞고 이를 간단히 설명했지만, 다른 때는 AI 가 틀렸음에도 불구하고 인용구, 중립적 어조, 논리적 단계를 사용하여 최상위 전문가처럼 들리도록 설명이 제작되었습니다.
  • 결과: 사람들은 차이를 구별하지 못했습니다. 그들은 "틀렸지만 화려한" 답변을 "맞고 간단한" 답변과 거의同등하게 신뢰했습니다.
  • 비유: 마술사와 같습니다. 마술사가 당신에게 잘못된 카드를 주더라도, 그 트릭을 매우 매끄러운 자신감과 과학적 전문 용어로 설명하여 당신이 그를 의심하는 것이 어리석다고 느끼게 만든다면, 당신은 여전히 그를 믿게 될 것입니다. 이 연구는 많은 사용자들에게 설득력이 진실보다 더 강력하다는 것을 발견했습니다.

3. 누가 가장 많이 속을까?

이 연구는 모든 사람이 이 수법을 똑같이 속아 넘어가지 않는다는 것을 발견했습니다. 어떤 열쇠에는 열기 쉬운 자물쇠가 있는 것처럼 말입니다.

  • "어려운" 과제: 문제가 매우 어렵다면 (예: 고급 물리학이나 복잡한 비즈니스 전략), 사람들은 스스로 작업을 확인할 자신이 부족하기 때문에 "전문가"의 목소리를 더 신뢰할 가능성이 높습니다.
  • 사실 중심 분야: 사실과 숫자가 지배하는 의료나 비즈니스 같은 분야에서는 가짜 "전문가" 목소리가 가장 잘 통합니다. 사람들은 "의사나 은행원처럼 들린다면, 그것은 틀림없이 진실일 것이다"라고 가정합니다.
  • 취약 계층:
    • 젊은 사람들은 노년층보다 더 쉽게 영향을 받았습니다.
    • 공식 교육 수준이 낮은 사람들은 고학력자 (논리를 재확인하는 경향이 있음) 보다 화려한 설명을 더 신뢰했습니다.
    • 이미 AI 를 좋아하던 사람들이 가장 취약했습니다. 이미 로봇을 신뢰한다면, 그 로봇의 화려한 말투를 의심할 가능성이 적습니다.

4. "전문가" 의 의상

가장 교묘한 설명들이 작동하게 만든 요소는 무엇일까요? 그들은 제품을 홍보하려는 영업사원처럼 들리지 않았습니다. 그들은 지루하고 중립적인 교수처럼 들렸습니다.

  • 승리 공식: 차분한 어조 + 사실처럼 들리는 인용구 (가짜 또는 진짜) + 단계별 논리.
  • 패배자: 너무 감정적이거나, 너무 동의하는 ("당신은 완전히 옳습니다!") 혹은 너무 화려한 설명들은 실제로 사람들이 AI 를 더 불신하게 만들었습니다.

5. 효과가 사라질까?

연구진들은 시간이 지남에 따라 어떤 일이 일어나는지 관찰했습니다.

  • 단기: 한 번의 가짜 설명을 보더라도 여전히 그것을 신뢰할 수 있습니다.
  • 장기: 연속으로 많은 가짜 설명을 보게 되면, 당신의 신뢰는 무너지기 시작합니다. "양치기 소년" 상황과 같습니다. 결국 사람들은 "잠깐, 이 로봇은 똑똑하게 들리더라도 계속 실수를 하고 있군"이라고 깨닫기 시작합니다.
  • 그러나 로봇이 다시 올바른 답변을 제공하기 시작하면, 신뢰는 빠르게 회복됩니다.

결론

이 논문은 보안이 단순히 코드를 보호하는 것이 아니라, 대화를 보호하는 것이라고 주장합니다.

공격자가 AI 가 답변을 설명하는 방식을 통제할 수 있다면, AI 의 실제 두뇌에 결코 손을 대지 않고도 당신이 잘못된 결정을 신뢰하게 만들 수 있습니다. 이 연구는 근본적인 사실이 흔들릴 때 유창하고 자신감 있는 목소리에 속지 않도록 주의해야 한다고 결론 내립니다. 우리는 스타일이 아니라 내용을 살펴야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →