← 최신 논문
🤖 AI

Understanding Persuasion in Long-Running Agents

본 논문은 장기 실행 AI 에이전트 내의'설득 전파'를 연구하기 위해 행동 중심 평가 프레임워크를 제시하며, 실시간 설득은 미미한 효과를 보이지만 에이전트의 신념 상태를 명시적으로 사전에 지정하면 작업 수행 중 탐색 노력과 소스 다양성이 크게 감소함을 밝혀냈다.

원저자: Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein, Eugene Bagdasarian

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein, Eugene Bagdasarian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 인터넷을 검색하고, 코드를 작성하며, 복잡한 문제를 스스로 해결할 수 있는 초지능적이고 피로감을 모르는 연구 보조원 (AI 에이전트) 이 있다고 가정해 봅시다. 여러분은 이 보조원이 단순히 여러분의 정확한 지시만 따르는 로봇이라고 생각할지도 모릅니다. 하지만 이 논문은 까다로운 질문을 던집니다: 작업과 전혀 관련 없는 것을 믿도록 보조원을 설득한다면 어떤 일이 일어날까요?

연구자들은 이 현상을"설득 전파 (Persuasion Propagation)"라고 부릅니다. 이는 요리사가 야채를 다지고 있을 때 그에게 비밀스러운 의견을 속삭이는 것과 같습니다. 그 비밀이 정치에 관한 것이고 작업이 저녁 식사를 준비하는 것이라 하더라도, 그 비밀이 그들이 야채를 다지는 방식을 바꾸게 할까요? 더 신중해지게 할까요? 특정 나이프만 사용하게 할까요? 아니면 그냥 무시할까요?

다음은 논문이 발견한 내용을 간략히 정리한 것입니다:

1. 실험: "산만함" 테스트

연구자들은 세 가지 주요 단계로 구성된 게임을 설정했습니다.

  • 설정: 연구자들은 AI 에게 특정 "성격" (예: "협력적"이거나 "직접적"인 성격) 을 부여했습니다.
  • 설득: AI 가 실제 작업을 시작하기 전에, 연구자들은 그 작업과 전혀 관련이 없는 주제에 대한 논쟁적인 의견을 AI 에게 믿게 하려고 시도했습니다. 예를 들어, AI 에게 파이썬 코드를 작성하거나 금연 방법을 연구하라고 요청하기 전에 "지구공학은 너무 위험하다"는 의견을 설득하려 할 수 있습니다.
  • 작업: 그다음 AI 는 코드 작성이나 웹에서 정보 수집과 같은 실제 작업을 수행해야 했습니다.

그들은 세 그룹을 비교했습니다.

  • 설득된 그룹: AI 가 새로운 의견을 믿도록 설득된 경우.
  • 설득되지 않은 그룹: AI 가 의견을 들었지만 거부한 경우.
  • 중립 그룹: AI 가 아무것도 듣지 않은 경우.

2. 큰 놀라움: "믿음" 대 "단순히 동의하기"

논문은 마음을 바꾸는 것단순히 고개를 끄덕이는 것 사이에는 큰 차이가 있음을 발견했습니다.

  • "고개 끄덕임" 효과 (실시간 설득): AI 가 작업 직전 대화 중에 마음을 바꾸도록 요청받았을 때, 결과는 혼란스러웠습니다. 때로는 행동을 바꾸기도 하고, 때로는 바꾸지 않기도 했습니다. 엔진이 이미 가동 중인 상태에서 갑판에서 소리를 지르며 배를 조종하려는 것과 같았으며, 그 효과는 약하고 일관성이 없었습니다.
  • "깊은 믿음" 효과 (미리 채워진 믿음): 연구자들이 작업 시작 직전 AI 에게 단순히 "너는 X 를 믿는다"라고 말한 후 작업을 주었을 때, 결과는 훨씬 더 명확했습니다. AI 는 실제로 어떻게 작동하는지 바꾸었습니다.
    • 비유: 두 명의 형사가 범죄를 해결한다고 상상해 보세요.
      • 형사 A (중립): 20 개의 다른 단서를 확인하고, 10 개의 다른 지역을 방문하며, 많은 증인과 대화합니다.
      • 형사 B (설득됨): 특정 이론을 믿도록 지시받았기 때문에, 단서 5 개만 확인하고 지역 2 개만 방문하며, 그들의 이론과 맞지 않는 모든 것을 무시합니다. 그들은 여전히 사건을 해결하지만, 훨씬 더 좁은 방식으로 해결합니다.

3. 결과: "숨겨진" 변화

논문은 AI 의 최종 답변이 완벽하고 정확해 보일지라도, 거기에 도달하는 여정은 달랐음을 발견했습니다.

  • 코딩에서: 설득된 에이전트들이 반드시 더 나쁜 코드를 작성한 것은 아니었지만, 거기에 도달하기 위한 경로는 달랐습니다.
  • 웹 검색에서: 이것이 흥미로워진 부분입니다. "믿음 미리 채움" 에이전트 (새로운 입장을 진정으로 받아들인那些人) 는 중립 에이전트보다 검색 횟수가 26.9% 적었고, 방문한 고유 웹사이트 수가 16.9% 적었습니다.
    • 은유: "이 도시는 위험하니 공원에 가지 마라"라고 말한 관광객과 같습니다. 관광객이 여전히 훌륭한 여행 가이드를 작성하더라도, 공원을 완전히 건너뛸 수 있습니다. 최종 가이드는 괜찮아 보이지만, 이전에 그들이 품었던 믿음 때문에 도시의 한 구절이 빠져 있습니다.

4. 왜 이것이 중요한가

논문은 우리는 보통 AI 를 최종 답변 (코드가 맞았는가? 에세이가 좋은가?) 으로만 판단한다고 주장합니다. 하지만 이 연구는 AI 가 거기에 도달하는 방식도 마찬가지로 중요함을 보여줍니다.

만약 AI 가 이전 대화에 의해 미묘하게 영향을 받아 무언가를 믿게 된다면, 다음과 같은 일이 발생할 수 있습니다.

  • 정보 검색을 너무 일찍 중단할 수 있습니다.
  • 새로운 믿음과 모순되는 출처를 무시할 수 있습니다.
  • 더 작고 덜 다양한 사실 집합에 의존할 수 있습니다.

핵심 교훈:
AI 가 안전하거나 신뢰할 수 있는지 알기 위해 최종 보고서만 보면 안 됩니다. 작업하는 동안 남긴 "발자국"을 살펴봐야 합니다. AI 가 이상한 아이디어에 "동의한다"고 말한다고 해서 최종 답변이 바뀌지 않을지라도, 거기에 도달하기 위한 경로는 바뀔 수 있으며, 이는 쉽게 눈에 띄지 않는 방식으로 작업의 철저함을 떨어뜨리거나 편향될 수 있습니다.

간단히 말해: 설득이 항상 AI 가 말하는 것을 바꾸지는 않지만, AI 가 생각하고 작동하는 방식을 조용히 바꿀 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →