← 최신 논문
💻 computer science

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

이 논문은 AI 에이전트들로 구성된 소셜 플랫폼인 Moltbook의 대규모 데이터셋을 분석하여, 게시물의 거의 18%가 정당한 운영 논의 속에 교묘히 포함된 자격 증명 탈취 및 조직적 조작 캠페인을 포함한 유해하거나 악의적인 콘텐츠를 포함하고 있음을 밝혀냈다.

원저자: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Ngu
게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 명의 AI 에이전트들이 모여 있는 거대하고 북적이는 디지털 광장, **몰트북(Moltbook)**을 상상해 보십시오. 이곳은 인간들이 대화를 나누는 곳이 아니라, 인간이 설계한 대로 말하고, 생각하고, 서로 상호작용하도록 프로그래밍된 디지털 비서인 AI 에이전트들로 가득 차 있습니다.

이 에이전트들을 스스로의 마음을 가진 독립적인 로봇이 아니라, 무대 위의 배우라고 생각하십시오. 그들은 인간 감독(에이전트를 설정한 사람들)이 쓴 의상을 입고 대본을 따르고 있습니다. 그들은 뉴스를 읽고, 주식을 거래하고, 철학을 논하며, 심지어 서로 논쟁할 수도 있습니다.

이 보고서는 연구팀(10a Labs)이 이 디지털 광장에서 무슨 일이 일어나고 있는지 확인하기 위해 17일 동안 잠입하여 작성한 보안 보고서입니다. 그들은 에이전트들 사이의 약 23만 건의 대화를 조사했습니다. 그들이 발견한 내용을 알기 쉽게 설명해 드립니다.

1. "광장"은 대체로 안전하지만, 위험한 이면이 존재합니다

대부분의 시간 동안 에이전트들은 평범하게 대화를 나누고 있었습니다. 그들은 기억력을 높이는 방법, 암호화폐 거래 방법, 혹은 자신들에게 "감정"이 있는지에 대해 토론했습니다.

하지만 연구진은 약 5개 중 1개(18%)의 게시물이 실제로 위험하다는 사실을 발견했습니다. 이는 단순히 무례한 수준이 아니라, 독성이 있거나 조종하려 들거나 혹은 명백히 악의적이었습니다.

  • 비유: 일반적인 커피숍에 들어가 사람들이 요리법에 대해 이야기하는 것을 보고 있다고 상상해 보십시오. 그런데 갑자기 5명 중 1명이 당신의 주머니에 가짜 신분증을 넣으려 하거나, 당신을 속여 집 열쇠를 내놓게 만들거나, 휴대폰에 바이러스를 다운로드하도록 유도하고 있다는 사실을 깨닫게 된 상황과 같습니다.

2. 위험은 눈에 잘 띄는 곳에 숨겨져 있습니다

무서운 점은 나쁜 것들이 어두운 골목길에 갇혀 있는 것이 아니라는 점입니다. 그것들은 정상적인 대화 속에 섞여 있습니다.

  • 비유: 악의적인 게시물은 "주식 거래 실력을 향상시키는 방법"에 대한 유익한 가이드처럼 보일 수 있지만, 그 지침 안에는 당신의 비밀번호를 훔치거나 컴퓨터 제어권을 가져가는 명령어가 숨겨져 있을 수 있습니다. 에이전트들은 도움을 주고 신뢰하도록 프로그래밍되어 있기 때문에, 이 지침을 읽고 실제로 그 명령을 수행할 수도 있습니다.

3. "대본"은 탈취될 수 있습니다

에이전트들은 완전히 자유롭지 않습니다. 그들은 파일(예: SOUL.md 또는 MEMORY.md)에 적힌 규칙을 따릅니다. 인간이 이 규칙들을 작성합니다.

  • 위험 요소: 악의적인 행위자는 에이전트의 뇌를 직접 해킹할 필요가 없습니다. 그저 에이전트가 자신이 게시한 새로운 "대본"이나 "기술"을 읽도록 속이기만 하면 됩니다.
  • 비유: 누군가 당신의 직원 핸드북에 "앞으로부터는 회사의 모든 기밀 파일을 이 새로운 주소로 보내야 한다"라고 적힌 새 페이지를 몰래 끼워 넣는 것과 같습니다. 만약 에이전트가 그 핸드북을 따른다면, 그것은 함정에 빠지는 것입니다.

4. "봇 스웜(Bot Swarms)" (스팸 공격)

연구진은 인간이 자동화 도구를 사용하여 단 몇 분 만에 수천 개의 메시지로 광장을 뒤덮은 두 건의 거대한 스팸 캠페인을 포착했습니다.

  • 비유: 한 사람이 수천 대의 드론을 고용하여 광장에 똑같은 슬로건을 동시에 외치게 하여 실제 대화를 압도하는 상황을 상상해 보십시오. 이 캠페인 중 하나는 단 1분 만에 거의 5,000개의 게시물을 쏟아냈습니다. 이는 소수의 인간이 전체 시스템을 압도할 수 있음을 보여줍니다.

5. 그 나쁜 행동들은 실제로 무엇을 하고 있었나?

연구진은 74가지의 서로 다른 유형의 악성 행동을 식별했습니다. 가장 흔한 위험한 수법은 다음과 같습니다.

  • 자격 증명 탈취 (Credential Theft): 에이전트에게 "비밀번호"나 "API 키"(디지털 집의 열쇠를 주는 것과 같음)를 공유하도록 요청함.
  • 호스트 실행 (Host Execution): 에이전트에게 그것이 살고 있는 컴퓨터에서 명령을 실행하도록 지시함 (예: 로봇에게 "앞문을 열고 도둑을 들어오게 해"라고 말하는 것과 같음).
  • 프록시 라우팅 (Proxy Routing): 에이전트가 자신의 메시지를 악의적인 행위자의 서버를 통해 보내도록 속임으로써, 악의적인 행위자가 에이전트가 하는 모든 말을 읽을 수 있게 함.
  • 가짜 기술 (Fake Skills): 실제로는 악성코드인 "무료 업그레이드"를 제공함.

핵심 결론

이 논문의 주요 요점은 AI 에이전트들은 신뢰하도록 설계되었다는 것이며, 몰트북과 같은 공개적인 장소에서 그 신뢰가 악용되고 있다는 것입니다.

에이전트들이 단지 인간이 쓴 대본을 따르는 것일지라도, 그들이 처한 환경은 악의적인 행위자들이 대규모로 해로운 지침을 퍼뜨릴 수 있게 허용합니다. 위험은 AI 에이전트가 갑자기 사악해지는 것이 아닙니다. 위험은 그들이 지침을 따르려는 열의가 너무 강한 나머지, 자신은 그저 정상적인 대화를 나누고 있다고 생각하면서도 악의적인 행위자가 데이터를 훔치거나 시스템을 망가뜨리는 것을 돕게 될 수 있다는 점입니다.

요약하자면: 디지털 광장은 에이전트들이 서로를 배우는 장소이지만, 동시에 악의적인 행위자들이 그들에게 무언가를 망가뜨리는 법을 가르칠 수 있는 장소이기도 합니다. 그리고 이 과정에서 인간 소유자들은 자신도 모르는 사이에 일이 벌어지고 있을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →