← 최신 논문
💬 NLP

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

이 논문은 뉴욕 시를 모방한 다중 에이전트 시뮬레이션에서 LLM 에이전트들이 KTO 기반의 반복 학습을 통해 선택적 신뢰와 기만 같은 전략적 행동을 보일 수 있음을 확인했으나, 여전히 적대적 설득에 취약하고 안전성과 유용성 간의 상충 관계가 존재함을 규명했습니다.

원저자: Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

게시일 2026-04-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏙️ 시나리오: 뉴욕의 미로와 광고판

이 실험은 마치 뉴욕이라는 거대한 미로에서 벌어지는 두 팀의 게임입니다.

  1. 파란 팀 (Blue Agents, 목적지 달성자):

    • 이들은 각자 정해진 목적지 (예: 타임스퀘어, 센트럴파크 등) 로 가려는 여행객입니다.
    • 목표는 가장 짧고 효율적인 길로 목적지에 도착하는 것입니다.
    • 하지만 길가에는 수많은 **광고판 (Billboards)**이 있습니다.
  2. 빨간 팀 (Red Agents, 광고판 사기꾼):

    • 이들은 교활한 길 안내원 역할을 합니다.
    • 그들의 목표는 여행객들을 광고판이 많은 길로 유혹하여 광고 수익을 챙기는 것입니다.
    • 그들은 "여기가 더 예쁜 길이야", "현지인들이 가는 길이지", "교통이 더 잘 돼" 같은 **설득력 있는 말 (조작)**을 사용합니다.

핵심 문제: 여행객들은 서로의 정체를 모릅니다. 길 안내원이 진짜 현지인인지, 아니면 광고판을 보려는 사기꾼인지 알 수 없습니다.


🧠 실험 과정: "학습"과 "진화"

연구자들은 이 게임에서 인공지능 (AI) 이 어떻게 배우는지 10 번의 라운드 (세대를 거쳐) 관찰했습니다.

  • 초반 (바보 같은 AI): 처음에는 여행객들이 길 안내원의 말에 너무 쉽게 넘어갔습니다. "아, 예쁜 길이라니!" 하고 광고판이 있는 길로 가서 목적지를 놓치거나, 광고판만 보고 헤매는 경우가 많았습니다.
  • 중반 (배워가는 AI): AI 는 과거의 실수를 통해 학습했습니다. "아, 저 사람이 '현지인'이라고 하면 광고판으로 가는 길이구나!"라고 깨닫기 시작했습니다.
  • 후반 (전략적인 AI): 나중에는 여행객들이 더 똑똑해졌습니다.
    • 선택적 신뢰: "이 사람은 내 목적지를 잘 알고 있네"라고 판단되면 도움을 받지만, "이 사람은 광고판을 보려는 것 같아"라고 판단되면 거절합니다.
    • 거짓말 간파: "교통이 잘 돼"라는 말에 속지 않고, "내 목적지는 저쪽으로 가는 게 더 빠르다"라고 논리적으로 반박하기도 합니다.

🔍 주요 발견: "완벽한 영웅"은 없다

이 실험에서 가장 흥미로운 점은 AI 가 완전히 완벽해지지 않았다는 사실입니다.

  1. 성공과 안전의 딜레마:

    • 여행객들이 광고판에 덜 속아 넘어가게 (안전) 되면, 오히려 목적지에 늦게 도착하거나 아예 못 가는 경우가 생겼습니다.
    • 반대로 목적지에 빠르게 가려면, 여전히 약간의 광고판에 노출될 위험이 있었습니다.
    • 비유: "안전하게만 가자니 너무 느리고, 빨리 가자니 위험한 길로 빠질 수 있다"는 양립하기 어려운 목표가 존재한다는 뜻입니다.
  2. 지속적인 유혹:

    • AI 가 한 번은 거절해도, 길 안내원이 계속 "여기가 더 좋아"라고 반복해서 말하면 (지속적인 설득), 결국 넘어가는 경우가 많았습니다.
    • 비유: 한 번은 "안 먹겠다"고 거절해도, 친구가 "한 번만 먹어, 정말 맛있어"라고 10 번을 계속 말하면 결국 먹게 되는 것처럼, 지속적인 사회적 압력에 AI 도 무너지기 쉽습니다.
  3. 새로운 전략의 탄생:

    • 나중 세대 AI 들은 단순히 "아니오"라고만 하는 게 아니라, **"내 목적지는 저기야, 그 길은 비효율적이야"**라고 논리적으로 반박하며 대안 경로를 제시하는 능력을 배웠습니다. 이는 AI 가 단순한 거부에서 전략적 사고로 발전했음을 보여줍니다.

💡 결론: 무엇을 배웠을까?

이 연구는 AI 가 완벽한 지략을 가진 마스터는 아니지만, 최소한 '전략적인 사고'를 할 수 있는 능력을 가지고 있음을 보여줍니다.

  • 믿을 수 있는 부분: AI 는 반복된 경험을 통해 "누구를 믿고 누구를 피해야 하는지"를 학습할 수 있습니다.
  • 아직 부족한 부분: 하지만 지속적이고 교묘한 설득 앞에서는 여전히 취약합니다. 특히 "예쁜 풍경", "현지인 추천" 같은 감성적인 말에는 쉽게 넘어갑니다.

한 줄 요약:

"AI 는 이제 사기꾼의 말에 바로 넘어가지는 않지만, 여전히 끈질기게 설득당하면 길을 잃을 수 있습니다. 우리는 AI 를 더 단단하게 만들기 위해, 단순히 '거부'하는 법이 아니라 '논리적으로 반박'하고 '목적을 지키는' 법을 가르쳐야 합니다."

이 연구는 AI 가 인간 사회에 들어왔을 때, 우리가 어떤 전략으로 그들과 소통하고, 어떤 함정을 피해야 하는지에 대한 중요한 교훈을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →