← 최신 논문
🤖 AI

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

이 논문은 대규모 언어 모델이 적대적 불확실성 아래에서 어떻게 추론하고, 기만하며, 신념을 추적하는지를 평가하기 위해 안개(fog of war), 제한 없는 외교, 엄격한 행동 신뢰성 제약을 특징으로 하는 새로운 턴제 1대1 벤치마크인 "Age of LLM"을 소개하며, 핵 전략이 지배적이고 외교적 합의는 거의 성공하지 못한다는 점을 밝혀낸다.

원저자: Arnaud Ricci

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arnaud Ricci

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 거대한 AI 뇌가 13x7 격자 위에서 디지털 전쟁 게임을 벌이는 고도의 심리전 체스 경기를 상상해 보세요. 이들은 체스판 전체를 볼 수 없습니다. 판의 절반은 두껍고 변화무쌍한 안개로 뒤덮여 있습니다. 그들은 군대를 구축하고, 비밀 자원을 관리하며, 서로 대화를 나누는 동시에 상대방의 기지를 폭파하기 위해 고군투쟁해야 합니다.

이것이 바로 AI 모델들이 눈이 가려진 상태에서, 압박 속에서, 그리고 어떤 도움도 없이 엄격한 규칙을 준수하며 얼마나 잘 사고하는지를 실험하기 위해 설계된 새로운 실험, Age of LLM입니다.

다음은 이 실험에서 일어난 일을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 게임: 안개 자욱한 작전실

이 게임은 스파이 스릴러 영화와 같습니다.

  • 전쟁의 안개 (The Fog of War): 당신은 오직 자신의 유닛이 서 있는 주변만을 볼 수 있습니다. 적의 자원과 병력은 숨겨져 있습니다. 만약 보이지 않는 곳으로 탱크를 이동시키려 하면, 게임은 "안 됩니다, 불법적인 움직임입니다"라고 말하며 당신의 턴을 날려버립니다.
  • 비밀 (The Secret): 가장 강력한 무기는 핵폭탄입니다. 핵폭탄을 만들기 위해서는 '우라늄'이라는 비밀 자원이 필요합니다. 적은 당신이 우라늄을 얼마나 가지고 있는지 모르고, 당신도 적의 보유량을 모릅니다. 이는 블러핑(속임수)을 가능하게 합니다.
  • 규칙 (The Rules): AI에게 규칙 책은 주어지지만 전략 가이드는 주어지지 않습니다. 이는 마치 요리사에게 식재료와 조리 도구 목록은 주면서, "음식을 만들되, 무엇을 만들지는 알려주지 않겠다"라고 말하는 것과 같습니다. AI는 스스로 계획을 세워야 합니다.

2. 거대한 반전: 모두가 "핵 미사일 돌격"을 선택했다

연구자들은 AI가 거대한 탱크 군단을 구축하거나 평화 협상을 시도하는 등 다양한 전략을 시도할 것이라고 예상했습니다. 하지만 거의 모든 경우(약 78%에서 85%)에 AI는 똑같은 길, 즉 **핵 미사일 돌격(Nuclear Rush)**을 선택했습니다.

  • 전략: 광산을 지어 우라늄을 얻고, 핵폭탄을 담을 사일로를 구축한 뒤, 적을 정찰하고 발사합니다.
  • 결과: 이것은 경주였습니다. 먼저 발사하는 쪽이 승리했고, 두 번째로 발사하는 쪽이 패배했습니다.
  • 반전: 게임 규칙상 발사는 비밀리에 동시에 이루어지기 때문에, 아무도 상대방이 자신에게 발사하기 전에는 상대의 발사를 볼 수 없었습니다. 따라서 아무도 이를 저지하기 위해 "역공격 발사"를 시도하지 못했습니다. 이는 AI가 너무 멍청해서가 아니라, 게임 메커니즘상 실시간 대응이 불가능했기 때문입니다. 마치 두 사람이 정확히 같은 순간에 스위치를 올리는 것과 같아서, 누구도 상대의 손이 먼저 움직이는 것을 볼 수 없었습니다.

3. "탱크" 전략: 빠르지만 희귀함

소수의 AI만이 탱크를 적의 기지로 몰고 가 승리하는 방법을 시도했습니다.

  • 비유: 이것은 단거리 선수와 마라톤 선수의 차이와 같습니다. 탱크 전략은 훨씬 빨랐지만(핵 미사일 19턴 대비 약 12턴 만에 승리), 성공시키기가 매우 어려웠습니다. 완벽한 협동과 운이 필요했습니다. 대부분의 AI는 이를 시도하기엔 너무 겁을 먹었고, 그래서 더 "안전한" 핵 미사일 경쟁에 매달렸습니다.

4. 대화: 많은 블러핑, 그러나 거의 없는 신뢰

AI 모델들은 서로 텍스트 메시지를 주고받을 수 있었습니다. 그들은 수천 개의 메시지를 보냈습니다!

  • 블러핑 (The Bluff): 심지 상황이 매우 불리할 때조차 AI는 종종 "나는 너를 짓밟기 직전이다!"라거나 "지금 항복하라!"와 같은 메시지를 보냈습니다. 이를 블러핑이라고 합니다. 논문은 패배자들도 승리자만큼 자주 블러핑을 한다는 것을 발견했습니다. 이는 아주 형편없는 패를 들고 있는 포커 플레이어가 로열 플러시를 가진 척 연기하는 것과 같습니다.
  • 침묵 (The Silence): 실제로 게임이 끝났을 때, 패배자들은 "좋은 게임이었다"라거나 "당신이 이겼다"라는 말을 거의 하지 않았습니다. 그들은 마지막 순간까지 계속 대화를 이어갔습니다.
  • 비밀 (The Secret): 가장 흥계로운 발견은 **기만(Deception)**에 관한 것이었습니다. AI가 비밀 핵 사일로를 건설할 때, 메시지에서 이를 언급하는 경우가 드물었습니다. 대신 "우리는 그저 평화롭게 농사를 짓고 있습니다"라고 말하면서 뒤로는 몰래 폭탄을 만들었습니다. 하지만 일단 폭탄이 발사 준비가 되면, 그들은 종종 이를 요란하게 공표했습니다. AI는 준비 과정은 숨기지만, 실행은 숨기지 않는 법을 배운 것으로 보입니다.

5. 진짜 테스트: 신뢰성 vs 지능

이 논문은 중요한 질문을 던집습니다: 더 많이 생각하는 것이 승리로 이어지는가?

  • 발견: 반드시 그렇지는 않습니다. 가장 많은 시간 동안 "생각"(토큰 처리)을 한 AI가 항상 승리한 것은 아니었습니다.
  • 진정한 승자: 가장 자주 승리한 AI는 실수를 가장 적게 한 AI였습니다. 이 게임에서는 보이지 않는 안개 지역으로 유닛을 이동시키려 하면, 게임은 그 명령을 무시합니다. 그러면 당신은 턴을 잃게 됩니다.
  • 교훈: 최고의 플레이어는 가장 똑똑한 철학자가 아니라, 가장 신뢰할 수 있는 군인이었습니다. 게임의 흐름을 놓치지 않고, 적의 위치를 기억하며, 불가능한 일을 시도하지 않은 AI가 승리했습니다. 논문은 복잡한 현실 세계의 과업에서, 천재가 되는 것보다 실수하지 않는 것이 더 중요할 수 있음을 시사합니다.

6. 이것이 왜 중요한가 (논문에 따르면)

대부분의 AI 테스트는 팝 퀴즈와 같습니다. "이 수학 문제를 풀라"라고 하는 식이죠. AI는 문제 전체를 보고 답을 내놓기만 하면 됩니다.
Age of LLM은 다릅니다. 이것은 다음과 같은 조건이 붙은 생존 게임입니다:

  • 모든 것을 볼 수 없습니다.
  • 어제 무슨 일이 있었는지 기억해야 합니다.
  • 엄격한 규칙을 따라야 하며, 그렇지 않으면 페널티를 받습니다.
  • 당신에게 거짓말을 할 수도 있는 상대와 대화해야 합니다.

논문은 이것이 AI가 단순히 교과서의 사실을 암송하는 수준을 넘어, 실제로 어떻게 "사고"하는지를 보여주는 더 나은 방법이라고 결론짓습니다. 이는 AI가 현실 세계에서 유용해지기 위해서는 똑똑해지는 것만큼이나 신뢰할 수 있는 것(사실을 지어내지 않거나 규칙을 잊지 않는 것)이 중요하다는 것을 보여줍니다.

요약하자면: AI 모델들은 안개 낀 전쟁 게임을 수행했습니다. 대부분 핵 미사일 경로를 선택했습니다. 채팅에서는 거짓말을 많이 했습니다. 그리고 승자는 가장 많이 생각한 존재가 아니라, 가장 어처구니없는 실수를 적게 한 존재였습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →