← 최신 논문
💬 NLP

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

이 논문은 지식이 역할별로 격리된 개체들 사이에 분할되어 있는 사회적 분산 작업 환경에서 생성적 에이전트를 평가하기 위한 프레임워크인 Incognita를 소개하며, 현재의 모델들이 지식 인출 및 성급한 최종화 감소와 같은 개선된 행동을 보여줌에도 불구하고 전반적인 성공률은 여전히 낮다는 것을 입증한다.

원저자: Dan C. Hsu, Luke Lu

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dan C. Hsu, Luke Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "비밀 레시피" 문제

당신이 복잡한 케이크를 구우려고 하는데, 전체 레시피가 없다고 상상해 보세요. 대신 재료와 지침이 방 안에 있는 다섯 명의 사람에게 흩어져 있습니다:

  • A라는 사람은 고객의 이름과 주소를 알고 있습니다.
  • B라는 사람은 어떤 케이크가 재고로 있는지 알고 있습니다.
  • C라는 사람은 환불을 처리하는 방법을 알고 있습니다.
  • D라는 사람은 주문을 변경하는 규칙을 알고 있습니다.
  • E라는 사람은 고객이며, 기술적인 세부 사항은 모르고 자신이 무엇을 사고 싶은지만 알고 있습니다.

만약 당신(AI 에이전트)이 단순히 A에게 주소를 물어본다면, 당신은 케이크를 구울 수 없습니다. 당신은 케이크를 만들기 위해 B에게 재고를 확인하고, C에게 결제를 요청하고, 그 다음 단계로 넘어가야 합니다. 만약 레시피를 짐작하거나 너무 일찍 대화를 중단한다면, 케이크는 실패하게 됩니다.

이 논문은 Incognita라고 불리는 새로운 AI 에이전트 테스트 방식을 소개합니다. 이는 AI가 단순히 하나의 지시 목록을 따르는 것을 넘어, 사회적 환경에서 실제로 문제를 해결할 수 있는지 확인하기 위해 이 "지식이 흩어진" 게임을 수행하도록 강제합니다.

설정: 새로운 게임 보드

연구진은 기존의 테스트(AI를 위한 표준 운전 시험과 같은 tau-bench)를 가져와 이를 해체했습니다. 그들은 하나의 "모든 것을 아는" 시스템을 **사회적으로 분산된 작업 환경(Socially-Distributed Task Environment)**으로 변모시켰습니다.

이렇게 생각하면 쉽습니다:

  • 기존 방식: AI는 거대한 지도와 창고로 연결된 직통 전화기가 있는 관제실에 앉아 있습니다. AI는 모든 것을 즉시 보고 모든 것을 할 수 있습니다.
  • Incognita 방식: AI는 바쁜 사무실에 있습니다. AI는 특정 동료(전문가 엔티티)나 고객에게 한 번에 하나의 메시지만 보낼 수 있습니다. AI는 적절한 사람에게 묻지 않는 한 창고를 볼 수도, 고객의 개인 메모를 볼 수도 없습니다.

게임의 작동 방식

AI는 이 환경에서 세 가지 뚜로 다른 역할을 수행합니다.

  1. 탐색자 (질문하기):
    AI는 누가 무엇을 알고 있는지 알아내야 합니다. AI는 "고객"(목표를 보유함)과 "전문가"(데이터를 보유함)에게 질문을 던집니다. 이는 마치 탐정이 사건을 구성하기 위해 목격자들을 심문하는 것과 같습니다. AI는 단순히 추측해서는 안 되며, 단서를 모아야 한다는 것을 배웁니다.

  2. 수행자 (행동하기):
    충분한 단서를 얻었다면, AI는 행동을 취해야 합니다. 하지만 AI는 스스로 무언가를 "할" 수 없습니다. 대신 특정 작업(예: "배송 주소 변경")을 수행하도록 전문가에게 요청해야 합니다. 시스템은 이 요청이 타당한지 확인합니다. 만약 AI가 아직 배송되지 않은 주문에 대해 주소를 변경하려고 하면, 시스템은 "안 된다"고 말합니다. 이는 AI의 행동이 환각(hallucination)이 아니라 현실에 **근거(grounded)**하도록 보장합니다.

  3. 판사 (종료 결정하기):
    가장 어려운 부분은 언제 일이 끝났는지 아는 것입니다. AI는 "좋아, 필요한 정보는 다 얻었고, 작업도 마쳤다. 이제 끝났다"라고 결정해야 합니다. 만약 AI가 너무 일찍 멈추면(조기 종료), 실패합니다. 만약 영원히 질문만 계속한다면, 이 또한 실패입니다.

연구 결과

연구진은 세 가지 버전의 AI(이름을 각각 "주니어", "미들", "시니어" 에이전트라고 부릅시다)를 18개의 서로 다른 작업에 대해 테스트했습니다.

  • 주니어 에이전트: 매우 성급했습니다. 아무에게도 묻지 않고 즉시 작업을 끝내려 했습니다. 규칙이나 고객의 요구사항을 알지 못했기 때문에 100% 확률로 실패했습니다.
  • 미들 에이전트: 질문을 던지고 더 많은 사람과 대화를 시작했습니다. 몇 가지 작업을 성공적으로 수행했지만(성공률 약 9%), 여전히 가끔 너무 빨리 포기하곤 했습니다.
  • 시니어 에이전트: 탐색 능력이 훨씬 뛰어났습니다. 더 많은 전문가와 대화하고, 더 깊은 질문을 던졌으며, 더 많은 행동을 시도했습니다. 이 에이전트는 약 17%의 성공률을 기록했습니다.

핵심 요점:
"시니어" 에이전트조차 완벽하지는 않았습니다. 여전히 성공보다 실패하는 경우가 더 많았습니다. 그러나 이 논문은 진보가 최종 점수가 아닌 '행동'에서 나타난다는 점을 보여줍니다. 더 똑똑한 에이전트들은 단순히 정답을 더 자주 맞히는 것이 아니라, 작업 방식 자체를 바꿨습니다:

  • 더 많은 숨겨진 정보를 요청했습니다.
  • 더 다양한 사람들과 접촉했습니다.
  • 더 많은 실제 행동(예: 데이터베이스 업데이트)을 시도했습니다.
  • 추측하는 것을 멈추고, 충분한 증거를 모을 때까지 기다린 후에야 "끝났다"라고 말했습니다.

이것이 왜 중요한가

이 논문은 AI가 단순히 작업을 완료했는지만을 보고 "똑똑하다"고 판단해서는 안 된다고 주장합니다. 우리는 AI가 세상과 어떻게 상호작용하는지를 관찰해야 합니다.

현실 세계에서 지식은 흩어져 있습니다. 단 한 명의 사람(또는 AI)이 모든 것을 알 수는 없습니다. 진정으로 효과적인 AI가 되기 위해서는 다음을 알아야 합니다:

  1. 언제 질문할 것인가 (탐색).
  2. 누구에게 질문할 것인가 (출처 선택).
  3. 언제 행동할 것인가 (근거 있는 실행).
  4. 언제 멈출 것인가 (완료에 대한 확신).

Incognita는 이 네 가지 과정이 실시간으로 일어나는 것을 관찰할 수 있게 해주는 도구이며, 이를 통해 AI 에이전트가 정확히 어디에서 막히는지, 그리고 어떻게 더 나은 협업을 하도록 학습하고 있는지를 보여줍니다.

한 문장 요약

이 논문은 AI 에이전트가 흩어진 정보를 모으기 위해 다양한 "전문가"들과 대화하며 문제를 해결해야 하는 새로운 테스트 환경을 구축하였으며, 이를 통해 더 똑똑한 에이전트는 비록 최종 결과가 항상 완벽하지 않더라도 더 나은 질문을 던지고 적절한 순간을 기다리는 법을 배운다는 것을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →