← 최신 논문
🤖 AI

Humans' ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration

이 논문은 LLM 에이전트가 정렬된 정신 모델을 유지하고 인간의 협업 행동을 시뮬레이션하는 능력을 훈련하고 평가하는 데 있는 격차를 해소하기 위해 설계된, 맵 태스크(Map Task)에서의 인간 이인 협업으로부터 도출된 2,987개의 행동 수준 정신 모델 주석 데이터셋인 ALMANAC을 소개한다.

원저자: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaju Chen, Yuxuan Lu, Jiayi Su, Chaoran Chen, Songlin Xiao, Zheng Zhang, Yun Wang, Yunyao Li, Jian Zhao, Tongshuang Wu, Toby Jia-Jun Li, Dakuo Wang, Bingsheng Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 친구와 함께 보물 지도를 그리려고 노력 중이라고 상상해 보세요. 하지만 당신은 서로 다른 방에 있습니다. 오직 텍스트 채팅을 통해서만 대화할 수 있습니다. 한 사람(가이드)은 올바른 경로가 그려진 원래의 지도를 가지고 있습니다. 다른 한 사람(팔로워)은 랜드마크(산이나 다리 같은 것)만 있고 경로는 없는 빈 지도를 가지고 있습니다.

성공하기 위해서, 그들은 협력해야 합니다: 가이드는 경로를 설명하고, 팔로워는 그것을 그리려고 노력해야 합니다.

이것이 ALMANAC라는 새로운 연구 프로젝트의 핵심입니다. 여기는 연구진이 무엇을 했고 그것이 왜 중요한지에 대한 간단한 분석이며, 일상적인 비유를 사용했습니다.

1. 문제점: 로봇은 "수행"하는 데는 뛰어나지만, "함께 생각하는 것"에는 서툴다

현재의 AI 에이전트(고급 챗봇과 같은)는 명령을 따르는 데 매우 뛰어납니다. 만약 당신이 "항공권을 예약해 줘"라고 말하면, 그들은 해냅니다. 하지만 진정한 인간의 협업은 단순히 명령을 따르는 것이 아니라, **정신적 정렬(mental alignment)**에 관한 것입니다.

인간 팀을 재즈 밴드에 비유해 보세요. 그들은 단순히 악보를 읽는 것이 아닙니다. 그들은 끊임없이 서로의 소리를 듣고, 동료 연주자가 다음에 어떤 음을 연주할지 예측하며, 실시간으로 자신의 리듬을 조정합니다. 그들에게는 "공유된 정신 모델(shared mental model)"이 있습니다.

  • 자기 추론: "나는 왜 이 음을 연주하고 있는가?"
  • 파트너의 의도: "내 밴드 동료는 무엇을 하려고 하는가?"
  • 팀의 목표: "우리는 여전히 재즈 곡을 연주하고 있는가, 아니면 록 음악으로 흘러가고 있는가?"

이 논문은 현재의 AI가 자신의 악기만 완벽하게 연주할 줄 알 뿐, 나머지 밴드가 무엇을 생각하고 있는지는 전혀 모르는 로봇과 같다고 주장합니다. 기존의 데이터셋은 사람들이 무엇을 말했고 무엇을 했는지만 기록할 뿐, 그들의 머릿속에 있는 *이유(why)*는 놓치고 있습니다.

2. 해결책: ALMANAC ("마음을 읽는" 데이터셋)

연구진은 이를 해결하기 위해 ALMANAC라는 새로운 데이터셋을 구축했습니다. 그들은 위의 "지도 과업(Map Task)"을 가져와서 여기에 특별한 관찰 층을 추가했습니다.

데이터 수집 방법:

  1. 게임: 50명의 사람이 두 명씩 짝을 지어 지도 과업을 수행했습니다 (총 25쌍).
  2. 체크포인트: 과업의 25%, 50%, 75% 지점에 도달할 때마다 게임이 잠시 멈췄습니다. 플레이어들은 마이크를 통해 빠르게 답변해야 했습니다: "지금 우리의 목표가 무엇이라고 생각합니까?", "당신의 파트너가 무엇을 하려고 한다고 생각합니까?", "방금 왜 그런 행동을 했습니까?"
  3. 재생: 게임이 끝난 후, 플레이어들은 자신들의 행동을 다시 재생하여 보았습니다. 모든 개별 동작(선을 긋거나, 실수를 지우거나, 메시지를 보내는 등)에 대해, 그들은 자신의 정신 상태를 다시 라벨링했습니다.

결과:
그들은 2,987개의 구체적인 행동을 얻었으며, 모든 행동에 대해 다음을 기록했습니다:

  • 수행된 행동 (예: "선을 그음")
  • 팀 목표 (예: "우리는 다리와 산을 연결하려고 함")
  • 파트너의 의도 (예: "내 파트너가 방향에 대해 혼란스러워하고 있다고 생각함")
  • 자기 추론 (예: "산이 왼쪽에 있다고 생각해서 이 선을 그었음")
  • 근거(Rationale) (그들의 사고 과정을 설명하는 자유 형식의 설명)

3. 실험: AI는 "마음을 읽을" 수 있는가?

연구진은 여섯 가지 서로 다른 AI 모델(GPT-5.5 및 Claude와 같은 대형 모델 포함)을 테스트하여, 이 새로운 데이터셋을 사용하여 인간처럼 협력할 수 있는지 확인했습니다. 그들은 AI에게 두 가지 임무를 주었습니다:

  1. 다음 동작 예측: "지금까지 일어난 일을 바탕으로, 인간이 다음에 무엇을 할 것 같습니까?"
  2. 정신 상태 예측: "지금까지 일어난 일을 바탕으로, 인간은 현재 무엇을 생각하고 있습니까?"

연구 결과:

  • "무엇"은 쉽고, "왜"는 어렵다: AI 모델들은 다음 행동을 예측하는 데는 꽤 능숙했습니다 (예: "인간이 아마 선을 그을 것이다").
  • "마음"은 까다롭다: 모델들은 내부적인 생각(정신 모델)을 예측하는 데 어려움을 겪었습니다. 공유된 목표(예: "우리는 다리를 만들고 있다")는 꽤 잘 맞혔지만, 개인적이고 사적인 추론(예: "나는 긴장해서 이 선을 그었다")을 추측하는 데는 형편없었습니다.
  • 역할의 차이:
    • 가이드 (지시를 내리는 역할)는 정신적 예측이 더 어려웠는데, 이는 그들의 생각이 항상 말로 표현되지 않는 복잡한 공간적 계획을 포함하기 때문입니다.
    • 팔로워 (그리는 역할)는 정신적 예측이 더 쉬웠는데, 이는 그들의 생각이 가이드의 명시적인 지시에 의해 직접적으로 형성되기 때문입니다.
  • 학습의 효과: 이 특정 데이터셋을 사용하여 작은 AI 모델을 "교육"(미세 조정)했을 때, 그 모델은 인간의 행동을 시뮬레이션하는 능력이 향가졌으며, 거대하고 비싼 모델들을 거의 따라잡았습니다.

4. 결론

이 논문은 AI를 진정한 협력자로 만들기 위해서는 단순히 과업을 완료하는 법을 훈련시키는 것만으로는 부족하다고 결론짓습니다. 우리는 인간이 함께 일할 때 어떻게 생각하는지를 훈련시켜야 합니다.

ALMANAC는 인간의 행동과 이러한 "행동 수준의 정신 모델"을 결속시킨 최초의 데이터셋입니다. 이는 AI가 인간의 행동을 시뮬레이션하는 데는 점점 나아지고 있지만, 인간의 팀워크를 만드는 보이지 않는 내부적 추론을 이해하는 데는 여전히 어려움을 겪고 있음을 보여줍니다. 이 데이터셋은 AI가 단순히 명령을 맹목적으로 따르는 것이 아니라, 자신의 정신 모델을 인간의 모델과 일치시키도록 가르치는 데 필요한 "보조 바퀴"를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →