← 최신 논문
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

이 논문은 일상적인 시나리오에서 인과적 상호작용 추론 능력을 평가하기 위해 50 가지 상호작용 작업과 1,000 개의 증강현실 원격 조작 데이터를 포함한 COIN 벤치마크를 제안하고, 현재 VLA 및 코드 기반 정책 모델들이 시각 이해와 운동 실행 간의 간극으로 인해 이러한 장거리 작업 수행에 한계가 있음을 규명합니다.

원저자: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"로봇이 인간처럼 생각하며 행동하는 능력"**을 평가하기 위해 만든 새로운 시험지, **COIN(Chain Of Interaction)**에 대한 이야기입니다.

기존의 로봇 연구들은 "상자를 들어라", "문을 열어라" 같은 단순한 명령을 잘 수행하는지만 확인했습니다. 하지만 현실 세계는 훨씬 더 복잡합니다. 예를 들어, **"냉장고에서 사과를 꺼내라"**는 명령을 내렸을 때, 로봇은 단순히 냉장고 문을 여는 것만으로는 부족합니다. 문이 잠겨 있다면 열쇠를 찾아야 하고, 사과가 다른 물건 뒤에 숨겨져 있다면 그 물건을 치워야 하며, 손이 닿지 않는다면 계단을 올라가야 할 수도 있습니다. 즉, 상황을 파악하고, 실패하면 다시 생각하고, 계획을 수정하며 행동하는 '상호작용적 추론' 능력이 필요합니다.

이 논문은 바로 이 능력을 측정하기 위해 COIN이라는 새로운 기준을 만들었습니다.

🍎 핵심 비유: "요리사 로봇의 시험"

이 논문의 내용을 쉽게 이해하기 위해 로봇을 '요리사'로, COIN 을 '요리사 실력 시험'으로 상상해 보세요.

1. 기존 시험지 vs. 새로운 시험지 (COIN)

  • 기존 시험지 (기존 벤치마크): "계란을 깨서 그릇에 넣으세요" 같은 아주 단순한 동작만 평가했습니다. 마치 요리사에게 "물 한 컵 따르세요"만 시켜본 것과 같습니다.
  • COIN (새로운 시험지): "냉장고에서 사과를 꺼내서, 식탁에 있는 접시에 담고, 만약 사과가 썩었다면 버리세요"처럼 복잡하고 긴 과정을 평가합니다. 이 과정에서는 로봇이 "아, 문이 잠겨 있네? 열쇠를 찾아야겠다", "아, 사과가 안 보이네? 다른 물건을 치워야겠다"라고 스스로 생각하며 행동을 바꿔야 합니다.

2. 시험의 3 단계 구성 (COIN-50, Primitive, Composition)

이 시험지는 난이도별로 3 단계로 나뉩니다.

  • COIN-Primitive (기본기): "문 열기", "물건 잡기", "밀기" 같은 기본 동작 20 가지를 평가합니다. 요리사가 칼질과 썰기 같은 기본기를 잘하는지 보는 단계입니다.
  • COIN-Composition (응용): 기본 동작을 살짝 변형한 문제입니다. "빨간 문은 열고, 파란 문은 닫아라"처럼 약간의 변화에 적응할 수 있는지 봅니다.
  • COIN-50 (최종 보스): 실제 생활과 같은 복잡한 상황 50 가지를 평가합니다. "냉장고 문이 잠겨 있고, 열쇠가 책장 뒤에 숨겨져 있으며, 사과가 그 아래에 있다"는 식의 긴 호흡의 미션입니다.

3. 데이터 수집: "저렴한 AR 원격 조종"

이 시험지를 만들기 위해 연구팀은 1,000 개 이상의 인간 실습 데이터를 모았습니다.

  • 재미있는 점: 보통 로봇 데이터를 모으려면 수천만 원짜리 고가의 장비를 쓰는데, 이 연구팀은 스마트폰과 AR(증강현실) 앱을 이용해 2 만 원도 안 되는 비용으로 데이터를 모았습니다. 마치 스마트폰으로 로봇의 손을 조종하는 것처럼, 사람이 스마트폰을 움직이면 로봇이 똑같이 따라 하게 한 것입니다.

4. 실험 결과: "로봇은 아직 초보입니다"

연구팀은 최신 AI 로봇 모델들 (VLA, CodeAsPolicy 등) 을 이 시험지에 풀어보게 했습니다. 결과는 충격적이었습니다.

  • 인간: 40%~100% 성공 (상황에 따라 다름).
  • 최고급 AI 로봇: 3% 미만의 성공률.

왜 실패했을까요?

  • 눈과 손의 괴리: AI 는 "상자를 들어야 한다"는 것을 눈으로 이해는 했지만, 실제로 손을 움직여 잡는 기술이 매우 불안정했습니다. (눈은 잘 보는데 손이 떨림)
  • 계획과 실행의 단절: "문을 여는 계획"을 세웠는데, 실제로 문이 잠겨 있을 때 "아, 잠겨 있네? 다른 방법을 찾아야지"라고 즉시 계획을 수정하지 못했습니다.
  • 새로운 상황 공포: 조금만 상황이 달라져도 (예: 문 손잡이 색이 달라짐) 완전히 망가졌습니다.

💡 결론: 앞으로의 방향

이 논문은 **"로봇이 진짜 인간처럼 복잡한 세상에서 일하려면, 단순히 명령을 따르는 것을 넘어, 상황을 보고 스스로 생각하고 행동을 바꿔야 한다"**는 사실을 증명했습니다.

현재의 AI 는 아직 요리사로서의 기본기조차 부족하며, 특히 실수했을 때 다시 생각하고 대처하는 능력이 매우 떨어집니다. 연구자들은 앞으로 로봇이 더 유연하게 움직이고, 눈과 손의 협응을 잘하며, 실패를 통해 배우도록 시스템을 개선해야 한다고 제안합니다.

한 줄 요약:

"로봇에게 '냉장고에서 사과 꺼내라'고 시켰더니, 문이 잠겨 있다는 사실도 모르고 계속 문을 밀다가 지쳐서 멈춰버린 상황. COIN 은 이런 로봇이 상황을 보고 스스로 생각하며 문제를 해결하는 능력을 평가하는 새로운 시험지입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →