← 최신 논문
🤖 AI

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight는 세 가지 핵심 추상화(태스크, 리소스, 결과)를 통해 레짐 이질성(regime heterogeneity)을 보존함으로써 단일 런타임 상에서 전체 Physical AI 스택을 아우르는 통합 평가 인프라로서, 파편화된 멀티 하네스 방식으로는 달성할 수 없는 확장 가능한 벤치마킹과 교차 계층 회귀 진단을 가능하게 합니다.

원저자: Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 로봇이 되기 위해 학습 중인 한 학생을 채점하려 한다고 상상해 보세요. 이 학생은 서로 매우 다른 세 가지 '두뇌'를 함께 사용하고 있습니다:

  1. 철학자 (System 2): 이 부분은 생각하고, 계획하고, 지침을 읽습니다. 인간이 지도를 읽는 것과 같습니다. 느리게 작동하지만 깊게 생각합니다.
  2. 운동선수 (System 1): 이 부분은 세상을 보고 팔과 다리를 움직입니다. 체조 선수가 날아오는 공에 반응하는 것과 같습니다. 빠르게 작동하며 정밀함이 필요합니다.
  3. 반사 신경 (System 0): 이 부분은 로봇이 넘어지지 않도록 유지합니다. 당신의 속귀(내이)가 균형을 잡는 것과 같습니다. 초당 수천 번의 속도로 믿을 수 없이 빠르게 작동합니다.

문제점: "프랑켄슈타인" 채점 시스템
이 논문 이전에는, 이 로봇을 테스트하고 싶다면 서로 소통하지 않는 완전히 다른 세 가지 채점 시스템을 사용해야 했습니다.

  • 철학자를 테스트하기 위해서는 텍-기반 퀴즈 시스템을 사용했습니다.
  • 운동선수를 테스트하기 위해서는 비디오 게임 물리 엔진을 사용했습니다.
  • 반사 신경을 테스트하기 위해서는 고속 시뮬레이션을 사용했습니다.

만약 로봇이 과제를 실패한다면, 당신은 실패했는지 알 수 없었습니다. 철학자가 잘못된 지시를 내린 것일까요? 운동선수가 지시를 오해한 것일까요? 아니-면 반사 신경이 넘어지는 것을 막지 못한 것일까요? 그것은 마치 단서들이 세 가지 다른 언어로 쓰여 있고, 세 개의 서로 다른 서류함에 보관되어 있으며, 형사들은 서로 대화조차 하지 않는 미스터리 사건을 해결하려는 것과 같았습니다.

해결책: DeepInsight (유니버설 채점실)
저자들은 세 가지 두뇌를 동시에 처리할 수 있는 단 하나의 "채점실"인 DeepInsight를 구축했습니다. 철학자를 운동선수처럼 행동하도록 강요하는 대신, DeepInsight는 그들의 고유한 개성을 잃지 않으면서도 모두가 공존할 수 있게 해주는 유니버셜한 언어를 만듭니다.

이것이 어떻게 작동하는지 세 가지 간단한 비유를 통해 설명하겠습니다:

1. "배낭" (작업 추상화 - Task Abstraction)

로봇이 받는 모든 테스트를 등산객이라고 상상해 보세요. 어떤 등산객은 작은 배낭(빠른 텍스트 질문)을 메고 있고, 어떤 등산객은 거대한 텐트(복잡한 물리 시뮬레이션)를 메고 있습니다.

  • 기존 방식: 서로 다른 등산객을 운반하기 위해 서로 다른 트럭이 필요했습니다.
  • DeepInsight 방식: 모든 등산객은 표준 배낭을 받습니다. 트럭(시스템)은 배낭 안에 무엇이 들어있는지는 상관하지 않습니다. 그저 배낭을 운반할 뿐입니다. 등산객이 철학자이든 체조 선수이든, 그들은 모두 같은 트럭에 탑승합니다. 이를 통해 시스템은 혼란 없이 빠른 텍스트 테스트와 느린 물리 테스트를 동시에 실행할 수 있습니다.

2. "자판기" (자원 추상화 - Resource Abstraction)

어떤 테스트는 비용이 많이 들고 느린 반면(슈퍼컴퓨터가 생각하기를 기다리는 것처럼), 어떤 테스트는 빠르고 저렴합니다.

  • 기존 방식: 메인 매니저가 모든 것을 직접 하려고 했습니다. 만약 느린 컴퓨터가 끝나기를 기다리느라 막히게 되면, 다른 어떤 작업도 할 수 없었습니다. 전체 라인이 멈춰버리는 것입니다.
  • DeepInsight 방식: DeepInsight는 자판기를 사용합니다. 메인 매니저는 버튼을 눌러 "생각하는 기계"나 "물리 기계"를 요청하기만 하면 됩니다. 자판기는 뒤에서 복잡하고 느리거나 비싼 부분들을 처리합니다. 매니저는 결과가 필요할 때만 기계와 상호작용하며 자유롭고 빠르게 유지됩니다. 즉, 시스템이 느린 프로세스를 기다리느라 멈춰 서 있는 일이 발생하지 않습니다.

3. "단일 스토리북" (결과 추상화 - Result Abstraction)

  • 기존 방식: 철학자는 일기에 기록하고, 운동선수는 스케치북에 그림을 그리며, 반사 신경은 심박수를 기록했습니다. 만약 로봇이 넘어지면, 당신은 실수 원인을 찾기 위해 세 권의 서로 다른 책을 대조해야 했습니다.
  • DeepInsight 방식: 모든 단일 사건—모든 생각, 모든 움직임, 모든 심박수—은 정확히 동일한 형식의 하나의 거대한 스토리북에 기록됩니다.
    • 만약 로봇이 실패한다면, 당신은 스토리북을 넘겨보며 철학자가 언제 잘못된 아이디어를 주었는지, 운동선수가 그것을 어떻게 따르려 했는지, 그리고 반사 신경이 어떻게 그것을 구하려고 했는지 그 정확한 순간을 볼 수 있습니다.
    • 모든 것이 하나의 책에 담겨 있기 때문에, 어느 지점에서 사건의 사슬이 끊어졌는지 즉시 확인할 수 있습니다. 추측할 필요 없이, 스토리가 어느 계층이 실패했는지 정확히 알려줍니다.

이것이 왜 중요한가

이 논문은 DeepInsight가 단순한 새로운 도구가 아니라, 로봇을 테스트하는 새로운 사고방식임을 보여줍니다.

  • 빠릅습니다: 줄을 서서 기다리는 시간을 낭비하지 않기 때문에 기존 도구들보다 더 빠르게 테스트를 실행합니다.
  • 정확합니다: "철학자" 부분에 대해 기존의 가장 우수한 도구들과 동일한 점수를 얻어냄으로써, 규칙을 어기지 않음을 증명했습니다.
  • 확장 가능합니다: 하나의 컴퓨터에서 실행하거나 여러 대의 컴퓨터로 확장할 수 있으며, 재조정(re-tuning)할 필요가 없습니다.
  • 결정적인 승리 (진단): 가장 중요한 부분은 "단일 스토리북"입니다. 만약 로봇이 복잡한 과제에 실패한다면, DeepInsight는 다음과 같이 말해줄 수 있습니다: "철학자는 옳았고, 운동선수도 옳았지만, 반사 신경이 빙판에 미끄러졌습니다." 이 통합 시스템이 없었다면, 당신은 반사 신경이 문제였다는 것을 알지 못하고 대신 철학자를 탓했을지도 모릅니다.

요약하자면, DeepInsight는 로봇의 두뇌, 근육, 그리고 균형을 동시에, 같은 장소에서, 같은 노트를 사용하여 테스트할 수 있게 해주는 최초의 시스템이며, 이를 통해 당신은 마침내 이들이 어떻게 함께 작동하는지 이해할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →