← 최신 논문
💬 NLP

Limited Linguistic Diversity in Embodied AI Datasets

본 논문은 널리 사용되는 비전 - 언어 - 행동 (VLA) 데이터셋에 대한 체계적인 감사를 제시하여, 이러한 데이터셋이 주로 제한된 언어적 다양성을 가진 반복적이고 템플릿과 같은 지시에 의존하고 있음을 드러냄으로써 언어 범위를 확장하기 위한 더 원칙적인 데이터셋 선별 및 보고의 필요성을 강조합니다.

원저자: Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 집안일을 어떻게 하는지 가르치려 한다고 상상해 보세요. 인간이 이러한 작업을 수행하는 모습을 보여주는 방대한 양의 비디오 녹화 자료와, 작업 중 인간이 말한 내용을 담은 음성 녹음이 각각 포함되어 있습니다. 이 자료 모음이 바로 '데이터셋'입니다.

이 논문은 바로 그 자료 모음에 대한 언어적 감사와 같습니다. 저자들은 현대의 '비전 - 언어 - 행동 (Vision-Language-Action, VLA)' 로봇을 훈련시키는 데 가장 널리 사용되는 자료 모음들을 살펴봤습니다. 이러한 시스템은 세상을 보고, 언어를 이해하며, 팔을 움직입니다. 그리고 저자들은 단순한 질문을 던졌습니다: "이 책들 안에 있는 언어는 얼마나 다양한가?"

다음은 그들이 발견한 바를 간단한 비유로 설명한 것입니다:

1. "고장 난 레코드" 문제

저자들은 이러한 로봇 훈련 자료 모음이 놀라울 정도로 반복적임을 발견했습니다. 마치 언어를 배우려는데 교과서에는 오직 한 문장만 있는 것과 같습니다: "빨간 컵을 들어 올리세요." 그리고 다음 10,000 페이지 동안 그 책은 오직 "빨간 컵을 들어 올리세요," "빨간 컵을 들어 올리세요," 그리고 *"빨간 컵을 들어 올리세요"*라고만 반복합니다. 가끔은 컵을 "파란 컵"으로 바꾸는 정도입니다.

  • 발견: RT-1 과 같은 주요 데이터셋에서 2% 미만의 명령어만이 고유합니다. 나머지는 동일한 몇 가지 명령의 복사본이거나 약간의 변형일 뿐입니다.
  • 비유: 마치 DJ 가 플레이리스트에 단 한 곡만 가지고 있는 것과 같습니다. 속도를 높이거나 늦출 수는 있지만, 다른 곡은 절대 재생하지 않습니다. 로봇은 명령의 의미가 아니라 명령의 소리를 인식하도록 훈련받습니다.

2. "작은 어휘" 상자

명령어가 너무 반복적이기 때문에, 로봇들은 매우 제한된 어휘로 학습하고 있습니다.

  • 발견: 일부 데이터셋은 수천 가지 행동을 설명하는 데 49 개의 고유 단어만을 사용합니다.
  • 비유: 복잡한 영화 줄거리를 오직 "가라," "멈춰," "빨강," 그리고 "공"이라는 단어만으로 설명하려 한다고 상상해 보세요. 기본적인 아이디어는 전달할 수 있지만, 뉘앙스, 예외 사항, 또는 복잡한 상황을 설명할 수는 없습니다. 로봇들은 몇 개의 동사와 명사만을 아는 "단어 감옥"에 갇혀 있습니다.

3. 논리의 "평탄한 땅"

이 논문은 문장의 구조를 살펴봤습니다. 실제 인간의 언어는 굴곡과 논리로 가득 차 있습니다. 우리는 "불이 빨간색이면 건너지 마라," 또는 "뜨거운 팬을 만지지 마라," 혹은 *"사과를 집어 들고 가방에 넣어라"*와 같은 말을 합니다.

  • 발견: 로봇 데이터셋은 거의 완전히 "평탄"합니다. 다음 요소들이 빠져 있습니다:
    • 부정: "아니"나 "하지 마"와 같은 단어는 명령어의 2% 미만에서 나타납니다.
    • 조건문: "만약"이나 "그렇지 않으면"과 같은 단어는 거의 존재하지 않습니다.
    • 복잡성: 명령어는 보통 단순한 1 단계 명령입니다.
  • 비유: 로봇들은 완벽하게 직선적이고 예측 가능한 세상을 항해하도록 가르침을 받고 있습니다. 그들은 "만약에"라는 시나리오를 처리하거나 위험한 행동을 스스로 멈추는 방법을 배우지 못했습니다. 만약 이 데이터로 훈련된 로봇에게 *"컵을 떨어뜨리지 마라"*고 말하면, 로봇은 "마라"라는 단어가 무엇을 의미하는지 이해하지 못할 수 있습니다. 왜냐하면 그 단어를 들어본 적이 없기 때문입니다.

4. "템플릿" 공장

저자들은 이러한 데이터셋 중 많은 부분이 "템플릿"을 사용하여 생성되었음을 발견했습니다.

  • 비유: 빈칸을 채우는 '매드립스 (Mad Libs)' 게임을 상상해 보세요. 데이터셋 제작자들은 [위치] 근처의 [대상] 을 [동작] 하라와 같은 템플릿을 작성했습니다. 그들은 단순히 "사과"를 "오렌지"로, "테이블"을 "카운터"로 바꾸었을 뿐입니다.
  • 결과: 이는 실제 인간들이 서로 대화하는 방식과 같지 않은 "로봇 같은" 말투를 만들어냅니다. 이는 실제 대화의 자연스러운 흐름, 은어, 또는 다양한 문장 구조가 결여되어 있습니다.

5. 비교: 로봇 vs 인간

주장을 입증하기 위해 저자들은 이러한 로봇 데이터셋을 일반 채팅봇 (휴대전화에서 대화하는 것들) 을 훈련시키는 데 사용된 데이터셋과 비교했습니다.

  • 발견: 채팅봇 데이터셋은 수백만 개의 서로 다른 목소리, 억양, 그리고 문장 구조가 있는 분주한 도시와 같습니다. 반면 로봇 데이터셋은 모두가 같은 세 가지 구절을 속삭이는 조용하고 텅 빈 복도와 같습니다.
  • 교훈: 로봇 데이터셋은 크기(수백만 개의 비디오) 는 거대하지만, 언어적 다양성은 미미합니다.

논문이 제안하는 것 (해결책)

저자들은 로봇이 고장 난 것이라고 말하지 않습니다. 그들은 사용 설명서가 너무 단순하다고 말합니다. 로봇을 더 똑똑하고 유연하게 만들기 위해 다음과 같은 조치가 필요하다고 제안합니다:

  1. 데이터 증강: AI 를 사용하여 단순한 명령어를 더 복잡하고 다양한 문장으로 다시 작성합니다 (예: "컵을 들어 올리세요"를 "만약 컵이 가득 차 있지 않다면 그 컵을 잡아라"로 변환).
  2. 더 나은 데이터 수집: 인간이 작업을 수행하는 모습을 녹화할 때, 경직된 대본에 머무르는 대신 자연스럽게 말하고, "만약/그러면" 논리를 사용하며, 적절할 때 "하지 마라"라고 말하도록 장려합니다.

요약하자면: 이 논문은 우리가 "전문가" 데이터 (반복적이고 단순한 명령) 를 사용하여 로봇을 "일반주의자"(어떤 일이든 처리할 수 있을 만큼 똑똑한 존재) 로 가르치려 한다고 주장합니다. 이를 해결하기 위해 우리는 로봇에게 훨씬 더 풍부하고 다양한 어휘와 복잡한 논리에 대한 더 나은 이해를 제공해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →