← 최신 논문
💻 computer science

Key-Gram: Extensible World Knowledge for Embodied Manipulation

Key-Gram은 외부 메모리에 작업별 사전 지식을 저장하여 효율적인 검색과 주입을 가능하게 함으로써 확장 가능한 언어적 세계 지식과 신체 조작의 시각적 추론을 분리하는 조건부 메모리 프레임워크로, 이를 통해 다양한 벤치마크에서 구성적 그라운딩, 전이 및 실제 성능을 크게 향상시킵니다.

원저자: Jingjing Fan, Siyuan Li, Botao Ren, Zhidong Deng

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingjing Fan, Siyuan Li, Botao Ren, Zhidong Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 요리하는 법을 가르친다고 상상해 보세요. 로봇에게 복잡한 지시를 내립니다: "노란색과 흰색 머그잔을 전자레인지에 넣고 문을 닫아라."

현재의 로봇 두뇌 (AI 모델) 는 정확히 같은 순간에 두 가지 매우 다른 일을 동시에 하려고 시도합니다. 이로 인해 사고 과정에서 교통 체증이 발생합니다:

  1. "무엇" 작업: 세상에 관한 사실을 기억하는 것 (예: "전자레인지에는 문이 있다", "머그잔은 깨지기 쉽다", "노란색과 흰색 머그잔이 존재한다").
  2. "어떻게" 작업: 비디오 피드를 관찰하고 물리적 움직임을 파악하는 것 (예: "팔이 너무 왼쪽에 있으니 오른쪽으로 이동하라", "손잡이를 잡으라").

대부분의 기존 로봇에서는 이 두 가지 작업이 하나의 거대한 두뇌로 뭉쳐져 있습니다. "사실"과 "비디오"가 주의를 얻기 위해 경쟁합니다. 마치 시끄러운 군중이 한 명의 화자를 듣으려 애쓰는 것과 같습니다. 로봇에게 새로운 사실 (예: "전자레인지에 금속을 넣지 마라") 을 배우게 하려면, 종종 두뇌 전체를 다시 훈련시켜야 합니다. 이는 느리고 위험한데, 그 이유는 로봇이 팔을 움직이는 방법을 잊어버릴 수 있기 때문입니다.

해결책: Key-Gram

이 논문은 로봇의 두뇌를 조직하는 새로운 방법인 Key-Gram을 소개합니다. 이를 로봇이 즉시 넘겨볼 수 있는 스마트한 외부 노트를 제공하는 것이라고 생각하세요.

간단한 비유를 들어 작동 방식을 설명하겠습니다:

1. "인덱스 카드" 시스템 (분해)

로봇은 "노란색과 흰색 머그잔을 전자레인지에 넣으라"는 문장 전체를 읽는 대신, Key-Gram이라고 불리는 작고 구체적인 인덱스 카드로 분해합니다.

  • 카드 A: "머그잔을 전자레인지에 넣으라"
  • 카드 B: "전자레인지 문을 닫으라"
  • 카드 C: "노란색과 흰색 머그잔"

2. "즉시 검색" (해싱)

로봇은 정답을 찾기 위해 도서관 전체를 읽지 않습니다. 정답이 저장된 노트의 정확한 페이지로 즉시 이동할 수 있도록 마법 같은 해시 코드 (바코드 스캐너와 유사) 를 사용합니다.

  • 카드 A 를 찾아 "전자레인지에는 문이 있다"는 규칙을 찾습니다.
  • 카드 C 를 찾아 "이것은 특정 유형의 머그잔이다"는 규칙을 찾습니다.

이 검색은 즉각적 (O(1)O(1)) 입니다. 즉, 노트에 10 페이지가 있든 100 만 페이지가 있든 소요되는 시간은 동일합니다.

3. "스마트 어시스턴트" (융합)

로봇이 노트에서 이러한 사실들을 꺼내오면, 단순히 화면에 나열하지 않습니다. 스마트 필터 (게이트) 를 사용하여 언제 그리고 어디서 이를 사용할지 결정합니다.

  • 로봇이 전자레인지 문을 볼 때, 필터는 "이봐, '문 닫기' 사실을 보라!"라고 말합니다.
  • 로봇이 머그잔을 볼 때, 필터는 "이봐, '노란색과 흰색 머그잔' 사실을 보라!"라고 말합니다.

주요 로봇 두뇌 (비전 백본) 는 이제 어려운 부분에 완전히 집중할 수 있습니다: 비디오를 관찰하고 팔을 움직이는 것. 사실을 기억하려고 에너지를 낭비할 필요가 없습니다. 필요할 때 노트에 물어보기만 하면 됩니다.

이것이 큰 문제인 이유

이 논문은 이 접근 방식이 세 가지 주요 문제를 해결한다고 주장합니다:

  • "망각" 더 이상 없음: 사실들이 별도의 노트에 있기 때문에, 로봇의 두뇌를 다시 작성하지 않고도 새로운 페이지 (새로운 지식) 를 추가할 수 있습니다. 로봇에게 토스터에 대해 가르치고 싶다면, 노트에 새로운 페이지를 추가하기만 하면 됩니다. 로봇의 팔을 움직이는 능력은 정확히 그대로 유지됩니다.
  • 복잡한 작업 수행 능력 향상: 테스트에서 Key-Gram 을 사용하는 로봇은 긴 다단계 작업 (예: 빵을 분류한 후 상자에 넣고, 그 상자를 이동하는 작업) 을 훨씬 더 잘 수행했습니다. "사실"이 항상 노트에 바로 있기 때문에 중간 단계를 혼동하거나 잊어버리지 않았습니다.
  • 새로운 조합 처리: 연구자들이 로봇이 이전에 함께 본 적이 없는 물체들을 섞고 매칭했을 때 (예: 펜과 라이터를 한 쌍으로 들어 올리는 작업은 처음), Key-Gram 로봇이 훨씬 더 자주 성공했습니다. 그들은 "펜 들기" 사실과 "라이터 들기" 사실을 즉시 결합할 수 있었습니다.

결과

연구자들은 시뮬레이션 로봇과 실제 양팔 로봇에서 이를 테스트했습니다.

  • 시뮬레이션 내에서: 로봇들은 어려운 작업에서 성공률을 약 30% 향상시켰습니다.
  • 실제 세계에서는: 실제 로봇 팔에서 복잡한 조립 작업의 경우 개선 효과가 더욱 두드러져, 성공률이 52% 에서 66% 로 뛰어올랐습니다 (상대적 이득 27%).

결론

Key-Gram 은 로봇에게 사실에 대한 별도이고 확장 가능한 백과사전을 제공하는 동시에, 주요 두뇌가 물리적 작업을 수행하는 것에 전념하도록 합니다. 이 분리는 로봇을 더 똑똑하게 만들고, 새로운 지시에 더 적응하며, 이미 알고 있는 것을 잊을 가능성을 줄여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →