Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
본 논문은 LLM 기반 데이터 합성 전략을 통해 구축된 특수하게 훈련된 생성형 검증기를 활용하여 후보 행동을 샘플링하고 가장 신뢰할 수 있는 행동을 선택함으로써, 다중 모달 대규모 언어 모델 기반의 구체적 에이전트의 강건성을 향상시키는 테스트 시간 프레임워크인 검증기 안내 행동 선택 (VeGAS) 을 제안하며, 이는 기본 정책을 수정하지 않고도 복잡한 장기 작업에서 상당한 성능 향상을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 로봇에게 집 청소를 가르치고 있다고 상상해 보세요. 로봇에게 간단한 지시를 내립니다: "스포츠 용품을 찾아서 카운터 위에 올려놓아라."
과거에 똑똑한 로봇에게 이런 일을 시켰다면, 로봇은 빠르게 훑어보고 다음에 무엇을 해야 할지 추측한 뒤 본인이 본 첫 번째 물건을 바로 집어 들었을 것입니다. 로봇이 공인 줄 알고 스펀지를 집어 들었다면, 로봇은 실패했을 것이며 전체 작업이 망가질 때까지 자신이 실수를 저질렀다는 사실을 깨닫지 못했을 것입니다. 이는 시험을 치르는 학생이 머릿속에 떠오르는 첫 번째 답을 적어내어 검토도 하지 않은 채 제출하는 것과 같습니다.
이 논문은 이러한 문제를 해결하기 위해 VEGAS(Verifier-Guided Action Selection, 검증자 안내 행동 선택) 라는 새로운 방법을 소개합니다. VEGAS 는 로봇이 행동하기 전에 '두 번째 의견'을 듣는 것과 같습니다.
문제: '충동적인' 로봇
현재의 로봇들은 매우 똑똑한 AI 모델(멀티모달 대규모 언어 모델이라고 함) 에 의해 구동됩니다. 이들은 언어를 이해하고 이미지를 파악하는 데 뛰어납니다. 하지만 이들은 다소 충동적인 천재와 같습니다. "바나나" 대신 "노란색으로 구부러진 과일"을 찾거나, 캐비닛에 넣기 전에 사과를 닦는 것과 같이 까다로운 상황에 직면했을 때, 그들은 종종 서둘러 답을 내립니다. 초기에 사소한 실수를 저지르면, "잠깐, 이게 정말 맞는 걸까?"라고 멈춰서 생각하지 않기 때문에 전체 계획이 무너집니다.
해결책: '한 번 더 생각하기' 전략
저자들은 간단하지만 강력한 변화를 제안합니다: 행동하기만 하지 말고, 두 번 생각한 뒤 한 번 행동하라.
VEGAS 가 어떻게 작동하는지 요리 비유를 들어 설명해 보겠습니다:
- 요리사 (정책): 로봇이 레시피를 따라 하려는 요리사라고 상상해 보세요. 재료를 하나 집어 냄비에 던져 넣는 대신, 요리사는 이제 멈춥니다.
- 테이스팅 메뉴 (샘플링): 요리사는 현재 단계를 해결할 16 가지의 서로 다른 방법을 생각해 냅니다. "토마토를 집어라", "양파를 집어라", "먼저 냉장고로 가라" 등등. 요리사는 각 옵션이 왜 좋은지 설명하는 작은 메모 (생각의 사슬) 를 작성합니다.
- 비평가 (검증자): 이것이 마법 같은 부분입니다. 요리사는 첫 번째 아이디어만 선택하지 않습니다. 모든 16 가지 아이디어를 실수를 찾아내도록 훈련된 전문 AI 인 비평가에게 넘깁니다.
- 비평가는 레시피와 요리사의 메모를 읽습니다.
- 비평가는 말합니다: "옵션 1 은 틀렸습니다. 공이 아니라 스펀지를 집었기 때문입니다."
- "옵션 2 는 틀렸습니다. 이미 닫혀 있는 전자레인지 열려고 했기 때문입니다."
- "옵션 3 이 완벽합니다!"
- 최종 행동: 요리사는 비평가가 '좋음' 표시를 한 한 가지 행동만 실행합니다.
비밀 재료: 비평가 훈련
"비평가로 그냥 아주 똑똑한 AI 를 쓸 수 있지 않나?"라고 생각하실 수 있습니다. 저자들은 이를 시도해 보았으나 실패했습니다. 범용 AI 는 로봇의 구체적인 실수를 잡아내기에는 너무 예의 바르거나 너무 모호합니다.
이를 해결하기 위해 저자들은 합성 실패 공장을 고안해 냈습니다.
- 그들은 수천 개의 성공적인 로봇 작업을 가져왔습니다.
- 강력한 AI 를 이용해 이를 고의적으로 망가뜨렸습니다. 로봇이 잘못된 물건을 집게 하거나, 단계를 건너뛰게 하거나, 잘못된 문을 열게 했습니다.
- 그런 다음 AI 에게 각 실수가 왜 나쁜지 설명하는 보고서를 작성하도록 요청했습니다.
- 그들은 이러한 "가짜 실수"와 "가짜 보고서"를 이용해 비평가를 훈련시켰습니다.
이는 위험한 행동을 하는 사람들의 수천 개의 영상을 보여주고 정확히 왜 그것이 위험한지 설명함으로써 안전 검사관을 훈련시키는 것과 같습니다. 이제 실제 로봇이 행동할 때, 비평가는 그러한 구체적인 오류들을 찾아내는 전문가가 됩니다.
결과
저자들은 로봇이 집안일을 해야 하는 두 가지 가상 세계 (Habitat 와 ALFRED) 에서 이를 테스트했습니다.
- VEGAS 없이: 로봇은 약 65% 의 작업을 올바르게 수행합니다.
- VEGAS 로: 로봇은 약 71% 를 올바르게 수행합니다.
- 가장 어려운 작업에서: 개선 폭은 매우 컸습니다. 이전보다 36% 까지 향상되었습니다.
이 논문은 로봇이 여러 옵션을 생성하게 하고 전문적인 '비평가'가 가장 좋은 것을 선택하게 함으로써, 로봇이 훨씬 더 신뢰할 수 있게 된다는 것을 보여줍니다. 특히 지시가 까다롭거나 상황이 새로운 경우 더욱 그렇습니다.
요약
이 논문은 이것이 내일 질병을 치료하거나 자동차를 운전하게 해줄 것이라고 주장하지 않습니다. 단순히 집안일을 하는 로봇에게 있어 작업을 확인하기 위해 속도를 늦추는 것(훈련된 검증자 사용) 은 로봇을 훨씬 더 똑똑하게 만들고, 상황이 복잡해질 때 실패할 가능성을 크게 줄인다고 주장할 뿐입니다. 이는 "추측하고 희망하는" 로봇을 "계획하고, 확인하고, 실행하는" 로봇으로 바꿉니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.