← 최신 논문
🤖 AI

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM은 LLM이 시각-언어 모델(VLM)을 능동적으로 비판하고 탐색하여 과업 중심의 장면 이해를 생성하는 동적인 질의응답 파이프라인을 채택함으로써, 체화된 에이전트(embodied agents)의 인지-추론-결정 간 격차를 메우는 완전 자동화된 프레임워크이며, ALFWorld 및 Room-to-Room과 같은 벤치마크에서 최신 모델들을 크게 능가합니다.

원저자: Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어두운 방 안에서 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 하지만 당신은 한 번에 아주 작은 빛의 틈새만을 볼 수 있습니다. 당신에게는 사진을 찍고 보이는 것을 설명할 수 있는 사진가(시각 모델)와, 논리와 계획에는 천재적이지만 앞을 볼 수 없는 탐정(언어 모델)이 있습니다.

현재 대부분의 로봇 시스템에서는 사진가가 빠르게 한 번 훑어보고는 "탁자와 의자가 보입니다"와 같은 일반적인 설명을 작성하여 탐정에게 전달합니다. 그러면 탐정은 달걀을 집어서 데우는 방법을 알아내려 애씁니다. 문제는? 사진가가 달걀이 냅킨 아래에 숨겨져 있다는 사실이나, 마이크로웨이브가 사실은 토스터기라는 사실을 놓쳤을 때 발생합니다. 불완전한 정보로 작업하는 탐정은 실수를 저지르게 됩니다.

PRISM은 이 과정을 일방적인 정보 전달이 아닌 역동적인 대화로 바꿈으로써 판도를 바꿉니다.

PRISM 방식: 전화 통화 중인 탐정과 사진가

단순히 정적인 보고서를 넘겨주는 대신, PRISM은 사진가와 탐정 사이에 **폐쇄 루프형 대화(closed-loop conversation)**를 설정합니다:

  1. 첫 번째 훑어보기: 사진가가 장면을 보고 대략적인 설명을 제공합니다.
  2. 탐정의 비판: 탐정은 설명을 읽고 목표(예: "달걀 데우기")를 확인합니다. 탐정은 즉시 정보의 공백을 찾아냅니다: "잠깐, 당신은 달걀이 어디 있는지, 혹은 마이크로웨이브가 있는지 말해주지 않았어요!"
  3. 표적 질문: 사진가에게 방 전체를 다시 설명하라고 요청하는 대신, 탐정은 구체적이고 목표 지향적인 질문을 던집니다: "마이크로웨이브가 보입니까?" 또는 "카운터 위에 달걀이 있습니까?"
  4. 구체적인 답변: 사진가는 정신적으로 초점을 맞추어 해당 질문에 대해서만 답변합니다.
  5. 최종 브리핑: 탐정은 원래의 설명에 새로운 답변들을 추가하여, 과제를 해결하는 데 정확히 필요한 내용이 포함된 완벽하고 간결한 요약본을 작성합니다.

이것이 왜 중요한가 (PRISM의 "마법")

이 논문은 이 방식이 세 가지 주요 문제를 해결한다고 주장합니다:

  • "환각(Hallucination)" 함정을 방지합니다: 만약 단순히 사진가에게 "마이크로웨이브를 찾아봐"라고 말한다면, 사진가는 목표에 부응하려다 보니 없는 마이크로웨이브를 상상해낼 수도 있습니다. PRISM은 초기 현실을 먼저 확인한 후 탐정이 질문을 던지게 함으로써, 사실 관계를 근거에 기반하게 하여 이를 방지합니다.
  • "노이즈"를 제거합니다: 질문을 할 때마다 저자가 답변을 강조하여 책 전체를 다시 붙여넣는 소설을 읽는다고 상상해 보세요. 그것이 다른 방식들이 하는 일입니다. PRISM은 새로운 정보를 가져와서 짧고 명확한 이야기로 엮어내는 숙련된 편집자와 같습니다. 이는 로봇이 올바른 결정을 내리는 것을 훨씬 쉽게 만듭니다.
  • 스스로 학습합니다: 이 시스템은 "냉장고를 확인하라"나 "가스레인지를 확인하라"와 같은 질문 목록을 작성하기 위해 인간의 도움을 받을 필요가 없습니다. 탐정(AI)이 특정 상황에 따라 어떤 질문을 던질지 스스로 결정합니다.

결과: 게임에서 더 뛰어난 성과를 내다

연구진은 이 "탐정-사진가" 팀을 두 가지 게임 같은 환경에서 테스트했습니다:

  1. ALFWorld: 청소, 음식 데우기, 물건 집기 등의 집안일을 수행해야 하는 집 환경.
  2. Room-to-Room: 집 안을 돌아다니며 특정 방을 찾아야 하는 내비게이션 작업.

논문의 주장:

  • PRISM은 카메라와 뇌를 서로 대화시키지 않고 사용하는 로봇들보다 성능이 현저히 뛰어났습니다.
  • 심지어 어떤 경우에는 "치트키"(방에 대한 완벽한 텍스트 설명)를 가진 로봇들을 이겼는데, 이는 PRISM이 적절한 세부 사항을 찾아내는 능력이 매우 뛰렸기 때문입니다.
  • 이 과정은 완전히 자동입니다. 인간이 질문을 작성하지 않았으며, AI가 상황에 맞춰 무엇을 물어볼지 스스로 판단했습니다.

핵심 요약

PRISM을 상대방이 적절한 말을 해주길 바라며 앉아 있는 소개팅과, 상대방을 완벽하게 이해하기 위해 후속 질문을 던지는 훌륭한 대화의 차이라고 생각하십시오. 로봇의 "뇌"가 "눈"에게 적극적으로 질문하게 함으로써, 로봇은 추측을 멈추고 성공을 위해 정확히 무엇을 해야 하는지 이해하기 시작합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →