← 최신 논문
🤖 AI

Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B

이 사전 등록된 연구는 쿼리 조건부 접근 메커니즘을 통해 예산이 제한된 임보디드 에이전트의 에피소드 검색 정확도를 크게 향상시키는 학습 불필요한 래퍼인 ASP를 소개하며, 동시에 프롬프트 기반의 온라인 압축과 전체 아키텍처 복잡성이 고정된 토큰 예산 하의 오픈 웨이트 모델에서 반드시 성능을 향상시키는 것은 아님을 입증한다.

원저자: Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 집에서 생활하며 오늘 아침 당신이 사용했던 특정 머그컵을 찾는 데 도움을 주는 임무를 맡은 로봇 비서가 있다고 상상해 보십시오. 이 로봇은 몇 시간 동안 집 안을 돌아다니며 연속적인 비디오 스트림을 기록했습니다. 당신의 질문에 답하기 위해, 로봇은 단순히 마지막 몇 초의 영상만을 살펴봐서는 안 됩니다. 그것은 기록된 수백 분의 역사를 뒤져야 합니다. 하지만 로봇의 두뇌에는 엄격한 제한이 있습니다. 결정을 내려야 하는 바로 그 순간에 처리할 수 있는 정보의 양이 매우 적고 고정되어 있다는 점입니다. 로봇은 전체 영상을 활성 메모리에 저장할 수도 없고, 질문을 던질 때마다 하루 종일 찍은 영상을 다시 돌려볼 여유도 없습니다. 이것이 바로 체화된 지능(embodied intelligence)의 근본적인 병목 현상입니다: 끝없이 이어지는 관찰의 흐름과 유한한 사고 예산 사이의 간극 말입니다.

수년 동안 연구자들은 단순히 인공지능 모델을 더 크게 만드는 것이 이 문제를 해결할 것이라고 기대해 왔습니다. 지배적인 생각은 모델이 충분히 커지기만 하면 본인이 본 모든 것을 기억하는 법을 자연스럽게 배울 것이라는 것이었습니다. 그러나 최근의 실험들은 가장 진보된 모델들조차 긴 연속 비디오 스트림을 마주했을 때 어려움을 겪는다는 것을 보여주었습니다. 모델들은 단 한 장의 사진 속에서 고양이를 인식할 수는 있지만, 그 고양이가 한 시간 전에 어디로 갔는지는 추적하는 데 종종 실패합니다. 문제는 모델들이 보는 능력이 부족한 것이 아니라, 시계가 돌아가고 메모리가 가득 찬 상황에서 무엇을 보아야 할지 결정하는 전략이 부족하다는 것입니다.

한 연구팀은 다른 접근 방식을 테스트하기 위해 연구를 시작했습니다. 그들은 더 큰 뇌를 만드는 대신, 로봇이 기억에 접근하는 방식이 뇌의 크기 자체보다 더 중요한지를 물었습니다. 그들은 성공적인 에이전트에게 두 가지 별개의 도구가 함께 작동해야 한다고 제안했습니다: 지금까지 일어난 일에 대한 압축된 요약(마치 계속 작성되는 일기처럼)과 모든 순간을 담은 정밀하고 검색 가능한 아카이브(마치 사진 도서관처럼)입니다. 결정적으로, 에이전트는 질문의 특성에 따라 일기를 읽는 데와 도서관을 검색하는 데 예산을 얼마나 사용할지 선택할 수 있어야 합니다. 그들은 기존의 로봇 두뇌를 재학습 없이 자원을 관리하는 새로운 논리 계층으로 감싸는 시스템을 구축하여 이를 테스트했습니다.

연구진은 건물을 통과하는 긴 산책을 모방하도록 설계된 합성 환경에서 이 시스템을 테스트했습니다. 이 환경에서 로봇은 몇 시간 전에 본 물체에 대한 질문에 답해야 했습니다. 그들은 이 새로운 시스템을 무작위로 프레임을 선택하는 모델, 모든 것을 짧은 텍스트로 요약하려는 모델, 그리고 실행 중인 요약 없이 도서관을 검색하는 모델을 포함한 여러 표준 방식들과 맞붙였습니다. 그들은 모든 모델에 대해 동일하게 엄격한 4,096 토큰(정보 단위)의 결정당 제한을 적용하여 테스트를 진행했습니다.

결과는 놀라웠지만 미묘했습니다. 지능적으로 로봇의 주의를 집중시킨 새로운 시스템은 질문에 따라 접근 방식을 조건화하지 않은 다른 모든 방법을 압도했습니다. 300개의 프레임 스트림 속에 숨겨진 특정 물체를 찾는 작업(에피소드 검색 작업)에서, 새로운 시스템은 75~94%의 성공률을 보인 반면, 가장 우수한 대안 방식들은 20% 미만의 성공률을 기록했습니다. 연구진은 적절한 질문을 던지고 나서 적절한 프레임을 가져오는 능력이 결정적인 요소였다는 것을 발견했습니다. 실제로 표준 모델에게 4배 더 많은 메모리를 주어도, 제한된 메모리를 똑똑하게 사용하는 새로운 시스템만큼 도움이 되지 않았습니다. 거대한 예산을 가진 멍청한 시스템은 작은 예산을 가진 똑똑한 시스템을 이기지 못했습니다.

하지만 이야기는 완벽한 승리로 끝나지 않았습니다. 연구진은 시스템을 세 부분, 즉 요약, 아카이브, 그리고 이 둘을 어떻게 사용할지 결정하는 스마트 라우터로 설계했습니다. 연구진이 각 부분을 개별적으로 테스트했을 때, 놀라운 결함을 발견했습니다. 스마트 라우터와 아카이브가 핵심적인 역할을 수행했습니다. 하지만 일어난 일을 계속 기록하기로 되어 있던 요약 구성 요소는 오히려 시스템을 악화시켰습니다. 요약을 제거했을 때 시스템의 복잡한 과업 수행 능력이 크게 향고되었습니다. 사실, 전체 시스템은 7개의 모델 모두에서 아카이브 전용 베이스라인보다 성능이 나았습니다. 그 이유는 로봇의 두뇌가 수백 단계에 걸쳐 완벽한 누적 기록을 유지하는 데 서툴렀기 때문입니다. 요약 과정에서의 작은 오류들이 쌓여 시스템을 혼란스럽게 만들었습니다. 라이브 요약 대신 오프라인 텍텍스트 인덱스에 의존하는 더 성능 좋은 시스템이 연구진의 설계보다 더 높은 성과를 냈습니다.

이 실패는 패배가 아니라 중요한 개선점이었습니다. 이 연구는 엄격한 시간과 메모리 제한 하에서는 접근의 구조가 모델의 크기나 가용 메모리의 양보다 더 중요하다는 것을 입증했습니다. 로봇은 모든 것을 볼 필요가 없습니다. 정확히 어디를 봐야 할지 알면 됩니다. 연구진은 체화된 에이전트의 미래가 더 큰 뇌를 만드는 것이 아니라, 정보를 훨씬 더 똑똑하게 사용하는 방법을 구축하는 데 있다고 결론지었습니다. 가장 효과적인 전략은 예산을 모든 세계를 메모리에 담아두는 데 쓰는 것이 아니라, 올바른 증거를 찾는 데 사용하는 것입니다. 비록 그들의 구체적인 라이브 요약 설계는 실패했지만, 핵심 원칙은 확고했습니다: 끝없는 데이터와 제한된 시간이 존재하는 세상에서, 무엇을 무시해야 할지 아는 것은 무엇을 기억해야 할지 아는 것만큼이나 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →