← 최신 논문
🤖 AI

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

본 논문은 물리적 LLM 에이전트가 기계적 퍼즐을 해결할 때 저해상도 감각 입력이나 중간 수준의 지각적 노이즈가 오히려 성공률을 높이는 역설적 현상을 밝히는데, 이러한 결함은 반복적 행동 고리를 깨고 추론 실패를 가려주어 완벽한 관찰이 항상 최적의 성능으로 이어진다는 가정을 도전한다고 주장합니다.

원저자: Oussama Zenkri, Oliver Brock

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Oussama Zenkri, Oliver Brock

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 까다로운 기계식 퍼즐 상자를 풀려고 한다고 상상해 보세요. 상자에는 여러 개의 미끄럼 막대와 회전 노브가 있지만, 모두 비밀리에 연결되어 있습니다. 상자를 열려면 매우 특정된 순서로 이들을 움직여야 합니다. 잘못된 것을 움직이면 아무 일도 일어나지 않습니다. 올바른 것을 움직이면 숨겨진 래치가 '딸깍' 소리를 내며 다음 조각을 움직일 수 있게 됩니다.

이제, 이 상자를 대신 풀려고 하는 초지능 로봇 두뇌 (AI) 가 있다고 상상해 보세요. 당신은 이렇게 생각할지도 모릅니다. "로봇이 더 똑똑할수록 더 잘할 것이고, 더 선명한 영상을 볼수록 더 잘할 것이다."

이 논문은 정반대의 결과를 발견했습니다.

연구자들이 발견한 내용을 간단히 설명해 드리겠습니다.

1. 설정: "락박스" 게임

연구자들은 물리적 퍼즐 상자 ( "락박스"라고 명명됨) 를 제작하여 강력한 AI(구체적으로 OpenAI 의 GPT-o1) 가 제어하는 로봇 팔에 주었습니다. 그들은 AI 가 세 가지 다른 "시각" 조건 하에서 퍼즐을 어떻게 해결하는지 확인하고 싶었습니다.

  • "흐린 카메라" (RGB): AI 는 상자의 표준 컬러 사진을 봅니다. 상자는 "이전"과 "이후" 사진을 비교하여 조각을 움직인 후 무슨 일이 일어났는지 추측해야 합니다.
  • "3D 카메라" (RGB-D): AI 는 사진 그리고 깊이 지도 (사물들이 얼마나 멀리 있는지 알 수 있는 정보) 를 함께 봅니다. 이는 더 "풍부한" 정보입니다.
  • "신의 시점" (Ground Truth): AI 는 상자를 전혀 보지 않습니다. 대신 컴퓨터가 모든 조각의 상태를 완벽한 수학적 텍스트로 정확히 알려줍니다 (예: "막대 A 는 왼쪽, 노브 B 는 오른쪽"). 이는 가능한 가장 정확한 정보입니다.

2. 큰 놀라움: "완벽한" 정보가 AI 를 더 멍청하게 만들다

당신은 AI 가 "신의 시점"(완벽한 텍스트 데이터) 을 가질 때 가장 잘하고, 흐린 사진을 쭈그려 보아야 할 때 가장 못 할 것이라고 기대할 것입니다.

하지만 그렇게 되지 않았습니다.

  • AI 는 완벽하고 선명한 텍스트 데이터를 가졌을 때 가장 못 했습니다.
  • AI 는 흐리고 불완전한 사진을 볼 때 가장 잘 했습니다.
  • 더 많은 데이터를 가진 3D 카메라는 오히려 단순한 사진보다 상황을 약간 더 악화시켰습니다.

이는 마치 수학 시험을 보는 학생이 교사가 완벽하고 수정이 없는 정답지를 주는 것보다 약간 흐리고 혼란스러운 워크시트를 받을 때 더 잘 수행하는 것과 같습니다.

3. 왜? "고리 속에 갇힘" 문제

연구자들은 AI 가 완벽한 정보로 실패한 이유를 파악하기 위해 더 깊이 파고들었습니다. 그들은 특정한 나쁜 습관을 발견했습니다: 반복적인 고리 (Repetitive Loops).

AI 가 완벽한 정보를 가졌을 때, 그것은 정신적으로 고착되는 함정에 빠졌습니다. 움직임을 시도하고 결과를 본 후, "그건 작동하지 않았어"라고 생각한 뒤, 정확히 같은 움직임을 다시 시도하고 같은 결과를 본 후, 또다시 반복했습니다. 마치 자신의 꼬리를 쫓는 개처럼 진전 없이 빙글빙글 도는 것이었습니다. 정보가 너무 완벽했기 때문에 AI 는 같은 실수를 반복해도 자신감을 가지고 계속 반복했습니다.

반면, AI 가 흐린 사진을 볼 때는 시야가 약간 노이즈가 섞여 있었습니다. 움직임이 약간 잘못 해석될 수도 있었습니다. 이 "혼란"은 부드러운 밀어붙임처럼 작용했습니다. AI 의 자신감을 약간의 수준으로 떨어뜨려 같은 실수를 반복하지 못하게 했습니다. 노이즈는 AI 를 새로운 것을 시도하도록 강요했고, 이는 우연히 고리에서 벗어나 퍼즐을 해결하는 데 도움이 되었습니다.

4. 시뮬레이션 실험

이것이 단순히 우연이 아님을 증명하기 위해 연구자들은 AI 에게 고의로 "거짓말"을 하는 컴퓨터 시뮬레이션을 실행했습니다. 특정 확률 (예: 40% 의 거짓말 확률) 로 AI 에게 실패한 움직임이 실제로는 성공했다고, 또는 그 반대로 말해 주었습니다.

  • 거짓말 0% (완벽한 진실): AI 는 고리에 갇혀 자주 실패했습니다.
  • 거짓말 40% (적당한 노이즈): AI 의 성공률이 두 배로 증가했습니다. "거짓말"이 고리를 깨고 새로운 것을 시도하게 만들었습니다.
  • 거짓말 60% (너무 많은 노이즈): AI 는 너무 혼란스러워져 다시 실패했습니다.

주요 결론

이 논문은 성공률이 오해의 소지가 있을 수 있다고 결론 내립니다.

AI 가 퍼즐을 빠르게 해결한다고 해서 반드시 "더 잘 사고한다"는 뜻은 아닙니다. 때로는 실수나 센서의 노이즈가 우연히 나쁜 습관을 깨뜨려 운이 좋았을 뿐일 수 있습니다.

당신이 AI 를 승패만으로 판단한다면, 실제로는 자신의 추론과 씨름하고 있다는 사실을 놓칠 수 있습니다. 로봇이 불완전한 센서를 가진 현실 세계에서는, 이 "불완전함"이 정신적 고착에 빠지지 않도록 하는 숨겨진 초능력이 될 수도 있습니다.

간단히 말해: 때로는 완벽하게 선명하게 아는 것보다 약간 혼란스러운 상태가 더 낫습니다. 그것은 당신이 같은 실수를 두 번 반복하지 않도록 막아주기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →