← 최신 논문
🤖 AI

Emergence of Physical Intelligence via Controllable Information Production

본 논문은 동역학 시스템과 최적 제어에 기반하여 물리적 지능과 정보 생산을 통합하고, 시스템이 통제 가능한 혼란의 가장자리로 유도되도록 함으로써 인간형 로봇의 자기 일어서기 같은 복잡한 과제를 숙달할 수 있게 하는 새로운 내재적 동기 부여 프레임워크인 제어 가능한 정보 생산 (CIP) 을 소개한다.

원저자: Tristan Shah, Stas Tiomkin

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tristan Shah, Stas Tiomkin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 움직이는 법을 가르치려는데, 치트시트나 보상 시스템을 주기를 거부한다고 상상해 보세요. "일어서서 쿠키를 받아라"거나 "앞으로 걸어서 점수를 얻어라"라고 말하지 않을 것입니다. 대신 로봇이 스스로 어떻게 유용해질지 알아내길 원합니다. 이것이 **내재적 동기 (Intrinsic Motivation, IM)**의 도전 과제입니다: 인간의 지시 없이 세계와 상호작용하기만 해서 에이전트가 학습하게 만드는 것입니다.

이전에 시도된 방법들은 개가 무엇을 흥미로워할지 추측하며 가르치려던 것과 비슷했습니다. 연구자들은 특정 측정 항목 (예: "로봇이 팔을 얼마나 움직이는가?") 을 선택하고 로봇에게 이를 최대화하라고 지시했습니다. 하지만 이는 인간의 편향을 도입합니다. 로봇은 인간이 흥미로워한다고 생각한 것만 학습할 뿐, 상황의 물리학에 실제로 근본적인 것은 학습하지 못합니다.

이 논문은 **조절 가능한 정보 생산 (Controllable Information Production, CIP)**이라는 새롭고 더 깨끗한 방식을 제시합니다.

핵심 아이디어: "혼돈의 줄타기"

로봇을 줄타기꾼으로 생각해 보세요.

  • 너무 안정적: 걷는 사람이 넓고 평평한 플랫폼 위에 서 있다면, 별다른 일을 하지 않습니다. 학습하지도 않으며, 실수가 발생할 수 없으므로 실제로 "조절"하고 있는 것도 아닙니다.
  • 너무 혼란스럽: 걷는 사람이 줄도 없이 거친 폭풍우가 몰아치는 바다 위에 있다면, 그저 허우적댑니다. 많은 "정보" (무작위 운동) 를 생산하지만, 이를 통제할 수 없습니다. 그저 추락할 뿐입니다.
  • 적절한 지점: 가장 흥미롭고 지능적인 행동은 혼돈의 가장자리에서 발생합니다. 이는 강한 바람 속 줄타기와 같습니다. 걷는 사람은 일어서 있으려고 끊임없이 싸웁니다. 그들은 많은 "정보" (미세 조정, 흔들림, 수정) 를 생산하지만, 이를 통제하고 있습니다.

저자들은 진정한 물리적 지능은 지루할 정도로 안정적이거나 광란처럼 혼란스러운 것이 아니라고 주장합니다. 시스템이 흥미로울 정도로 불안정하지만, 숙달할 정도로 통제 가능한 그 적절한 지점을 찾는 것입니다.

"조절 가능한 정보 생산"이란 무엇인가?

간단히 말해, CIP는 로봇이 스스로에게 묻는 방식입니다: "내가 이를 통제하려 노력할 때, 세상을 얼마나 변화시킬 수 있을까?"

  1. 옛 방식 (편향된 교사): 이전 방법들은 로봇에게 "다양성"이나 "호기심"을 최대화하라고 요구했습니다. 마치 교사가 "가장 colorful 한 것들을 찾아라!"라고 말하는 것과 같습니다. 로봇은 다양한 색을 보기 위해 그냥 빙글빙글 돌 수도 있는데, 이는 그리 유용하지 않습니다.
  2. 새로운 방식 (CIP): 이 방법은 로봇에게 특정 것을 찾도록 요구하지 않습니다. 대신 로봇이 생성하는 새로운 예측 불가능한 상황의 비율을 측정하되, 로봇이 여전히 그 상황을 고칠 수 있는지 측정합니다.

블록 쌓기를 하는 아이를 상상해 보세요.

  • 블록 더미가 이미 바닥에 있다면, 아이는 별다른 일을 할 수 없습니다 (낮은 정보 생산).
  • 아이가 탑을 순식간에 모두 무너뜨린다면, 그 추락을 통제할 수 없습니다 (높은 혼란, 낮은 통제).
  • 하지만 아이가 탑을 조심스럽게 균형을 맞추며 흔들리게 하고, 넘어지지 않도록 손을 조정한다면, 그들은 "CIP 존"에 있는 것입니다. 그들은 복잡하고 변화하는 데이터 (흔들림) 를 많이 생성하지만, 결과를 조종하는 것은 바로 그들입니다.

작동 원리 (마술 같은 기법)

이 논문은 이 아이디어를 **최적 제어 (Optimal Control)**와 연결합니다. 이는 자동차를 운전하거나 비행기를 조종하는 최선의 방법을 계산하는 데 사용되는 수학입니다.

저자들은 숨겨진 연결고리를 발견했습니다. 로봇이 안정적으로 머무는 법을 알려주는 수학 (가치 함수) 은 또한 얼마나 많은 "조절 가능한 혼란"이 발생하고 있는지를 비밀리에 알려준다는 것입니다.

  • 그들은 어떤 변수를 측정할지 추측할 필요 없이 이 "혼란율"을 계산하는 방법을 찾았습니다.
  • 그들은 이전에 너무 어려워했던 복잡한 로봇에서도 이 수학을 실행할 수 있는 빠르고 안정적인 계산기 (알고리즘) 를 만들었습니다.

결과: 일어서는 로봇들

연구자들은 다음과 같은 여러 로봇 시뮬레이션에서 이를 테스트했습니다:

  • 카트 폴 (Cart Poles): 움직이는 카트 위에 있는 막대기.
  • 이중 및 삼중 진자 (Double and Triple Pendulums): 막대기에서 매달린 막대기들로, 광란처럼 흔들려 균형을 잡기 어렵기로 유명합니다.
  • 긴보 (Gibbon): 막대기에 매달린 인간처럼 생긴 로봇이 일어서는 자세로 자신을 끌어올리려 시도합니다.

결과:
인간의 보상이나 지시 없이 CIP를 사용한 로봇들은 다음을 스스로 알아냈습니다:

  • 막대기를 흔들어 올리고 균형을 잡는 법.
  • 매달린 자세에서 일어서는 자세로 자신을 끌어올리는 법 (자기 바로잡기).

다른 방법들 (예: "호기심"이나 "다양성" 추구자) 은 대부분 실패했습니다. 그들은 루프에 갇히거나 일어서는 자세를 안정화하는 방법을 알아내지 못했습니다. 반면, CIP 로봇은 "조절 가능한 정보 생산"이 가장 높은 곳이 바로 일어서는 자세라는 이유로 자연스럽게 그 자세로 기울어졌습니다. 일어서는 것이 통제할 수 있는 가장 "흥미로운" 상태임을 깨달은 것입니다.

왜 이것이 중요한가

이 논문은 지능적 시스템이 학습해야 하는 새로운 규칙을 제안합니다: 시스템을 통제 가능한 혼돈의 가장자리로 몰아넣으십시오.

로봇에게 무엇을 할지 말해주는 대신, "흥미롭고 통제 가능한 불안정성"을 가리키는 나침반을 주어 보세요. 로봇은 수학상 가장 흥미로운 제어가 일어나는 곳이 바로 그곳이기 때문에, 일어서거나 균형을 잡는 것과 같은 유용한 기술을 스스로 발견합니다.

한 줄 요약: 이 논문은 로봇에게 새로운 내부 나침반을 제공합니다. 보상을 찾는 대신, 물리학의 "골디락스 존"을 찾습니다. 여기서 사물은 도전적이기 위해 불안정하지만, 숙달하기 위해 통제 가능한 상태입니다. 이를 통해 로봇은 인간이 시키지 않아도 일어서기 같은 복잡한 물리적 기술을 학습할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →