← 최신 논문
💻 computer science

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

이 논문은 RoboTokens로 학습되어 미학습된 작업 및 보상에 대해 최적화된 로봇 형태와 제어기를 생성할 수 있는 통합 디퓨전 트랜스포머 모델인 "Transformer Transformer"를 소개하며, 이는 새로운 역학 자기 유도(Dynamics Self-Guidance) 메커니즘을 통해 진화 기반 베이스라인보다 상당한 성능 향상을 달성한다.

원저자: Huy Ha, C. Karen Liu, Shuran Song

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huy Ha, C. Karen Liu, Shuran Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 저글링을 가르치려고 한다고 상상해 보세요. 하지만 당신은 로봇의 몸이 아니라, 당신의 손이 움직여야 할 경로만을 보여줍니다. 만약 이 경로를 작고 흔들거리는 장난감 로봇에게 준다면, 그 로봇는 처참하게 실패할 것입니다. 만약 이 경로를 거대하고 무거운 크레인에게 준다면, 크레인은 너무 빠르게 움직이려다 자신의 모터를 망가뜨릴지도 모릅니다. 이것이 바로 '체화(embodiment)'라고 불리는 로봇 공학의 핵심적인 문제입니다. 이는 로봇의 물리적 형태, 크기, 무게가 로봇이 실제로 '할 수 있는 일'을 결정한다는 개념입니다. 오랫동안 과학자들은 로봇의 몸을 고정되고 변하지 않는 상자로 취급하며, 뇌가 어떻게 움직이는지를 가르치는 데에만 집중해 왔습니다. 하지만 우리가 수행해야 할 특정 작업에 딱 맞는 완벽한 몸을 직접 설계할 수 있다면 어떨까요? 이 논문은 "특정 작업을 수행하기 위한 최적의 로봇 형태는 무엇인가?"라는 질문을 던지며 이 문제 속으로 파고듭니다. 이 연구는 로봇의 몸을 설계하는 예술과 그것을 움직이도록 가르치는 과학을 결합하여, 단순히 작업을 학습하는 것을 넘어 그 작업을 수행하기 위한 완벽한 기계를 스스로 발명해 내는 시스템을 만듭니다.

여기 **트랜스포머 트랜스포머(Transformer Transformer)**라는 새로운 AI 모델이 등장합니다. 이 모델은 똑똑한 로봇 건축가이자 코치가 합쳐진 역할을 합니다. 이름이 약간 발음하기 까다로운데, 첫 번째 "트랜스포머"는 모양을 바꿀 수 있는 로봇(변신 로봇처럼)을 의미하며, 두 번째 "트랜스포머"는 복잡한 패턴을 이해하는 데 탁월한 것으로 유명한 특정 유형의 AI 아키텍처를 의미합니다. 연구진은 이 까다로운 퍼즐을 풀기 위해 이 모델을 구축했습니다. 즉, 원하는 움직임(예: 인간의 손이 공중에서 경로를 그리는 것)과 일련의 목표(예: "빠르게" 또는 "가볍게")가 주어졌을 때, AI가 그 일을 완벽하게 수행할 수 있는 완전히 새로운 로봇 설계를 발명할 수 있는가 하는 문제입니다.

이를 위해 팀은 **로보토큰(RoboTokens)**이라는 특별한 언어를 만들었습니다. 이것을 로봇을 위한 '보편적인 알파벳'이라고 생각하세요. AI는 기어나 모터에 대한 길고 복잡한 설명 대신, 로봇의 모든 부분(다리, 관절, 모터, 심지어 움직임까지)을 문장의 단어들처럼 깔끔한 토큰의 시퀀스로 변환합니다. 이를 통해 AI는 로봇의 몸과 그 동작을 한꺼번에 '읽을' 수 있습니다. 이 모델은 방대한 양의 로봇 시뮬레이션 라이브러리를 통해 훈련되며, 서로 다른 형태가 다양한 힘에 어떻게 반응하는지를 학습합니다. AI는 긴 팔에는 강력한 모터가 필요하다는 것과, 무거운 로봇은 균형을 잡기 위해 더 넓은 자세가 필요하다는 것을 배웁니다.

마법은 AI가 새로운 로봇을 설계하도록 요청받을 때 일어납니다. AI는 단순히 추측하는 것이 아니라, **확산(diffusion)**이라는 과정을 사용합니다. 이는 마치 정전기 노이즈 구름에서 시작하여 서서히 선명한 그림으로 정제해 나가는 과정과 같습니다. 이 경우, "그림"은 로봇의 설계도입니다. AI는 퍼지하고 무작위적인 로봇 부품들의 집합에서 시작하여, 이를 일관된 기계의 형태로 점차 날카롭게 다듬어 나갑니다. 여기서 핵심은 AI가 "보상 함수(reward function)"라는 가이드에 의해 유도될 수 있다는 점인데, 이는 AI가 목표로 삼아야 할 점수판과 같습니다. 만약 당신이 "이 경로를 추적하되 에너지를 최대한 적게 사용하는 로봇을 원한다"라고 말한다면, AI는 새로운 목표를 위해 매번 다시 훈련될 필요 없이 설계 과정 중에 에너지 사용을 최소화하도록 설계를 미세하게 조정합니다. 저자들이 **제로샷 최적화(zero-shot optimization)**라고 부르는 이 능력은, 마치 요리사가 특정 케이크를 본 적이 없더라도 "가볍게 만들어줘"라는 말을 듣는 것만으로 저칼로리 케이크를 위한 새로운 레시피를 발명하는 것과 같습니다.

논문은 이 접근 방식이 매우 다양한 유형의 로봇에 걸쳐 놀라울 정도로 잘 작동함을 보여줍니다. 연구진은 세 가지 뚜렷한 "놀이터"에서 테스트를 진행했습니다: 고정된 로봇 팔(공장의 로봇 팔 같은 것), 네 발 달린 로봇(강아지 같은 것), 그리고 두 팔이 달린 이동형 로봇(카트를 든 사람 같은 것)입니다. 모든 경우에서 AI는 전통적인 방식보다 더 느리지만 효과적인 방법으로 찾아낸 설계보다 더 뛰어난 로봇 설계를 생성했습니다. 예를 들어, 로봇이 천을 던지는 작업(flinging)을 최적화할 때, AI는 더 긴 팔과 다른 장착 위치를 가진 버전을 설계했습니다. 실제로 이 새로운 설계를 현실 세계에서 구현했을 때, 원래의 설계와 비교하여 추적 오차는 73% 감소했고, 관절의 움직임은 30% 더 느려졌습니다 (이는 모터에 가해지는 스트레스가 줄어들었으므로 좋은 결과입니다).

하지만 이 논문은 이 성과가 시뮬레이션에 크게 의존하고 있다는 점을 주의 깊게 언급합니다. 천을 던지는 로봇에 대한 실제 테스트는 성공적이었지만, 대부분의 결과는 컴퓨터 시뮬레이션에서 나왔습니다. AI는 "역학 모델(dynamics model)"로서 로봇이 어떻게 움직일지를 예측할 뿐, 스스로 물리적인 몸을 가지고 있지는 않습니다. 또한 연구진은 AI가 이전에 본 적이 없는 완전히 새로운 영역의 로봇을 발명할 수는 없다는 점을 지적합니다. AI는 자신이 학습한 부품과 연결 방식들을 조합하고 개선할 수 있을 뿐입니다. 즉, 완전히 새로운 물리학을 창조하는 것이 아니라, 기존의 판을 재배치하는 데 능숙한 것입니다.

가장 흥ante로운 기능 중 하나는 로봇을 설계하는 동일한 모델이 로봇을 제어할 수도 있다는 점입니다. AI가 새로운 로봇 형태를 발명하면, 즉시 로봇의 뇌 역할을 하여 목표 경로를 추적하도록 명령할 수 있습니다. 이는 설계와 제어기가 완벽하게 일치함을 의미하며, 로봇은 만들어졌지만 소프트웨어가 어떻게 움직여야 할지 모르는 흔한 문제를 방지합니다. 저자들은 이를 **교차 체화 제어(cross-embodiment control)**라고 부르며, 이는 우리가 단순히 특정 작업을 위해 로봇을 프로그래밍하는 것이 아니라, 그 작업을 위해 완벽한 몸을 갖도록 요청하는 미래를 시사합니다.

요약하자면, 트랜스포머 트랜스포머는 로봇의 미래가 더 나은 뇌나 더 나은 몸만을 구하는 것이 아니라, 그 둘을 함께 설계하는 것에 있다는 것을 보여줍니다. 로봇의 몸을 유연하고 학습 가능한 데이터로 취급함으로써, 이 모델은 작업에 완벽하게 맞춰진 기계를 만드는 "원스톱 숍"을 제공합니다. 비록 아직은 주로 시뮬레이션 단계이지만, 천을 던지는 로봇의 실제 테스트는 AI가 꿈꾸는 설계가 복잡하고 예측 불가능한 현실 세계에서도 실제로 작동할 수 있으며, 추적 오차를 줄이고 로봇을 더 효율적으로 만든다는 것을 증명했습니다. 이는 로봇이 단순히 우리가 만드는 도구가 아니라, 우리가 수행해야 할 특정한 춤을 위해 함께 설계하는 파트너가 되는 세상을 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →