기존의 로봇 강아지들은 눈앞에 장애물이 있으면 넘어지거나, 눈이나 비가 오면 길을 잃는 경우가 많았습니다. 마치 한 가지 운동만 잘하는 선수처럼, 평지에서는 잘 뛰지만 계단이나 진흙탕에서는 당황하는 것이죠.
또한, 로봇에게 "저기 저기서 뛰어오르세요"라고 말하면, 로봇이 "네, 알겠습니다!"라고 대답하면서도 실제로는 넘어져서 다치는 '할루시네이션(환각)' 현상이 발생하기도 합니다. 로봇이 말은 잘하지만, 몸이 따라주지 못하는 거죠.
2. OpenGo 의 핵심 아이디어: "레고 블록"과 "코치"
OpenGo 는 이 문제를 해결하기 위해 두 가지 장치를 도입했습니다.
① 검증된 '레고 블록' (스킬 라이브러리) 로봇이 직접 발을 움직이는 복잡한 코드를 매번 새로 짜는 대신, 미리 안전하고 완벽하게 검증된 **'행동 레고 블록'**들을 준비해 둡니다.
'앞으로 걷기', '계단 오르기', '뒤로 뒤집기', '춤추기' 같은 블록들이 있습니다.
이 블록들은 미리 시뮬레이션에서 수백 번 테스트했기 때문에, 로봇이 다치거나 넘어질 위험이 없습니다.
② 똑똑한 '코치' (디스패처 & LLM) 로봇의 머릿속에 있는 **거대 언어 모델 (LLM)**은 이제 직접 발을 움직이는 게 아니라, '코치' 역할을 합니다.
사용자가 "눈이 오는데 계단으로 올라가 줘"라고 말하면, 코치는 미리 준비된 레고 블록들 중에서 **'계단 오르기 블록'**과 **'눈길 걷기 블록'**을 골라냅니다.
그리고 "속도는 조금 줄이고, 발걸음은 넓게"처럼 **매개변수 (설정값)**만 조정해서 로봇에게 전달합니다.
핵심: 코치는 무작정 막무가내로 명령을 내리는 게 아니라, 안전한 레고 블록 안에서만 지시를 내리기 때문에 로봇이 엉뚱한 행동을 하거나 다치는 일을 막을 수 있습니다.
3. 어떻게 작동하나요? (실제 사용법)
자연스러운 대화: 사용자가 스마트폰 앱 (Feishu) 으로 "강아지야, 저기 있는 공을 가져와 줘"라고 말하면 됩니다. 로봇 전문 지식이 없는 일반인도 쉽게 명령할 수 있습니다.
실시간 판단: 로봇이 공을 향해 가다가 갑자기 물웅덩이를 만나면, 코치가 상황을 보고 "걷기" 블록 대신 "물웅덩이 건너기" 블록으로 실시간에 바로 전환합니다.
스스로 배우기: 만약 로봇이 어떤 명령을 수행하다가 실패하거나, 사용자가 "아니, 그렇게 하지 말고 저렇게 해"라고 피드백을 주면, 로봇은 그 경험을 기억해 둡니다. 다음에 비슷한 상황이 오면 더 잘할 수 있도록 스스로 수정합니다.
4. 실험 결과와 한계
성공: 실제 로봇 강아지 (Unitree Go2) 에 적용해 보니, 사용자가 말한 대로 계단을 오르고, 뒤집기를 하고, 춤을 추는 등 다양한 작업을 성공적으로 수행했습니다.
약점 (지연 시간):
생각하는 시간: 로봇이 말을 듣고 행동하기까지 코치가 생각해서 레고 블록을 고르는 데 시간이 조금 걸립니다. (마치 코치가 지시를 내리기 전에 잠시 고민하는 시간)
부드러움 부족: 한 행동에서 다른 행동으로 넘어갈 때 아주 미세한 끊김이 느껴질 수 있습니다.
🌟 한 줄 요약
OpenGo는 로봇에게 "무작정 명령을 따르게" 하는 게 아니라, **"안전하게 검증된 행동 블록들"**을 준비해 두고, AI 코치가 상황에 맞춰 그 블록들을 조합하게 함으로써, 일반인도 쉽게 지시할 수 있고 로봇도 안전하게 복잡한 일을 할 수 있게 만든 혁신적인 시스템입니다.
이 기술은 앞으로 로봇이 우리 일상에서 더 자연스럽게, 그리고 안전하게 일할 수 있는 토대를 마련해 줍니다.
1. 연구 배경 및 문제 정의 (Problem)
복잡한 환경 적응의 한계: 단일 로봇 에이전트가 다양한 환경과 복잡한 작업에 적응하는 것은 여전히 큰 도전 과제입니다. 특히 눈, 안개, 반사 표면, 부분 가려짐 등 지각 (Perception) 이 불안정한 극한 환경에서는 기존의 강화학습 기반 보행 제어기가 실패할 수 있습니다.
LLM 의 환각 (Hallucination) 문제: 최근 대규모 언어 모델 (LLM) 은 로봇의 고수준 의사결정에 유망하지만, 이를 물리적 로봇에 직접 적용할 때 언어적으로 타당하지만 로봇의 물리적 제약이나 환경 조건을 무시하는 '환각' (유효하지 않은 기술 호출, 안전하지 않은 매개변수 할당 등) 이 발생할 위험이 큽니다.
기존 접근법의 부족: 단일 일반 전략에 의존하거나, 시뮬레이션과 실제 로봇 간의 격차가 큰 기존 방법론들은 실제 배포에서 신뢰성과 안전성을 보장하기 어렵습니다.
2. 제안 방법론 (Methodology: OpenGo)
저자들은 OpenGo라는 새로운 프레임워크를 제안합니다. 이는 OpenClaw를 기반으로 하며, LLM 의 유연성과 로봇의 제어 가능성을 결합하기 위해 구조화된 기술 (Skill) 레이어에 의사결정을 제한합니다. 시스템은 크게 세 가지 핵심 구성 요소로 이루어져 있습니다.
가. 커스터마이징 가능한 기술 라이브러리 (Customizable Skill Library)
구조화된 행동 공간: 로봇의 모든 행동을 엔드 - 투 - 엔드 정책이 아닌, 호출 가능한 모듈 (기술) 의 집합으로 분해합니다.
기술 템플릿: 각 기술은 다음 5 가지 필드로 정의됩니다.
Skill Head: 기술 식별자 및 의미적 라벨.
Parameters: 작업 적응을 위한 조정 가능한 하이퍼파라미터 (거리, 속도, 각도 등).
Constraints: 실행 전제 조건 및 안전 경계 (지형 요구사항, 작동기 한계 등).
Function: 실제 실행 로직 (검증 후 고정됨).
Prompts: 기술 호출 시기와 방법을 설명하는 텍스트.
안전성 보장: 새로운 기술은 코드 검토와 시뮬레이션 기반 검증을 거쳐 라이브러리에 등록되며, 실행 중에는 함수 (Function) 는 불변 (Immutable) 으로 유지되어 LLM 이 저수준 제어 로직을 임의로 수정하는 것을 방지합니다.
나. LLM 기반 디스패처 (The Dispatcher)
역할 제한: LLM 은 직접 모터 명령을 생성하는 것이 아니라, 1) 적절한 기술 선택 및 2) 경계된 매개변수 할당이라는 두 가지 고수준 기능만 수행합니다.
입력: 작업 설명 (Task), 인간 지시 (Instruction), 현재 상황 상태 (Scenario) 를 입력받습니다.
출력: 검증된 기술 라이브러리에서 선택된 기술과 매개변수의 순차적 계획 (Symbolic-to-structured plan).
환각 방지: 기술 후보는 사전 필터링되고, 매개변수는 유효 범위 내로 제한되며, 메모리/상태 확인 모듈을 통해 실행 컨텍스트가 검증됩니다.
다. 자기 학습 프레임워크 (Self-Learning Framework)
피드백 루프: 작업 완료 신호, 오류 로그, 인간 피드백 (Feishu 플랫폼 등을 통한 자연어) 을 수집하여 디스패처와 메모리에 반환합니다.
적응적 개선:
디스패치 수준: 특정 환경에서 성공률이 높은 기술의 우선순위를 높입니다.
매개변수 수준: 반복된 성공/실패 패턴을 기반으로 기본 하이퍼파라미터 (보폭, 회전 반경 등) 를 조정합니다.
인간 개입: 비전문가도 자연어 지시를 통해 로봇의 행동을 수정하거나 확인할 수 있어, 직접 원격 조종 없이도 인간 선호도를 반영할 수 있습니다.
3. 주요 기여 (Key Contributions)
안전한 LLM 통합: LLM 의 역할을 '저수준 행동 생성'이 아닌 '검증된 기술 선택 및 매개변수 튜닝'으로 제한함으로써, 물리적 로봇 배포 시 안전성과 해석 가능성 (Interpretability) 을 크게 향상시켰습니다.
실시간 기술 전환: Unitree Go2 로봇에서 실시간으로 상황에 맞는 기술을 선택하고 전환하는 능력을 입증했습니다.
접근성 있는 HRI: Feishu 플랫폼과 통합하여 비전문가도 자연어로 로봇을 제어하고 피드백을 줄 수 있는 인터페이스를 제공했습니다.
확장 가능한 아키텍처: 코드 검토 및 시뮬레이션 검증을 통한 기술 추가 프로세스를 통해 시스템의 신뢰성을 유지하면서 기능을 지속적으로 확장할 수 있는 구조를 제시했습니다.
4. 실험 결과 (Results)
플랫폼: Unitree Go2 로봇에 실제 배포되었습니다.
작업 수행: 자연어 지시 (전진, 회전, 뒤집기, 춤 등) 를 받아 다양한 기술을 조합하여 성공적으로 실행했습니다.
지연 시간 (Latency) 분석:
단일 기술: 초기 실행 시 LLM 파싱 및 기술 로딩으로 인해 지연이 발생하지만, 캐싱된 기술은 빠른 응답을 보입니다.
복합 기술: 기술 조합 수가 증가함에 따라 지연 시간이 선형적으로 증가하지는 않지만, 기술 간 조율 및 상태 전환 오버헤드로 인해 전체 응답 시간이 증가합니다.
매개변수 영향: 입력 매개변수의 복잡도가 높을수록 파싱 및 유효성 검사 오버헤드로 인해 지연이 증가합니다.
사용자 인터랙션: Feishu 를 통한 자연어 지시와 피드백이 원활하게 작동하여 비전문가도 로봇을 제어할 수 있음을 확인했습니다.
5. 의의 및 한계 (Significance & Limitations)
의의:
LLM 의 강력한 의미적 추론 능력과 로봇의 물리적 제어 안정성을 결합한 실용적인 프레임워크를 제시했습니다.
"환각"을 줄이고 안전성을 확보하면서도 유연한 작업 수행이 가능한 새로운 패러다임을 보여줍니다.
장기적인 사용을 위한 자기 학습 및 인간 피드백 통합 메커니즘을 통해 적응형 에이전트 개발의 기초를 마련했습니다.
한계:
지연 시간: LLM 의 응답 지연과 OpenClaw 내부 실행 지연으로 인해 실시간성이 필요한 동적 환경에서의 반응 속도가 제한적입니다.
연속성: 기술 간 전환 시 발생하는 간격으로 인해 로봇의 운동이 매끄럽지 않고 단편적으로 보일 수 있습니다.
복잡한 작업: 현재는 기본 동작 위주로 검증되었으며, 복잡한 장애물 회피나 정밀한 협동 작업으로 확장 시 추가적인 최적화가 필요합니다.
결론
OpenGo 는 LLM 기반의 지능형 로봇이 실제 물리 환경에서 안전하고 신뢰성 있게 작동할 수 있도록 하는 중요한 걸음입니다. 이는 LLM 을 무제한의 행동 생성기가 아닌, 검증된 기술 라이브러리를 관리하는 '지휘자'로 위치시킴으로써, embodied AI 의 실용화와 확장 가능성을 크게 높인 연구입니다.