← 최신 논문
💬 NLP

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

이 논문은 인간의 내면 언어가 행동 선택을 안내한다는 통찰에서 착안하여, 비언어적 관측으로부터 행동 의도를 언어로 표현하고 이를 조건부로 활용함으로써 인간과 AI 의 다양한 협업 상황에서 행동의 다양성과 충실도를 높이고 추론 시 정교한 제어를 가능하게 하는 'MIMIC' 프레임워크를 제안합니다.

원저자: Rakshit Trivedi, Kartik Sharma, David C Parkes

게시일 2026-02-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rakshit Trivedi, Kartik Sharma, David C Parkes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 방식: "눈에 보이는 대로 바로 행동하는 로봇" (행동주의)

지금까지의 많은 AI 는 거울과 비슷했습니다.

  • 원리: 사람이 "상자를 왼쪽으로 밀어"라고 행동하면, AI 는 그 화면을 보고 "아, 왼쪽으로 밀어야지"라고 바로 반응합니다.
  • 문제점: AI 는 그렇게 했는지, 혹은 다른 방법은 없을까라는 깊은 고민을 하지 않습니다. 단순히 "A 를 보면 B 를 해라"라는 패턴만 외운 것입니다.
  • 결과: 상황이 조금만 달라져도 당황하거나, 인간이 원하는 다양한 방식 (예: 천천히 하거나, 빠르게 하거나) 으로 행동하는 것이 어렵습니다. 마치 기계처럼 딱딱하고 예측 불가능한 행동을 할 수 있습니다.

2. MIMIC 의 방식: "속으로 말하며 행동하는 인간" (인지과학)

이 논문은 인간이 어떻게 행동하는지 관찰했습니다. 인간은 무언가를 할 때, 눈으로 보고 바로 손이 움직이기 전에 속으로 말을 걸며 (Inner Speech) 결정을 내립니다.

  • 예시: 상자를 옮길 때, 인간은 "상자가 무거우니까 천천히 들어야지" 혹은 "빨리 끝내야 하니까 옆으로 빙 돌아서 가야겠다"라고 속으로 중얼거립니다. 이 '속의 말'이 실제 행동의 나침반이 됩니다.

MIMIC 는 이 '속의 말'을 AI 에게 심어줍니다.

🧠 MIMIC 의 핵심 작동 원리 (3 단계)

  1. 관찰과 번역 (VLM):
    AI 는 인간의 시연 영상을 보고, 마치 전문 번역가처럼 "이 사람은 지금 무엇을 생각하고 있을까?"를 추측합니다. 예를 들어, "상자를 오른쪽에서 잡아서 회전시키겠다"라는 **내면의 생각 (Inner Speech)**을 텍스트로 만들어냅니다.

    • 비유: 마치 영화의 자막을 읽듯이, 사람의 행동 뒤에 숨겨진 '의도'를 텍스트로 읽어내는 것입니다.
  2. 압축된 생각 (CVAE):
    AI 는 이 긴 설명을 간결한 키워드로 압축합니다. "상자를 오른쪽에서 잡아서 회전시킨다"는 복잡한 문장을 **"오른쪽 회전 전략"**이라는 짧은 내면의 말로 바꿉니다.

    • 비유: 복잡한 요리 레시피를 "매콤하게"라는 한 마디로 요약하는 것과 같습니다.
  3. 행동 결정 (Diffusion Policy):
    이제 AI 는 실제 행동을 할 때, 단순히 화면만 보는 게 아니라 이 '압축된 생각'을 보고 행동을 결정합니다.

    • 비유: 요리할 때 레시피를 보지 않고, "매콤하게"라는 생각만으로도 어떻게 양념을 넣을지 결정하는 것처럼요.

3. MIMIC 가 가져온 놀라운 변화

이 방식 덕분에 AI 는 다음과 같은 능력을 얻었습니다:

  • 🎛️ 조종 가능한 행동 (Steerable Imitation):
    연구자가 AI 에게 "이번엔 조심스럽게 움직여"라고 말하면, AI 는 그 말을 '속의 생각'으로 받아들여 행동이 바뀝니다.

    • 비유: 운전사가 "조심스럽게 운전해"라고 말하면 차가 갑자기 달리는 게 아니라, 브레이크를 더 자주 밟고 서두르지 않게 되는 것과 같습니다. 기존 AI 는 이런 '지시'를 들을 수 없었습니다.
  • 🎭 다양한 인간 같은 행동 (Diversity):
    같은 상황에서도 AI 는 "빠르게 처리하자"는 생각으로 행동하거나, "정확하게 맞추자"는 생각으로 행동할 수 있습니다.

    • 비유: 같은 식당에서 요리사 A 는 "빨리 내야지"라고 생각하며 빠르게 요리하고, 요리사 B 는 "맛을 살려야지"라고 생각하며 천천히 요리하는 것처럼, AI 도 다양한 스타일의 행동을 보여줍니다.
  • 🤝 인간과의 완벽한 협력:
    '오버쿡 (Overcooked)'이라는 요리 협력 게임 실험에서, MIMIC AI 는 인간 파트너와 함께 일할 때 훨씬 더 높은 점수를 받았습니다. 인간이 무엇을 원하는지 '속의 생각'을 통해 미리 파악하고 행동했기 때문입니다.

4. 결론: 왜 이 연구가 중요한가요?

이 논문은 AI 에게 단순한 '반사 신경'이 아닌, '생각하는 과정'을 심어주었습니다.

  • 기존: "화면이 이렇다면 -> 저렇게 행동해" (기계적)
  • MIMIC: "화면이 이렇다면 -> 속으로 '이렇게 해야겠다'라고 생각한 뒤 -> 행동해" (인간적)

이 덕분에 AI 는 인간의 다양한 성향과 상황에 맞춰 유연하게 대처할 수 있게 되었고, 앞으로 인간과 함께 일하는 로봇이나 AI 가 훨씬 더 안전하고 자연스럽게 우리 곁에 들어올 수 있는 발판을 마련했습니다.

한 줄 요약:

"AI 가 행동을 하기 전에 '속으로 중얼거리는 생각'을 통해 인간처럼 고민하고, 연구자의 지시에 맞춰 유연하게 행동할 수 있게 만든 혁신적인 방법입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →