← 최신 논문
💻 computer science

Hierarchical Compositionality for An Assistive AI Agent

본 논문은 계층적 구성성과 인간이 검증한 의미론적 특징을 활용하여 추론과 사용자 맞춤형 적응을 통해 객체 모호성을 효과적으로 해결함으로써, 최신 데이터 기반 베이스라인 모델들을 능가하는 자원 효율적이고 해석 가능한 AI 에이전트 아키텍처를 제안한다.

원저자: Tianyi Fu, Mohan Sridharan

게시일 2026-08-12
📖 7 분 읽기🧠 심층 분석

원저자: Tianyi Fu, Mohan Sridharan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 주방에서 친구에게 짧은 지시를 내리고 있다고 상상해 보세요. "과일 좀 가져다줘." 만약 카운터 위에 사과, 바나나, 오렌지가 있다면, 당신의 친구는 잠시 멈칫할 수 있습니다. 그들은 당신이 무엇을 의미하는지 추측해야 합니다. 인간은 단순히 단어만 보는 것이 아니라, 당신이 평소에 무엇을 먹는지, 5분 전에 무엇을 하고 있었는지, 그리고 지금 이 순간에 무엇이 적절한지를 기억하기 때문에 이 일을 아주 잘 해냅니다. 우리는 매번 "어떤 과일?"이라고 묻지 않고도 문제를 해결하기 위해 일종의 정신적 지름길(mental shortcut)을 사용합니다.

이것이 바로 인공지능(AI), 구체적으로는 **인간-로봇 상호작용(Human-Robot Interaction)**의 세계입니다. 과학자들은 이곳에서 우리 집을 도와줄 수 있는 로봇과 디지털 비서를 만들기 위해 노력하고 있습니다. 오랫동안 이 조력자들을 만드는 가장 인기 있는 방법은 **거대 언어 모델(LLM)**이라 불리는 거대한 "블랙박스" 컴퓨터를 사용하는 것이었습니다. LL 이를 인터넷에 있는 거의 모든 것을 읽은 초지능적인 앵무새라고 생각하면 됩니다. 이들은 문장에서 다음에 올 단어를 예측하는 데는 놀라울 정도로 뛰어나지만, 다소 무질서할 수 있습니다. 새로운 상황에 직면했을 때 무작ful하게 추측하기도 하고, 실행하는 데 엄청난 에너지가 필요하며, 왜 바나나 대신 사과를 선택했는지에 대한 "이해"가 없습니다. 그저 패턴에 기반하여 가장 확률이 높은 것을 선택할 뿐입니다.

연구자들이 던지는 핵심 질문은 이것입니다. "단순히 더 큰 기억력을 갖는 것보다, 어떻게 생각하는지에 대해 더 똑똑한 AI를 만들 수 있을까?" 즉, 슈퍼컴퓨터 없이도 간단한 인간형 논리와 습관을 사용하여 문제를 빠르게 해결하도록 가르칠 수 있을까요? 이 논문은 바로 그 퍼즐을 파고듭니다. 논리과 기억의 영리한 조합을 사용하여 단순히 추측하는 것이 아니라, 스스로 추론하여 정답에 도달하는 AI 비서를 만들고자 하는 시도입니다.


문제점: "어떤 것?"의 딜레마

당신이 집에서 유능한 로봇의 주인이라고 상상해 보세요. 당신이 "과일을 테이블 위에 놓아줘"라고 말합니다. 당신의 주방에는 사과, 오렌지, 바나나가 있습니다. 인간에게 이것은 쉽습니다. 당신이 방금 사과를 먹었을 수도 있고, 혹은 서두르는 중이라 보통 바나나를 집어 들곤 할 수도 있기 때문입니다. 하지만 일반적인 AI에게 이것은 악몽입니다. AI는 세 가지 과일을 봅니다. 하지만 당신이 어떤 것을 원하는지는 모릅니다.

AI가 너무 확신이 없으면 멈춰 서서 "어떤 과일인가요?"라고 물을 것입니다. 하지만 명령을 내릴 때마다 매번 그런 질문을 받아야 한다면, 로봇은 짜증스럽고 느려질 것입니다. 반대로, AI가 그냥 추측해 버린다면 잘못된 과일을 가져올 것이고, 당신은 좌절하게 될 것입니다.

이 논문의 저자들은 현대의 AI(예: 대화형 챗봇)가 단어를 예측하는 데는 뛰어나지만, 이러한 개인화된 추측에는 서투르다는 점에 주목했습니다. 이는 마치 세상의 모든 레시피를 알고 있지만, 당신이 고수를 싫어한다는 사실은 모르는 요리사와 같습니다. 그들은 실제로 당신의 특정 습관을 배우고 그것을 이용해 미스터리를 해결하는 로봇을 만들고 싶어 했습니다.

해결책: 3단계 정신적 사다리

AI가 무작위로 추측하거나 거대하고 불투명한 뇌에 의존하게 하는 대신, 저자들은 **계층적 구성성(Hierarchical Compositionality)**에 기반한 새로운 종류의 아키텍처(로봇이 생각하는 방식의 청사진)를 구축했습니다. 이것은 멋진 말로 표현하자면, "사물을 작은 조각으로 나누고, 그것들을 다시 그룹으로 쌓아 올린 다음, 그 그룹들이 '당신'과 어떻게 연결되는지 학습하는 것"입니다.

레고 블록으로 만드는 것을 생각해 보세요.

레벨 0: 브릭 (원자적 속성 - Atomic Attributes)
먼저, 로봇은 집 안의 모든 물체를 살펴보고 이를 작고 단순한 특징들로 분해합니다. 단순히 "사과"라고 보는 대신, 빨갛다, 둥글다, 달콤하다, 꼭지가 있다와 같이 봅니다. 이것들은 기본적인 레고 브록과 같습니다. 로봇은 인간이 실제로 사물을 묘사하는 방식이 담긴 데이터베이스로부터 이러한 설명을 얻습니다.

레벨 1: 사전 제작된 세트 (도메인 개념 - Domain Concepts)
다음으로, 로봇은 특정 브릭들이 항상 함께 붙어 있다는 것을 알아차립니다. 빨갛다, 둥글다, 꼭지가 있다가 자주 함께 나타나는 것을 보고, 이를 "사과 같은(Apple-like)"이라는 하나의 "개념"으로 그룹화합니다. 로봇은 모든 것에 대해 이 작업을 수행합니다. "램프"는 빛을 내보냄, 전구가 있음, 테이블 위에 놓임이라는 그룹이 될 수 있습니다. 이것은 모두가 공유하는 로나의 일반적인 세상 지식입니다.

레벨 2: 당신만의 플레이북 (사용자 특화 패턴 - User-Specific Patterns)
이 부분이 마법 같은 부분입니다. 로봇은 당신을 관찰하기 시작합니다. 로봇은 당신이 "책 같은(Book-like)" 물체(인쇄된 텍스트가 있고 평평함)와 상호작용할 때마다, 거의 항상 "램프 같은(Lamp-like)" 물체를 켠다는 것을 알아차립니다. 로봇은 단순히 "당신이 책을 좋아한다"고 기억하는 것이 아니라, 다음과 같은 패턴을 학습합니다: 책 → 램프.

이것이 바로 계층적 구성성입니다. 로봇은 지식의 사다리를 구축합니다:

  1. 브릭: 사물이 무엇으로 만들어졌는가.
  2. 세트: 어떤 그룹의 사물들이 존재하는가.
  3. 당신의 플레이북: 당신이 구체적으로 한 그룹에서 다른 그룹으로 어떻게 이동하는가.

로봇은 미스터리를 어떻게 해결하는가

당신이 "과일을 테이블 위에 놓아줘"라고 말하면, 로봇은 어떤 과일을 의미하는지 알아내기 위해 3단계 과정을 거칩니다.

1단계: 논리 필터 (금지 구역 - The "No-Go" Zone)
먼저, 로봇은 엄격한 논리(답 집합 프로그래밍 - Answer Set Programming)를 사용하여 불가능한 옵션들을 제외합니다. 만약 테이블이 이미 가득 찼거나, 과일이 잠긴 상자 안에 있다면, 그 옵션들을 목록에서 제거합니다. 이는 클럽 입구에서 신분증을 검사하는 보안 요원과 같습니다.

2단계: 세 가지 단서 (후보 점수 산정 - Scoring the Candidates)
여전히 여러 개의 과일이 남아 있다면(예: 사과와 바나나), 로봇은 세 가지 서로 다른 "단서"를 사용하여 점수를 매깁니다.

  • 의미론적 단서 (맥락 - Semantic Clue/Context): 이전에 무슨 일이 있었는가? 만약 당신이 방금 책을 테이블 위에 두었다면, 로봇은 "아, 이것은 '독서' 맥락이구나"라고 생각합니다. 그리고 어떤 과일이 독서 맥락에 가장 잘 어울리는지 확인합니다.
  • 현저성 단서 (최신성 - Salience Clue/Recency): 당신이 방금 무엇을 만졌는가? 만약 당신이 방금 사과를 잡았다면, 사과는 당신의 머릿속에 가장 최근의 정보이므로 높은 점수를 받습니다.
  • 주제적 단서 (당신의 습관 - Thematic Clue): 여기서 레벨 2 사다리가 등장합니다. 로봇은 당신의 개인 플레이북을 확인합니다. "이 사용자는 독서 후에 보통 바나나를 집는가?" 만약 그렇다면, 바나나는 엄청난 점수 보너스를 받습니다.

3단계: 결정 (The Decision)
로봇은 점수를 합산합니다. 만약 한 과일이 (충분한 차이로) 확실한 승자라면, 로봇은 그 과일을 집습니다. 만약 점수가 너무 비슷하다면, 로봇은 "사과를 원하시나요, 아니면 바나나를 원하시나요?"라고 질문합니다. 이는 로봇이 맹목적으로 추측하지 않도록 보장합니다.

실험 결과가 보여주는 것

저자들은 66개의 서로 다른 물체(컵, 책, 조명, 과일 등)와 고유한 습관을 가진 5명의 "사용자"가 있는 시뮬레이션된 집에서 이 로봇을 테스트했습니다. 그들은 로봇에게 3,000개의 모호한 명령을 해결하도록 했습니다.

그들은 자신들의 새로운 로봇을 최신 기술 수준의 거대 모델(최신 LLM 등) 및 자신들의 로봇의 더 단순한 버전들과 비교했습니다.

결과:

  • 새로운 로봇의 승리: 거의 모든 테스트에서, 계층적 구조를 가진 이 로봇은 거대 AI 모델들이 정확히 동일한 정보에 접근할 수 있었음에도 불구하고 훨씬 더 높은 정확도를 보였습니다.
  • "패턴"의 힘: 로봇은 명령이 매우 모호할 때(예: "사과" 대신 "그것"이라고 말할 때) 특히 뛰어났습니다. 이런 어려운 경우, 로봇의 레벨 2 패턴(당신의 개인적 습관) 활용 능력은 결정적인 차이를 만들었습니다. 거대 AI 모델들은 개인 플레이북이 없었기에 계속 잘못된 추측을 했습니다.
  • 질문은 줄이고, 실행은 늘리고: 새로운 로봇은 다른 모델들보다 도움(명확화 질문)을 요청하는 횟수가 훨씬 적었지만, 결정을 내릴 때는 더 자주 정답을 맞혔습니다.
  • "전이" 기술: 로봇은 이전에 본 적 없는 새로운 물체가 있더라도, 그 물체가 기존 물체와 동일한 "브릭(속성)"을 공유한다면 당신이 무엇을 원하는지 알아낼 수 있었습니다. 예를 들어, 당신이 평소에 복숭아를 즐겨 먹는다면, 로봇은 복숭아와 비슷하게 생기고 느낌이 비슷한 새로운 과일을 보았을 때 당신이 그것을 원할 것이라고 추측합니다.

이 논문이 주장하지 않는 것

이 논문이 주장하는 바가 아님을 명시하는 것이 중요합니다.

  • 이 논문은 거대 언어 모델(LLM)이 쓸모없다고 말하는 것이 아닙니다. 단지 이 특정 작업(개인화된 저데이터 추론)에는 최선의 도구가 아니라는 뜻입니다.
  • 이 논문이 모든 AI 문제를 해결했다고 주장하는 것도 아닙니다. 이 로봇은 아직 컴퓨터 시뮬레이션 내에 있으며, 실제 물리적 로봇에 적용되어 현실 세계에서 테스트될 필요가 있습니다.
  • 이 로봇이 "의식을 가지고 있다"고 말하는 것도 아닙니다. 로봇은 단지 인간이 사용하는 지름길을 모방하기 위해 영리한 수학과 논리를 사용할 뿐입니다.

요약

이 논문은 우리가 더 나은 비서를 만들기 위해 반드시 더 크고 비싼 AI 뇌를 가질 필요는 없다는 것을 시사합니다. 때로는 우리가 이미 알고 있는 것을 더 똑똑하게 조직하는 방법이 필요합니다. 단순한 사실에서 복잡한 그룹으로 이어지는 "정신적 사다리"를 구축하고, 당신이 그 사다리를 어떻게 오르내리는지를 학습함으로써, AI는 훨씬 더 훌륭하고 직관적인 조력자가 될 수 있습니다. 이는 로봇에게 단순히 사전을 읽게 하는 것이 아니라, 당신의 이야기를 이해하게 만드는 것과 같습니다.

저자들은 이 접근 방식이 현재 분야의 거물들보다 더 효과적이라는 것을 발견했으며, 특히 로봇이 당신의 고유한 습관을 바탕으로 당신이 원하는 것을 추측해야 할 때 더욱 그러했습니다. 이는 로봇이 단순히 명령을 따르는 것을 넘어, 실제로 우리를 이해하게 되는 단계로 가는 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →