← 최신 논문
🤖 machine learning

AETDICE: Unified Framework and Offline Optimization for Nonlinear Multi-Objective RL

이 논문은 정적 데이터셋을 사용하는 비선형 다목적 강화 학습을 위해 샘플 기반 최적화를 용이하게 하고자 스칼라화된 기대 수익(Scalarized Expected Return, SER)과 기대 스칼라화된 수익(Expected Scalarized Return, ESR) 패러다임 사이의 간극을 메우는 통합 프레임워크이자 오프라인 RL 알고리즘인 AETDICE를 소개한다.

원저자: Woosung Kim, Youngjun Suh, Jinho Lee, Jongmin Lee, Byung-Jun Lee

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Woosung Kim, Youngjun Suh, Jinho Lee, Jongmin Lee, Byung-Jun Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 택시 운전법을 가르치고 있다고 상상해 보세요. 하지만 이것은 단순히 A 지점에서 B 지점으로 이동하는 것에 관한 것이 아닙니다. 로봇은 동시에 여러 가지 상충하는 목표 사이에서 균형을 잡아야 합니다. 예를 들어, 속도를 높이고 싶으면서도 동시에 에너지를 아껴야 할 수도 있습니다. 혹은, 가장 많은 돈을 지불하는 사람들에게만 집중하는 대신, 서로 다른 두 그룹의 승객을 똑같이 대우해야 할 수도 있습니다.

로봇 공학과 AI의 세계에서, 이것은 **다목적 강화 학습(Multi-Objective Reinforcement Learning, MORL)**이라고 불립니다. 문제는 "좋다"는 것이 사람마다 다르게 정의될 때, 로봇에게 무엇이 "좋은 것"인지 어떻게 알려줄 것인가 하는 점입니다.

오래된 문제: 두 가지 서로 다른 규칙 세트

오랫동안 연구자들은 로봇을 가르치는 두 가지 매우 다른 방식을 선택해야 했으며, 이 둘을 섞을 수는 없었습니다.

  1. "평균" 접근 방식 (SER): 당신은 로봇에게 이렇게 말합니다. "많은 여정을 거치는 동안 평균적으로 균형을 유지해라." 이것은 마치 교장 선생님이 "오늘 수학 시험을 한 번 망치더라도, 일 년 전체의 평균 성적이 좋다면 상관없다"라고 말하는 것과 같습니다. 로봇은 나중에 더 나은 평균을 얻기 위해 때때로 특정 여정에서 실패하는 위험을 감수하는 법을 배웁니다.
  2. "매 여정마다" 접근 방식 (ESR): 당신은 로봇에게 이렇게 말합니다. "매번 모든 여정은 균형 잡혀 있어야 한다." 이것은 엄격한 부모님이 "너는 모든 시험에서 A를 받아야 한다"라고 말하는 것과 같습니다. 만약 로봇이 수학 시험 하나를 망친다면, 전체 전략은 엉망이 됩니다. 이는 훨씬 더 어렵습니다. 왜냐하면 로봇은 올바른 결정을 내리기 위해 과거에 무슨 일이 있었는지(예: "이미 A 그룹을 태웠으니, 이제는 반드시 B 그룹을 태워야 한다")를 정확히 기억해야 하기 때문입니다.

문제는 기존의 AI 방식들이 "평균" 접근 방식이나 "매 여정마다" 접근 방식 중 하나는 처리할 수 있었지만, 두 가지를 동시에 처리할 수는 없었다는 점입니다. 게다가, 더 심각한 것은 아무도 로봇이 실세계에서 실수하며 돌아다니게 하지 않고, 오직 고정된 데이터셋(과거의 운전 기록 라이브러리 같은 것)만을 사용하여 이 복잡한 규칙들을 가르칠 방법을 찾아내지 못했다는 것입니다.

새로운 해결책: AETDICE

이 논문의 저자들은 AETDICE라는 새로운 프레임워크를 구축했습니다. 이것은 어떤 조합의 규칙도 이해할 수 있는 '보편적인 번역기'라고 생각하면 됩니다.

그들이 이 문제를 해결한 방법은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. "기억 배낭" (확장된 상태 - Augmented State)

"매 여정마다" 규칙의 가장 큰 골칫거리는 로봇이 자신의 이력을 기억해야 한다는 점입니다. 만약 로봇이 단순히 현재의 길 모퉁이만 본다면, 자신이 이미 첫 번째 승객 그룹을 태웠는지 알 수 없습니다.

  • 해결책: 저자들은 로봇에게 배낭을 주었습니다. 로봇이 한 단계를 밟을 때마다, 자신의 "현재까지의 점수"를 배낭에 적어 넣습니다. 이제 로봇이 길 모퉁이를 볼 때, 단순히 "모퉁이"만 보는 것이 아니라 "모퉁이 + 배낭 점수"를 보게 됩니다.
  • 효과: 이 방식은 혼란스럽고 기억에 의존적인 문제를 표준적인 문제로 바꿔줍니다. 이제 로봇은 일반적인 로봇이 "길 모퉁이"를 보고 결정하듯 "모퉁이 + 배낭"을 바탕으로 결정을 내릴 수 있습니다.

2. "지도를 다시 쓰기" (변환된 보상 - Transformed Rewards)

보통 당신은 로봇에게 "가게에 가면 10점을 준다"라고 말합니다. 하지만 복잡한 규칙(예: "점수 균형 맞추기")이 적용되면, 점수는 고정되어 있지 않고 배낭의 내용에 따라 달라집니다.

  • 해결책: 저자들은 지도를 바꿨습니다. 여정이 끝날 때 점수를 주는 대신, 각 개별 단계가 최종 목표에 얼마나 기여했는지를 계산하여 그 작은 조각의 점수를 즉시 로봇에게 주었습니다.
  • 효과: 이를 통해 로봇은 미래에 어떤 일이 일어날지 추측할 필요 없이, 고정된 데이터셋(과거 여정의 라이브러리)으로부터 학습할 수 있습니다. 이는 복잡하고 전역적인 퍼즐을 일련의 단순하고 국소적인 단계들로 바꾸어 줍니다.

3. "글로벌 밸런서" (DICE 최적화 - DICE Optimization)

로봇이 배낭과 새로운 지도를 갖게 되었더라도, 여전히 까다로운 부분이 남아 있습니다. 바로 개별적인 여정을 넘어 전체적인 균형을 보장하는 것입니다.

  • 해결책: 그들은 DICE(분포 교정 추정 - Distribution Correction Estimation)라는 수학적 도구를 사용했습니다. 당신의 특정 목표에 대해 어떤 구슬은 "좋은" 구슬이고 어떤 구슬은 "나쁜" 구슬인, 과거의 모든 여정을 나타내는 구슬 주머니가 있다고 상상해 보세요. DICE는 스마트한 필터처럼 작동하여 구슬들의 가중치를 재조정합니다. 즉, 로봇에게 "너무 탐욕스러웠던 여정은 무시하고, 균형을 잡았던 여정에 집중하라"고 알려주는 것입니다.
  • 효과: 이를 통해 로봇은 원래의 데이터가 지저도 편향되어 있더라도 완벽한 전략을 찾아낼 수 있습니다.

그들은 무엇을 발견했는가?

이 새로운 시스템을 테스트했을 때, 그들은 기존의 방식으로는 달성할 수 없었던 놀라운 행동들을 발견했습니다.

  • "확률적" 조합 (The "Stochastic" Mix): 때로는 최선의 전략이 100% 일관성을 유지하는 것이 아닐 수도 있습니다. 로봇은 "동전 던지기"가 되는 법을 배웠습니다. 여정의 50%에서는 승객 그룹 A에 완전히 집중하고, 나머지 50%에서는 그룹 B에 완전히 집중하는 식입니다. 결과적으로 평균적으로 이것이 가장 균형 잡힌 결과가 됩니다. 기존 방식은 로봇을 항상 A만 하는 "전문가"이거나, 항상 나누어서 하는 "제너럴리스트" 중 하나로 강요했지만, 이 방식은 그 영리한 중간 지점을 놓치지 않았습니다.
  • "이력을 인지하는" 운전자: "매 여정마다" 규칙을 위해, 로봇은 배낭에 따라 행동을 바꾸는 법을 배웠습니다. 만약 이미 그룹 A를 태웠다면, 길의 모습이 이전과 똑같더라도 그룹 B를 찾기 위해 공격적으로 움직였습니다. 이는 표준적인 AI가 정적인 데이터로부터 학습하기 어려운 행동입니다.

핵심 요약

이 논문은 AI 에이전트가 오직 과거의 데이터만을 사용하여 복잡하고 경쟁하는 목표들을 처리하도록 훈련하는 새로운 방법을 제시합니다. 이는 "평균적인 성능"과 "완벽한 일관성" 사이의 간극을 메워주며, 로로봇이 실세계와 상호작용하지 않고도 다양한 상황에 맞춰 공정하고 균형 잡히며 적응력 있는 전략을 학습할 수 있게 해줍니다.

요약하자면, 그들은 로봇에게 기억 배낭을 주고 지도를 읽는 더 스마트한 방법을 제공함으로써, 로봇이 과거의 영상 라이브러리만을 사용하여 여러 목표를 완벽하게 조절하며 학습할 수 있게 하는 보편적인 훈련 키트를 만들어낸 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →