← 최신 논문
🤖 AI

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

이 논문은 다양하고 불균형한 행동 데이터로부터 효과적으로 학습하여 여러 태스크와 벤치마크에서 최첨단 성능과 일관된 추론 능력을 달감하는 새로운 이질성 인지 상대적 정책 최적화(Heterogeneity-Aware Relative Policy Optimization) 방법을 활용한 사회적 행동 처리를 위한 파운데이션 모델인 OmniSapiens-7B 2.0을 소개한다.

원저자: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 인간의 행동을 이해하도록 AI를 가르치기

당신이 로봇에게 인간의 행동을 이해하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 비꼬는 말투를 알아채고, 우울증을 감지하며, 유머를 이해하고, 바디랭귀지를 읽고, 누군가의 감정을 파악하는 등 아주 다양한 일을 잘하기를 원합니다.

문제는 인간의 행동이 매우 무질서하고 다양하다는 점입니다. 어떤 과업은 소리 지르는 것(매우 큰 신호)과 같고, 다른 과업은 속삭이는 것(매우 작은 신호)과 같습니다. 만약 이 모든 것을 일반적인 AI에게 한꺼번에 던져준다면, "소리 지르는" 과업들이 "속삭임"을 압도하게 됩니다. 그러면 AI는 시끄러운 것들은 아주 잘하게 되지만, 조용한 것들은 완전히 무시하게 됩니다.

이 논문의 저자들은 이 문제를 해결하기 위해 OmniSapiens-7B 2.0이라는 새로운 AI 모델을 만들었습니다. 이 모델은 여러 가지 다양한 과업을 동시에 처리하면서도, 가장 시끄러운 데이터에 의해 혼란을 겪거나 편향되지 않도록 설계된 "사회적 지능"을 가진 두뇌입니다.

문제점: "우는 아기" 효과

이 논문은 기존의 AI 모델들이 학습하는 데이터가 이질적(heterogeneous)(섞여 있고 불균형함)이기 때문에 어려움을 겪는다고 설명합니다.

  • 비유: 한 명의 교사가 동시에 10가지 서로 다른 과목을 가르치려고 노력하는 교실을 상상해 보세요. 한쪽 구석에서는 한 학생이 수학 문제의 정답을 소리 지르고 있습니다(매우 쉽고 큰 신호). 다른 쪽 구석에서는 다른 학생이 슬픔에 관한 복잡한 시를 속삭이고 있습니다(어렵고 작은 신호).
  • 결과: 표준적인 교사(또는 AI)는 그 소리 지르는 학생에게 전적으로 집중하게 될 것입니다. 왜냐하면 그 피드백이 듣기에 훨씬 쉽기 때문입니다. 교사는 속삭이는 학생을 무시할 것입니다. AI 용어로 말하자면, 모델은 쉬운 과업에는 뛰어나지 모르지만, 미묘하고 복잡한 과업에서는 실패하게 됩니다.

해결책: "공정성 코치" (HARPO)

이 문제를 해결하기 위해 연구진은 HARPO(Heterogeneity-Aware Relative Policy Optimization, 이질성 인지 상대적 정책 최적화)라는 새로운 학습 방법을 발명했습니다.

  • 비유: HARPO를 교실에 서 있는 매우 똑똑한 "공정성 코치"라고 생각해 보세요.
    1. 경청: 코치는 모든 학생의 답변을 듣습니다.
    2. 노력 측정: 코치는 각 학생이 기여하는 "소음"(또는 학습 신호)이 어느 정도인지 계산합니다.
    3. 볼륨 조절: 만약 수학을 공부하는 학생이 너무 크게 소리를 지른다면, 코치는 그 학생의 마이크 볼륨을 약간 낮춥니다. 만약 시를 읊는 학생이 너무 작게 속삭인다면, 코치는 그 학생의 마이크 볼륨을 높입니다.
    4. 목표: 코치는 소리가 크든 작든 상관없이, 모든 학생이 수업에 공정하게 영향을 미칠 수 있도록 보장합니다.

기술적인 관점에서 보면, HARPO는 각 특정 과업이나 데이터 샘플이 AI의 학습에 얼마나 기여하는지를 살펴봅니다. 그런 다음 수학적으로 조용한 신호는 "볼륨을 높이고", 시끄러운 신호는 "볼륨을 낮추어" AI가 모든 것을 동등하게 학습하도록 만듭니다.

결과: 올스타 플레이어

연구진은 이 새로운 AI(OmniSapiens-7B 2.0)를 불안 감지부터 비언어적 몸짓 이해에 이르기까지 10가지의 다양한 행동 과업을 대상으로 테스트했습니다.

  • 스코어보드: OmniSapiens는 단순히 승리한 것이 아니라 압도했습니다. 이 모델은 10가지 모든 과업에서 동시에 최고의 성적을 거두었습니다.
  • 비교: 다른 최고 수준의 AI 모델들과 비교했을 때, OmniSapiens는 전체적으로 최대 12% 더 나은 성능을 보였습니다. 더욱 인상적인 것은, AI가 이전에 본 적 없는 5가지 새로운 과업(예: 자폐증이나 심각한 우울증 감지)에 대해 테스트되었을 때도 다른 모든 모델보다 최대 9% 더 뛰어난 성능을 유지했다는 점입니다.
  • 이유: 논문은 "공정성 코치"(HARPO)가 AI가 조용하고 어려운 신호로부터도 학습할 수 있게 함으로써, AI가 더 깊고 유연한 인간 행동 이해력을 갖게 되었다고 제안합니다. AI는 단순히 큰 소리의 정답을 암기한 것이 아니라, 그 밑바탕에 깔린 패턴을 학습한 것입니다.

보너스: 더 명확한 사고 과정

논문은 또한 AI가 어떻게 생각하는지도 살펴보았습니다. 문제를 해결할 때, 이 AI는 자신의 추론 단계(마치 풀이 과정을 보여주는 학생처럼)를 적습니다.

  • 기존 모델들: 종종 길고 장황하거나 혼란스러운 설명을 늘어놓거나, 때로는 생각 없이 그냥 답을 추측하기도 합니다.
  • OmniSapiens: 더 짧고, 명확하며, 일관된 추론을 만들어냅니다. 이는 마치 단순히 정답만 맞히는 것이 아니라, 논리적이고 간결하게 이유를 설명하는 학생과 같습니다. 이는 AI를 실제 환경에서 더 신뢰할 수 있게 만듭니다.

요약

이 논문은 서로 다른 학습 신호의 "볼륨"을 조절하는 새로운 방법(HARPO)을 발명함으로써, 다음과 같은 특징을 가진 AI(OmniSapiens-7B 2.0)를 만들었다고 주장합니다:

  1. 모든 면에서 더 뛰어남: 10가지 다양한 사회적 과업에서 승리합니다.
  2. 새로운 일에도 더 능숙함: 보지 못한 과업에 대해서도 잘 일반화합니다.
  3. 더 명확함: 이전 모델들보다 자신의 추론 과정을 더 잘 설명합니다.

핵심적인 교훈은, 진정으로 사회적 지능을 가진 AI를 구축하려면 단순히 "시끄러운" 데이터가 지배하도록 내버려 두어서는 안 되며, "속삭임" 또한 똑같이 명확하게 들릴 수 있도록 보장하는 메커니즘이 필요하다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →