← 최신 논문
💬 NLP

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

이 논문은 오모니 LLM 의 정교한 오모달 추론 능력을 향상시키기 위해 교차 모달 코어퍼런스 문제를 공식화하고, 이를 해결하기 위한 새로운 데이터셋 CrossOmni 와 훈련 기반 및 훈련 없는 두 가지 전략을 제안하여 모델의 성능을 크게 개선함을 보여줍니다.

원저자: Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **'오만-LLM(Omni-LLM)'**이라는 최신 인공지능의 약점을 발견하고, 그 약점을 치료하는 방법을 제안한 연구입니다.

간단히 비유하자면, **"인공지능이 모든 감각 (눈, 귀, 입) 을 다 갖췄는데, 정작 그 감각들을 서로 연결해 논리적으로 생각할 때는 자꾸 헷갈려 한다"**는 문제입니다.

이 논문의 핵심 내용을 일상적인 언어와 비유로 설명해 드릴게요.


1. 문제: "눈과 귀가 따로 놀고 있어요"

상상해 보세요. 인공지능이 아주 똑똑한 수사관이라고 가정해 봅시다.

  • 눈 (영상): 범인의 옷차림, 표정, 행동을 잘 봅니다.
  • 귀 (음성): 목소리 톤, 말투, 감정을 잘 듣습니다.
  • 입 (텍스트): 범인의 신상 정보, 과거 이력 등을 잘 읽습니다.

기존의 인공지능은 이 세 가지 정보를 각각 따로따로 잘 처리합니다. 하지만 **"1985 년에 태어난 사람의 목소리는 어떤가?"**라는 질문을 받으면 엉망이 됩니다.

  • 텍스트를 보니 "1985 년생은 A 씨"라고 나와 있습니다.
  • 영상에는 A 씨가 앉아 있습니다.
  • 그런데 음성을 듣는 순간, "아, 이 목소리는 A 씨가 아니라 B 씨네?"라고 헷갈려서 틀린 답을 내놓습니다.

핵심 문제: 인공지능은 각 감각 (모달리티) 은 잘 보지만, **"이 목소리는 저 영상 속 그 사람과 같은 사람이다"**라고 **연결 (Coreference)**하는 능력이 부족합니다. 마치 번역기를 쓰는데, 문장 앞뒤의 '그', '이'가 누구를 가리키는지 계속 헷갈리는 것과 비슷합니다.

2. 해결책 1: 새로운 시험지 만들기 (CROSSOMNI)

연구팀은 인공지능의 이 약점을 정확히 측정하고 훈련시키기 위해 **새로운 시험지 (CROSSOMNI)**를 만들었습니다.

  • 비유: 기존 시험지는 "영상을 보고 설명해라", "소리를 듣고 감정 추려라"처럼 감각별로 따로 보았습니다. 하지만 이 새로운 시험지는 **"영상 속 저 남자가 입은 옷을 보고, 텍스트에 있는 그 사람의 신상 정보를 찾아서, 그 사람의 목소리 톤을 맞춰보라"**는 식의 연결 문제만 냅니다.
  • 이 시험지에는 정답뿐만 아니라 **"어떻게 생각해야 정답에 도달하는지" (추론 과정)**도 함께 적혀 있어서, 인공지능이 올바른 사고방식을 배울 수 있게 도와줍니다.

3. 해결책 2: 사고방식 훈련 (두 가지 치료법)

연구팀은 인공지능이 이 연결 능력을 기르기 위해 두 가지 방법을 썼습니다.

방법 A: "예시 보여주기" (In-Context Learning) - 훈련 없이 해결

  • 비유: 시험을 치르기 전에, "이런 문제는 이렇게 풀면 돼. 1 단계는 사람 찾기, 2 단계는 영상 찾기, 3 단계는 정보 연결하기"라는 해설이 달린 예제를 몇 개 보여주고 시험을 보게 하는 것입니다.
  • 결과: 인공지능이 별도의 학습 없이도, 예시를 보고 "아, 이렇게 연결해야구나!"라고 깨닫고 성적이 크게 향상되었습니다.

방법 B: "강력한 훈련" (SFT + GRPO) - 뇌를 다시 만드는 것

  • 비유: 인공지능에게 "연결하는 사고방식"을 직접 가르쳐서 뇌의 회로를 바꾼 것입니다.
    • SFT (지도 학습): 정답과 함께 "왜 그 답이 맞는지"에 대한 논리적 설명을 반복해서 가르칩니다.
    • GRPO (강화 학습): 인공지능이 스스로 추론할 때, "음, 이 목소리와 이 영상 속 사람이 연결되네?"라고 올바른 사고 흐름을 밟으면 칭찬 (보상) 을 주고, 헷갈리면 지적합니다.
  • 결과: 이 방법으로 훈련된 인공지능은 단순히 정답만 맞추는 게 아니라, 정보를 연결하는 '사고 패턴' 자체를 습득하게 되어, 훨씬 더 똑똑해졌습니다.

4. 결론: 왜 이 연구가 중요한가요?

이 논문의 결론은 매우 명확합니다.

"인공지능이 진짜 똑똑해지려면, 단순히 많은 정보를 모으는 것 (Aggregation) 이 아니라, 서로 다른 정보들을 정확히 연결하는 능력 (Coreference Alignment) 이 필수적이다."

지금까지 인공지능은 "눈으로 보고, 귀로 듣고, 글로 읽는" 능력을 키우는 데 집중했습니다. 하지만 이 연구는 **"눈으로 본 것이 귀로 들은 것과 같은 사람임을 깨닫는 능력"**이 없으면, 아무리 많은 정보를 가져도 복잡한 문제를 풀 수 없다고 지적합니다.

한 줄 요약:
인공지능이 모든 감각을 다 갖췄지만, "이건 저거야!"라고 연결하는 실력이 부족해서 헷갈려 했어요. 그래서 새로운 시험지를 만들고, 올바른 연결 사고방식을 가르쳐주니 훨씬 똑똑해졌어요!

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →