← 최신 논문
🤖 machine learning

Graph is a Substrate Across Data Modalities

본 논문은 통합된 구조 스키마와 교차된 역할 기반 학습을 통해 이질적인 모달리티와 작업 전반에 걸쳐 그래프 구조를 지속적 기질로 취급하는 표현 중심 프레임워크인 G-Substrate를 제안하며, 이를 통해 구조적 규칙성을 축적함으로써 전통적인 고립된 학습 방법보다 우수한 성능을 달성합니다.

원저자: Ziming Li, Xiaoming Wu, Zehong Wang, Jiazheng Li, Yijun Tian, Jinhe Bi, Yunpu Ma, Yanfang Ye, Chuxu Zhang

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziming Li, Xiaoming Wu, Zehong Wang, Jiazheng Li, Yijun Tian, Jinhe Bi, Yunpu Ma, Yanfang Ye, Chuxu Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"그래프는 다양한 데이터 모달리티에 걸친 기반이다"라는 논문을 간단한 언어와 창의적인 비유로 설명합니다.

큰 문제: "일회용 청사진"

당신이 건축가라고 상상해 보세요. 집을 지을 때마다 청사진을 그립니다. 하지만 현재의 인공지능 세계에서는 집이 지어지면 그 청사진을 쓰레기통에 버립니다. 그다음 다리를 지어야 할 때, 중력이나 하중 지지와 같은 물리 법칙이 둘 다 동일함에도 불구하고, 처음부터 새로운 청사진을 그립니다.

인공지능 세계에서는 그래프가 바로 이러한 청사진입니다. 이는 분자 내의 원자, 사진 속의 사물, 또는 이야기 속의 사건처럼 사물들이 어떻게 연결되어 있는지를 보여주는 지도입니다.

현재 인공지능 모델들은 이러한 그래프를 작업별 일회용 품목으로 취급합니다.

  • 인공지능이 사진을 사물의 그래프로 매핑하는 법을 배우면, 사진이 설명된 후 그 그래프를 버립니다.
  • 다른 인공지능이 이야기를 사건의 그래프로 매핑하는 법을 배우면, 이야기가 분석된 후 그 그래프를 버립니다.

이러한 그래프들의 구조는 종종 유사함에도 불구하고 (예: 여러 가지가 하나의 중심점에 연결되는 '허브'), 인공지능은 매번 이러한 패턴을 처음부터 다시 학습해야 합니다. 이는 목수가 못을 박을 때마다 망치를 다시 발명하는 것과 같습니다.

새로운 아이디어: "보편적 기반"

저자들은 새로운 사고방식을 제안합니다: 그래프는 기반이다.

**기반 (substrate)**을 정원의 비옥한 토양 층이라고 생각하세요.

  • 옛 방식: 토마토를 심고 수확한 뒤, 장미를 심기 위해 토양을 파내어 흔듭니다. 토양은 매번 교란되고 초기화됩니다.
  • 새 방식 (G-Substrate): 토양을 영구적이고 공유된 기초로 취급합니다. 토마토를 심고 뿌리가 자리를 잡게 한 뒤, 같은 토양에 장미를 심습니다. 토양 (그래프 구조) 은 지속되며 영양분 (지식) 을 축적하고 동시에 다양한 식물 (작업) 을 지지합니다.

이 새로운 프레임워크에서 그래프는 단순한 임시 산출물이 아닙니다. 그것은 다양한 유형의 데이터 (이미지, 텍스트, 분자) 와 다양한 작업 (추론, 예측, 생성) 을 가로질러 살아있고 유용한 지속적인 중간 상태입니다.

어떻게 작동하게 했는가: 두 가지 마법 도구

이 "보편적 토양"을 작동시키기 위해 저자들은 G-Substrate라는 프레임워크를 구축했으며, 여기에는 두 가지 주요 도구가 있습니다.

1. 보편적 번역기 (통합 구조 스키마)

다른 언어들은 문법이 다르지만, 모두 명사와 동사를 가지고 있습니다. 마찬가지로 분자 그래프 (원자) 와 장면 그래프 (방 안의 사물) 는 표면적으로는 다르게 보일 수 있습니다.

  • 문제: 분자로 훈련된 인공지능은 장면 그래프의 "언어"를 구사하지 못합니다.
  • 해결책: 저자들은 보편적 번역기를 만들었습니다. 그래프가 어디에서 왔든 상관없이 모두 정확히 동일한 간단한 형식, 즉 *(개체 A) —(관계)—> (개체 B)*로 쓰이도록 강제했습니다.
  • 비유: 파티에 참석한 모든 사람이 서로 다른 언어를 말한다고 상상해 보세요. 별도의 대화를 나누는 대신, 모두가 단일하고 간단한 "보편적 피진어"로 말하기로 합의합니다. 이제 다리를 짓는 법을 아는 사람과 케이크를 굽는 법을 아는 사람이 서로 쉽게 대화할 수 있습니다. 둘 다 동일한 기본 문장 구조를 사용하기 때문입니다.

2. 역할극 게임 (교차 훈련)

옛 방식에서는 그래프가 "만들어지는" (생성) 것이거나 "읽히는" (이해) 것이지, 드물게 둘 다는 아닙니다.

  • 문제: 그래프가 만들어지는 것만 훈련되면, 읽히는 것은 서툴러집니다. 마치 글을 쓰지만 절대 읽지 않는 작가를 훈련하는 것과 같습니다. 그들은 어떤 이야기가 읽히게 만드는지 모르기 때문에 터무니없는 글을 쓸 수 있습니다.
  • 해결책: 저자들은 교차 훈련 (Interleaved Training) 전략을 사용합니다. 동일한 그래프를 가져와 훈련 도중 역할을 오가게 합니다.
    • 단계 1: 인공지능이 사진을 보고 그래프를 만듭니다 (역할: 생성기).
    • 단계 2: 인공지능은 그 정확히 동일한 그래프를 가져와서 그것을 이용해 퍼즐을 풉니다 (역할: 해결사).
    • 단계 3: 인공지능이 텍스트 이야기를 보고 그래프를 만듭니다.
    • 단계 4: 그 그래프를 이용해 질문에 답합니다.
  • 비유: 체스를 배우는 학생을 상상해 보세요. 컴퓨터와 대결하는 것만 하는 대신, 게임을 한 뒤 즉시 같은 보드 상태를 이용해 친구를 코칭하고, 그 보드를 기반으로 퍼즐을 푸는 일을 강요받습니다. 보드를 여러 가지 방식으로 사용해야 하기 때문에, 그들은 한 게임만 하고 멈추는 경우보다 체스의 진정한 규칙을 훨씬 더 빠르고 깊이 있게 배우게 됩니다.

무슨 일이 일어났는가? (결과)

연구자들은 네 가지 매우 다른 세계에서 이를 테스트했습니다:

  1. 수학/논리: 그래프 퍼즐 해결 (예: 최단 경로 찾기).
  2. 화학: 분자 설명.
  3. 시각: 사진 속 내용 설명 (장면 그래프).
  4. 언어: 이야기 속 사건 매핑.

발견 사항:

  • 더 나은 성능: G-Substrate 접근법은 거의 모든 카테고리에서 "청사진을 버리는" 옛 방식보다 더 좋은 성과를 거두었습니다.
  • 최적점: 인공지능이 복잡한 추론 (예: 긴 경로를 가로질러 점들을 연결하는 것) 을 해야 할 때 가장 큰 향상이 있었습니다.
  • 회복탄력성: 그래프가 약간 지저분하거나 불완전할 때 (예: 얼룩이 찍힌 청사진) 도 시스템은 여전히 잘 작동했습니다. 이는 인공지능이 표면적인 세부 사항만 암기하는 것이 아니라, 그래프를 여러 가지 방식으로 사용하게 함으로써 핵심 구조를 학습했음을 시사합니다.

요약

이 논문은 그래프 구조를 일회용 도구로 취급함으로써 현재 인공지능의 잠재력을 낭비하고 있다고 주장합니다. 그래프를 **영구적이고 공유된 기초 (기반)**로 취급하고, 인공지능이 동일한 그래프를 구축과 이해 모두에 사용하도록 강제함으로써, 이미지, 텍스트, 과학 사이의 구조적 유사성에서 학습하는 더 똑똑하고 효율적인 모델을 만들 수 있습니다. 이를 통해 이들을 완전히 분리된 세계로 취급하지 않게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →