← 최신 논문
💻 computer science

Billion-Scale Graph Foundation Models

본 논문은 이질적 그래프에서 수십억 매개변수 기반 모델의 성공적인 학습을 가능하게 하는 확장 가능한 트랜스포머 아키텍처를 갖춘 엔드투엔드 프레임워크인 GraphBFF를 소개하며, 기존 베이스라인 대비 다양한 하위 작업에서 예측 가능한 신경 확장 법칙과 우수한 성능을 입증합니다.

원저자: Maya Bechler-Speicher, Yoel Gottlieb, Andrey Isakov, David Abensur, Ami Tavory, Daniel Haimovich, Ido Guy, Udi Weinsberg

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maya Bechler-Speicher, Yoel Gottlieb, Andrey Isakov, David Abensur, Ami Tavory, Daniel Haimovich, Ido Guy, Udi Weinsberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수천 가지 종류의 끈으로 모든 책이 서로 연결된 거대하고 혼란스러운 도서관이 있다고 가정해 봅시다. 어떤 끈은 빨간색이고, 어떤 것은 파란색이며, 어떤 것은 밧줄로 만들어졌고 다른 것은 실크로 만들어졌습니다. 어떤 책에는 방대한 양의 메모가 붙어 있는 반면, 다른 책에는 거의 메모가 없습니다. 이것이 데이터 세계에서의 그래프가 갖는 모습입니다: 거대한 연결의 그물망 (소셜 네트워크, 금융 거래, 또는 공급망과 같은) 이죠.

오랫동안 컴퓨터는 텍스트 (책과 같은) 를 읽거나 이미지 (그림과 같은) 를 보는 데 뛰어났습니다. 왜냐하면 그런 것들은 매우 깔끔하고 예측 가능한 구조를 가지고 있기 때문입니다. 하지만 컴퓨터에게 이 messy 하고 거대한 연결의 그물망을 이해하도록 가르치는 것은 믿을 수 없을 정도로 어려웠습니다.

이 논문은 **그래프 기초 모델 (Graph Foundation Model)**을 구축하기 위한 새로운 "레시피"인 GraphBFF를 소개합니다. 이 모델을 상상해 보세요. 이 거대한 도서관의 단 한 권의 책도 빠짐없이 모두 읽었고, 모든 끈이 어떻게 서로를 연결하는지 배운 초지능 사서 말입니다.

다음은 이를 단순한 개념으로 분해한 방법입니다:

1. 문제: 한 가지 크기가 모두에게 맞지 않음

이러한 그물망에 대해 컴퓨터를 가르치려는 이전 시도들은 마치 네모난 못을 둥근 구멍에 억지로 끼우려는 것과 같았습니다.

  • "텍스트" 접근법: 어떤 이들은 그물망을 긴 단어 목록으로 바꾸려 했습니다. 하지만 이는 줄지어 나열된 거리 이름만으로 3 차원 도시를 설명하려는 것과 같습니다; 지도를 잃어버리게 되죠.
  • "이미지" 접근법: 다른 이들은 그물망을 격자 (사진과 같은) 로 취급하려 했습니다. 하지만 그물망은 깔끔한 격자가 아니라 messy 하고 불규칙합니다.

저자들은 10 억 개의 노드가 있는 그물망을 처리하려면 서로 다른 연결은 서로 다른 의미를 가진다는 것을 이해하는 모델이 필요하다는 것을 깨달았습니다. "친구" 연결은 "거래" 연결과 다릅니다.

2. 해결책: GraphBFF Transformer

이들의 발명품의 핵심은 GraphBFF Transformer라는 새로운 뇌 아키텍처입니다. 이는 그물망을 듣기 위해 교묘한 두 부분 전략을 사용합니다:

  • 부분 A: "전문가" 귀 (유형 조건부 주의): 이 부분은 특정 유형의 연결에 주의 깊게 귀를 기울입니다. 만약 당신이 "친구" 연결을 보고 있다면, 이 부분은 다른 "친구" 연결에만 주의를 기울입니다. 프랑스어 대화 중일 때 프랑스어만 말하는 통역사가 있는 것과 같습니다. 이는 다른 연결 유형의 소음에 혼동되지 않도록 보장합니다.
  • 부분 B: "일반인" 귀 (유형 무관 주의): 이 부분은 연결 유형과 관계없이 주변의 모든 것을 듣습니다. 이는 "누가 방 안에 있는가?"에 대한 일반적인 감각과 같습니다. 이는 모델이 큰 그림을 보고 한 가지 유형의 세부 사항에만 매몰되지 않도록 도와줍니다.

이 두 개의 귀를 결합함으로써, 모델은 양쪽 세계의 장점을 모두 얻습니다: 구체적인 세부 사항과 일반적인 이웃을 모두 이해하게 되는 것이죠.

3. 도전 과제: "교통 체증"

10 억 개의 노드가 있는 그래프를 학습하는 것은 주방이 하나뿐인 레스토랑에서 10 억 명을 먹이려는 것과 같습니다. 모두에게 한 번에 서비스를 제공하려 하면 주방이 폭발합니다 (메모리 과부하). 무작위로 서비스를 제공하면, 수프를 서빙하다가 스테이크를 서빙하는 것을 계속 전환하기 때문에 셰프가 혼란에 빠집니다.

저자들은 두 가지 새로운 서빙 전략을 고안했습니다:

  • KL-Batching (스마트 메뉴): 무작위로 테이블을 잡는 대신, 그들이 주문한 것 (노드 유형) 을 기반으로 고객들을 그룹화하여 모든 테이블이 균형 잡힌 음식의 혼합물을 받도록 합니다. 이는 셰프가 한 번에 너무 많은 "스테이크" 주문에 압도되지 않도록 방지합니다.
  • Round-Robin Batching (공정 대기열): 그들은 셰프가 모든 유형의 고객을 원형으로 서빙하도록 합니다. 1,000 개의 "일반 요리" 주문이 있지만 5 개의 "희귀 요리" 주문만 있다면, 셰프가 그 요리를 만드는 법을 잊지 않도록 희귀 요리에도 주의를 기울이게 합니다.

4. 결과: "슈퍼 사서"

그들은 실제 세계의 10 억 규모 그래프 (거대한 기업 네트워크와 같은) 에서 이 시스템을 테스트했습니다. 그들은 10 억 개의 데이터 조각으로 모델을 학습시킨 후, 한 번도 본 적 없는 10 가지 다른 퍼즐을 풀도록 요청했습니다.

  • 테스트: 그들은 모델에게 얼어붙은 뇌 (새로운 것을 배울 수 없음) 를 주고, 이미 알고 있는 것을 사용하여 새로운 문제 (두 사람이 친구인지 예측하거나 거래가 의심스러운지 판단하는 것 등) 를 풀도록 요청했습니다.
  • 결과: GraphBFF 모델은 경쟁을 압도했습니다. 그것은 해당 특정 작업을 위해 설계된 모든 전문 모델들을 압도적인 차이 (최대 31 점 더 좋음) 로 능가했습니다.
  • "퓨샷 (Few-Shot)" 마법: 심지어 그들이 모델에게 새로운 작업의 예시를 1 개나 2 개만 제공했을 때 (예: 고양이 사진 한 장을 보여주고 고양이를 찾게 하는 것), 그것은 여전히 놀라울 정도로 잘 수행했습니다. 이는 사서에게 새로운 책 한 권을 보여주고 도서관 전체에서 유사한 책을 찾게 했을 때, 그들이 완벽하게 해낸 것과 같습니다.

5. "스케일링 법칙" 발견

이 논문은 또한 언어 모델에 대해 우리가 알고 있는 것과 유사한 이러한 모델들을 위한 경험칙을 발견했습니다: 뇌와 도서관을 함께 키워야 합니다.

  • 뇌를 더 크게 만들지만 읽을 책을 더 주지 않으면, 더 똑똑해지지 않습니다.
  • 책을 더 주지만 뇌가 작게 유지되면, 압도되어 학습을 멈춥니다.
  • 최상의 결과를 얻으려면 모델 크기와 데이터 크기를 동시에 확장해야 합니다.

요약

간단히 말해, 저자들은 거대하고 messy 하며 실제 세계의 네트워크에서 읽고, 이해하고, 학습할 수 있는 보편적인 그래프 뇌를 구축했습니다. 그들은 컴퓨터를 충돌시키지 않고 이 뇌에 데이터를 공급하는 기술적 문제들을 해결했으며, 이 뇌가 그토록 똑똑하여 한 번도 본 적 없는 새로운 문제들을, 종종 그 특정 문제만을 위해 수년 동안 모델을 구축한 전문가들보다 더 잘 해결할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →