Use What You Know: Causal Foundation Models with Partial Graphs
이 논문은 학습 가능한 어텐션 바이어스(attention biases)와 그래프 합성곱 인코더(graph-convolutional encoders)를 통해 부분적 또는 완전한 인과 그래프 정보에 기반하여 인과 파운데이션 모델(Causal Foundation Models)을 강화하는 방법을 소개하며, 이를 통해 도메인 전문 지식을 효과적으로 활용하면서도 특화된 모델의 성능에 부합하도록 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
개요: "모든 것을 아는" 탐정과 "회의적인" 탐정
당신이 특정 사건이 왜 일어났는지 알아내려고 한다고 상상해 보세요. 예를 들어, "만약 이 환자에게 신약을 투여한다면, 상태가 호전될까?"라는 질문을 던질 수 있습니다.
오랫동안 과학자들은 매 사례마다 맞춤형 탐정을 만들어야 했습니다. 만약 사례가 흡연과 암에 관한 것이라면 전용 탐정을 만들었고, 교육과 소득에 관한 것이라면 또 다른 탐정을 만들었습니다. 이 탐정들은 각자의 특정 업무에는 뛰어났지만, 그 외의 일에는 아무런 쓸모가 없었습니다.
최最近, 새로운 유형의 "파운데이션 모델(Foundation Model, 초거대 AI)"이 발명되었습니다. 이것을 도서관의 모든 책을 읽은 **"모든 것을 아는 탐정"**이라고 생각해보세요. 이 탐정은 어떤 데이터를 보더라도 거의 모든 질문에 대한 답을 추측할 수 있습니다. 이를 **인과 파운데이션 모델(Causal Foundation Model, CFM)**이라고 부릅니다.
문제점:
이 "모든 것을 아는 탐정"은 똑똑하긴 하지만, 현재로서는 다소 "순진"합니다. 이들은 오직 가공되지 않은 데이터(범죄 현장 사진)만을 보고 무슨 일이 일어났는지 추측하려 합니다. 이들은 전문가의 말을 듣지 않습니다.
- 예시: 만약 당신이 탐정에게 "흡연이 암을 유발하는가?"라고 묻는다면, 탐정은 데이터를 보고 "음, 둘이 자주 같이 나타나긴 하는데, 혹시 암 때문에 담배를 피우는 것 아닐까?"라고 말할 수도 있습니다. 왜냐하면 생물학적 시간 순서를 모르기 때문입니다.
- 문제의 핵심: 현실 세계에서 전문가들은 이미 알고 있는 것들이 있습니다. 우리는 흡연이 암보다 먼저 일어난다는 것을 압니다. 나이가 은퇴보다 앞선다는 것도 압니다. 하지만 현재의 AI 모델들은 모델을 처음부터 완전히 다시 만들지 않는 한, 이러한 "전문가 지식"을 사용하기를 거부합니다.
해결책: 탐정에게 "컨닝 페이퍼"를 주는 법
이 논문의 저자들은 다음과 같은 질문을 던졌습니다. "우리가 이 모델을 처음부터 다시 만들지 않고도, 이 '모든 것을 아는 탐정'이 우리의 전문가적 힌트를 듣도록 가르칠 수 있을까?"
그들은 모델이 작동하는 동안 "컨닝 페이퍼"(부분 그래프)를 줄 수 있는 방법을 개발했습니다. 이 컨닝 페이퍼는 완벽할 필요가 없습니다. 그저 우리가 알고 있는 것들을 알려주기만 하면 됩니다.
"컨닝 페이퍼" 비유: 가계도
당신이 거대하고 혼란스러운 가족 모임에서 누가 누구와 친척인지 알아내려고 한다고 상상해 보세요.
- 과거 방식: 100명의 사진을 보고 누가 할아버지이고, 누가 사촌이며, 누가 아기인지 추측합니다. 틀릴 수도 있습니다.
- 새로운 방식: 당신은 다음과 같은 내용이 적힌 종이(부분 조상 행렬, Partial Ancestral Matrix)를 받습니다.
- "할머니가 아기의 조상이라는 것은 확실히 알고 있다." (이것은 1입니다).
- "아기가 할머니의 조상이 아니라는 것은 확실히 알고 있다." (이것은 -1입니다).
- "삼촌 밥과 사촌 수 사이에 관계가 있는지 없는지는 모른다." (이것은 0입니다).
이 논문은 이 "불완전한" 컨닝 페이퍼(일부 관계가 "알 수 없음"으로 표시된 상태)를 가지고 있을 때도, AI가 컨닝 페이퍼가 전혀 없을 때보다 훨씬 더 뛰어난 성능을 보인다는 것을 보여줍니다.
구현 방법: "교통 통제관"과 "지도 판독가"
논문은 AI가 이 컨닝 페이퍼에 귀를 기울이게 만들기 위해 사용한 두 가지 구체적인 기술을 설명합니다. AI를 서로 쪽지를 주고받는 거대한 작업 팀이라고 생각해 보세요.
교통 통제관 (Soft Attention Bias):
보통 작업자들은 누구에게든 자유롭게 쪽지를 전달합니다. 저자들은 컨닝 페이퍼를 살피는 "교통 통제관"을 추가했습니다.- 만약 종이에 "할머니는 아기의 조상이다"라고 적혀 있다면, 컨트롤러는 그 쪽지에 초록불을 줍니다 (AI가 주의를 기울이도록 권장).
- 만약 종이에 "아기는 할머니의 조상이 아니다"라고 적혀 있다면, 컨트롤러는 그 쪽지에 빨간불을 줍니다 (AI가 주의를 기울이지 않도록 억제).
- 만약 "알 수 없음"이라고 적혀 있다면, 불빛은 노란색입니다 (AI가 스스로 결정할 수 있게 둠).
- 핵심 포인트: 이것은 강제적인 규칙이 아니라 부드러운 유도입니다. 덕분에 컨닝 페이퍼에 오류가 있더라도 시스템은 견고하게 작동합니다.
지도 판독가 (Graph Convolutional Network):
이것은 모든 작업자가 일을 시작하기 전에 전체 가계도 지도를 갖게 하는 것과 같습니다. 이는 그들이 전체적인 그림 속에서 자신의 "역할"을 이해하도록 돕습니다. 설령 그들이 단 한 사람만을 보고 있더라도, "아, 나는 손자를 보고 있으니, 부모님에 대해 생각해야겠구나"라고 알 수 있게 합니다.
결과: "완벽함"보다 "부분적임"이 더 나은 이유
연구진은 단순한 수학 문제부터 복잡하고 현실적인 시뮬레이션에 이르기까지 다양한 시나리오에서 테스트를 진행했습니다.
- 성공적임: 모델에게 컨닝 페이퍼를 주었을 때, 모델은 인과관계에 대해 훨씬 더 정확한 예측을 내놓았습니다.
- 유연함: 모델은 정보가 100% 채워진 컨닝 페이퍼나, 정보가 90% 비어 있는(힌트가 아주 적은) 컨닝 페이퍼 모두를 처리할 수 있습니다.
- "추측하지 마라"는 규칙: 이것이 가장 중요한 발견입니다. 논문은 만약 어떤 관계에 대해 확신이 없다면, 잘못 추측하는 것보다 "알 수 없음(0)"으로 표시하는 것이 훨씬 더 낫다는 것을 보여줍니다.
- 비유: 운전 중에 어떤 길이 일방통행인지 확실하지 않을 때, 그냥 "일방통행이다"라고 멋대로 추측해서 반대로 달리는 것보다 "모르겠다"라고 가정하고 조심히 운전하는 것이 훨씬 안전합니다. 논문은 잘못된 추측이 AI의 성능을 크게 떨어뜨리지만, "모른다"라고 말하는 것은 성능에 아주 조금만 영향을 준다는 것을 입증했습니다.
요약
이 논문은 "모든 것을 아는" AI 모델이 부분적인 전문가 지식을 사용할 수 있도록 업그레이드하는 방법을 소개합니다. 세상 전체의 완벽한 지도가 필요한 대신, 이제 AI는 빈칸이 뚫려 있는 스케치 형태의 지도만 있어도 작업할 수 있습니다. "교통 통제관"을 통해 주의력을 유도하고 "지도 판독가"를 통해 큰 그림을 이해하게 함으로써, AI는 부분적인 정보만 있는 상황에서도 "만약에?"라는 질문에 훨씬 더 정확하게 답할 수 있는 더 나은 탐정이 되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.