← 최신 논문
🤖 AI

Mask-Based Priors Are More Persistent than Query-Key Initializations

이 논문은 가산적 어텐션 마스크(additive attention masks)를 태스크 수준의 상호작용 구조로 직접 초기화하는 것이 쿼리-키 초기화보다 더 지속적이고 효과적인 귀납적 편향을 제공하며, 이를 통해 트랜스포머가 불리언 추론 작업에서 완벽에 가까운 외삽 성능을 달 수 있고 저데이터 산술 시나리오에서 개선된 성능을 달성할 수 있음을 입증한다.

원저자: Mingze Ma, Hemanth Saratchandran, Cameron Gordon, Simon Lucey

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mingze Ma, Hemanth Saratchandran, Cameron Gordon, Simon Lucey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 게임을 플레이하는 백만 개의 사례를 보여주고, 로봇은 그 게임에 매우 능숙해집니다. 하지만 그러고 나서 당신이 로봇에게 한 번도 본 적 없는 약간 새로운 버전의 게임을 수행하라고 요청합니다. 그러면 로봇은 새로운 규칙을 파악하는 대신, '지름길'을 찾아냅니다. 즉, 이전의 예시들에서는 통했지만 새로운 상황에서는 완전히 틀린 단순한 요령을 사용하는 것입니다. 이것은 인공지능 세계, 특히 **트랜스포머(Transformer)**라고 불리는 일종의 뇌를 닮은 컴퓨터 모델에서 발생하는 유명한 문제입니다. 트랜스포머는 이야기를 쓰고, 수학 문제를 풀고, 얼굴을 인식하는 많은 현대적 AI 도구들의 엔진입니다. 과학자들은 이 로봇들이 본 것을 기억하는 데는 천재적이지만, 지식을 새로운 상황에 적용하는 '외삽(extrapolate)'에는 자주 실패한다는 사실을 발견했습니다. 왜냐하면 로봇이 진정한 정답보다는 가장 단순한 답에 매몰되기 때문입니다.

연구자들이 던지는 핵심적인 질문은 이것입니다: 어떻게 하면 로봇이 지름길로 빠지는 것을 막을 수 있을까? 한 가지 아이디어는 로봇이 학습을 시작하기도 전에 규칙을 가르쳐서 '선행 지식'을 주는 것입니다. 트랜스포머의 세계에서 이것은 **귀납적 편향(inductive bias)**이라고 불립니다. 이것은 탐정에게 사건을 해결하기 전에 지도를 건네주는 것과 같습니다. 만약 지도가 정확하다면 탐정은 범인을 빠르게 찾아낼 것입니다. 하지만 만약 지도가 틀렸거나 탐정이 지도를 무시한다면, 탐정은 길을 잃게 될 것입니다. 오랫동안 과학자들은 로봇의 내부 '센서'(쿼리 및 키 투영, Query and Key projections라고 불림)를 미세하게 조정하여 로봇이 자연스럽게 올바른 단서를 찾도록 지도를 그려주려 노력했습니다. 하지만 결과적으로 로봇은 데이터를 배우려는 의지가 너무 강해서, 당신이 준 지도를 빠르게 잊어버리고 다시 지름길을 찾는 습관으로 돌아가 버린다는 것이 밝혀졌습니다.

"Mask-Based Priors Are More Persistent than Query-Key Initializations"라는 제목의 이 논문은 바로 이 문제에 대해 깊이 파고듭니다. 호주 머신러닝 연구소(Australian Institute for Machine Learning)의 밍제 마(Mingze Ma)와 그의 팀은 단순하지만 심오한 질문을 던졌습니다. "로봇이 결코 잊을 수 없는 지도를 주는 방법이 있을까?" 그들은 지도를 그리는 두 가지 방법을 테스트했습니다. 첫 번째 방법은 기존 방식인 센서 미세 조정이었습니다. 두 번째 방법은 더 단순하고 새로운 접근법으로, 특수한 **마스크(mask)**를 사용하여 로봇의 '주의력(attention)' 메커니즘에 직접 지도를 그려 넣는 것이었습니다.

그들이 발견한 결과는 다음과 같습니다. 기존 방식(센서 미세 조정)을 사용했을 때, 로봇은 처음에 올바른 지도를 가지고 시작했지만, 학습이 시작되자마자 로봇은 지도를 지워버리고 다시 잘못된 지름길로 돌아갔습니다. 그것은 마치 화이트보드에 글을 써 놓으면 로봇이 즉시 지워버리는 것과 같았습니다. 그러나 새로운 마스크 기반 방식을 사용했을 때는 지도가 그대로 유지되었습니다. 그들은 센서를 변경하지 않았습니다. 대신, 주의력 점수(attention scores)에 직접적으로 학습 가능한 편향, 즉 '넛지(nudge)'를 추가했습니다. 이 넛지는 매우 끈질겨서, 수천 번의 학습 단계가 지난 후에도 로봇은 여전히 규칙을 기억하고 있었습니다.

결과는 극적이었습니다. 로봇이 보통 실패하는 까다로운 논리 퍼즐(불리언 태스크, Boolean tasks)에서, 이 새로운 방식은 로봇이 보지 못한 문제에서도 거의 100%의 정답률을 기록한 반면, 기존 방식들은 75%에 머물렀습니다. 이는 마치 로봇이 단순히 요령 피우는 암기자가 아니라, 마침내 인간처럼 생각하는 법을 배운 것과 같습니다. 이 성공은 단지 논리 퍼즐에만 국한되지 않았습니다. 연구팀은 또한 수학 문제(큰 숫자의 덧셈과 곱셈 등)와 이미지 인식에 대해서도 테스트했습니다. 모든 경우에서 로봇은 더 빠르게 학습했고, 특히 공부할 데이터가 많지 않을 때 실수를 훨씬 적게 했습니다.

이 논문은 비결이 단순히 로봇에게 '무엇을' 가르치느냐가 아니라, '어디에' 가르치느냐에 있다는 점을 시사합니다. 구조적 규칙을 복잡한 센서 계산 속에 숨기는 대신 주의력 마스크에 직접 배치함으로써, 로봇은 그 규칙을 마음속에 간직하게 됩니다. 저자들은 이 단순한 기술이 마치 튼튼한 닻처럼 작용하여, 새로운 데이터의 파도가 로봇을 경로에서 벗어나도록 밀어내려 할 때도 학습의 방향을 올바르게 잡아준다는 것을 보여줍니다. 비록 이것이 모든 AI 문제를 해결해주지는 못하며(연구진은 지도를 그리기 위해 사전에 규칙을 알고 있어야 한다는 점을 인정합니다), 경험으로부터 단순히 암기하는 것이 아니라 경험으로부터 실제로 배울 수 있는, 더 똑똑하고 신뢰할 수 있는 AI를 구축하기 위한 강력한 새로운 도구를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →