Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning
본 논문은 확장된 LEGO 프레임워크를 사용하여 트랜스포머의 지속적 구성적 추론을 조사하며, 고정된 단축 해법으로 인해 순전 Feedforward BERT 모델은 실패하는 반면 순환적 ALBERT 모델은 교차 경험 훈련을 통해 더욱 향상될 수 있는 알고리즘적 'for-loop' 전략을 학습함으로써 우수한 성능을 보인다는 사실을 규명합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 일련의 퍼즐을 풀도록 가르친다고 상상해 보세요. 이 퍼즐들은 단순히 무작위가 아니라, 동일한 근본 논리의 변형들입니다. 예를 들어, 첫 번째 퍼즐은 삼각형을 회전하라고 하고, 다음 퍼즐은 뒤집으라고 하며, 그 다음 퍼즐은 두 가지를 모두 하라고 할 수 있습니다. 목표는 로봇이 첫 번째 퍼즐의 논리를 학습하여, 첫 번째 방법을 잊지 않은 채로 두 번째와 세 번째 퍼즐을 즉시 해결할 수 있는지 확인하는 것입니다.
이 논문은 두 가지 인기 있는 AI"두뇌"(BERT와 ALBERT라고 함) 가 이러한 유형의 학습을 어떻게 처리하는지 조사합니다. 연구자들은 이러한 AI 모델들이 놀라울 정도로 똑똑하지만, 종종 나중에 새로운 것을 배우는 능력을 떨어뜨리는"정신적 단축키"를 사용한다는 사실을 발견했습니다.
다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:
1. 두 가지 유형의 학습자
연구자들은 두 가지 모델을 테스트했습니다:
- BERT: 이를사진사로 생각하세요. 사진사는 한 번에 전체 이미지를 보고 그 단일 이미지의 구체적인 세부 사항을 암기하려고 합니다. 이는 매우 빠르고 순간적인 패턴 인식에 뛰어나지만, 이미지가 어떻게 만들어졌는지에 대한 과정을 실제로 이해하지는 못합니다.
- ALBERT: 이를프로그래머로 생각하세요. ALBERT 는 단순히 이미지를 암기하는 대신, 문제를 해결하기 위해 반복할 수 있는 일련의 지시사항 (컴퓨터 코드의 루프와 같은) 을 학습합니다. 이는 퍼즐 뒤에 숨겨진 메커니즘을 이해합니다.
2."단축키"함정
모델들에게 첫 번째 퍼즐 (이를"퍼즐 A"라고 부르겠습니다) 을 가르쳤을 때, 두 모델 모두 잘 수행했습니다. 그러나 연구자들이"퍼즐 B"(매우 비슷하지만 약간 다른) 를 소개했을 때 문제가 발생했습니다.
BERT(사진사): 이는 단축키를 학습했습니다. BERT 는"이 퍼즐의 첫 번째 단서만 보면, 이 특정 유형의 퍼즐에 대한 답을 추측할 수 있구나"라고 깨달았습니다. 이는 실제 논리를 학습한 것이 아니라 퍼즐 A 에만 작동하는 트릭을 암기한 것입니다.
- 결과: 퍼즐 B 를 마주했을 때 BERT 는 혼란스러워졌습니다. 퍼즐 A 에 특화된 트릭에 의존했기 때문에 적응할 수 없었습니다. 또한 퍼즐 B 학습을 시작하자마자 퍼즐 A 를 수행하는 방법을 완전히 잊어버렸습니다. 이를 **파괴적 망각 (catastrophic forgetting)**이라고 합니다.
ALBERT(프로그래머): 이는 알고리즘을 학습했습니다. ALBERT 는"아, 현재 상태를 가져와서 규칙을 적용한 다음 다음 단계로 이동해야 하구나"라고 파악했습니다. 이는 행동 반복을 지시하는 컴퓨터 명령인"For 루프"를 학습하는 것과 같습니다.
- 결과: ALBERT 는 특정 트릭이 아닌 방법을 학습했기 때문에, 그 방법을 퍼즐 B 에 훨씬 빠르게 적용할 수 있었습니다. 이는 **전향적 전이 (forward transfer)**를 보여주며, 퍼즐 A 에서 배운 것을 퍼즐 B 학습을 가속화하는 데 사용했다는 의미입니다.
3. 크기가 중요하지만 (당신이 생각하는 방식은 아님)
연구자들은 모델의 크기를 키우는 시도 (집에 방을 더 추가하는 것처럼 레이어를 추가하는 것) 를 했습니다.
- ALBERT 에게: 더 큰 것이 더 좋았습니다. 더 많은"방"은 알고리즘을 정교하게 다듬고 지식 전이를 더 잘하도록 만들었습니다.
- BERT 에게: 더 큰 모델은 오히려 상황을 악화시키거나 불안정하게 만들었습니다. BERT 는 단축키에 의존하기 때문에 모델을 더 복잡하게 만들면 나쁜 습관에 빠질 수 있는 더 많은 방법을 제공하게 된 것입니다. BERT 는 학습한 내용을 새로운 퍼즐에 일반화할 수 없었습니다.
4."메모리 재생"해결책
두 모델 모두 파괴적 망각으로 고통받았습니다. 새로운 퍼즐을 학습할 때 이전 퍼즐에 대한 기억을 완전히 지워버리는 현상입니다.
이를 해결하기 위해 연구자들은 **재생 버퍼 (Replay Buffer)**를 사용했습니다. 새로운 수학 시험을 공부하는 학생이, 가끔 훑어보기 위해 책상에 이전 시험의 플래시카드를 몇 장 남겨두는 상황을 상상해 보세요.
- 결과: 이는 놀라운 효과를 발휘했습니다. 모델들이 새로운 데이터를 학습하는 동안 이전 데이터의 아주 작은 부분 (단 1%) 만 보여줌으로써 망각을 멈출 수 있었습니다. BERT 와 ALBERT 모두 새로운 퍼즐을 학습하는 동안 이전 퍼즐을 기억할 수 있었습니다.
5. 마지막 장애물: 퍼즐 결합하기
"구성적 추론"의 궁극적인 테스트는 AI 가 서로 다른 퍼즐의 규칙을 섞고 조합하여 이 모든 것을 결합한 완전히 새로운 복잡한 퍼즐을 해결할 수 있는지 여부입니다.
- 문제: "재생 버퍼"가 기억을 돕고 있음에도 불구하고, 두 모델 모두 규칙을 결합하는 데 어려움을 겪었습니다. 그들은 퍼즐 A 와 퍼즐 B 를 개별적으로 기억할 수는 있었지만, 이를 결합하여 하이브리드 퍼즐을 해결하는 방식으로 쉽게 엮어낼 수는 없었습니다.
- 차이점: 연구자들은 ALBERT가 이를 성공하도록 돕는 방법을 발견했습니다. 만약 ALBERT 를 훈련하는 동안 기존 퍼즐과 새로운 퍼즐을 천천히 연결하는 전략 (서로 분리된 상태로 유지하는 대신) 으로 가르친다면, ALBERT 는 이를 결합하는 법을 배울 수 있었습니다.
- 한계: 이"연결"전략은 BERT 에게는 작동하지 않았습니다. BERT 는 초기 훈련 동안 이미"단축키"사고 방식에 깊이 빠져 있었기 때문에, 나중에 규칙을 결합하도록 가르칠 수 없었습니다. BERT 는 너무 고집이 세서 변하지 않았습니다.
결론
이 논문은 BERT 와 ALBERT 와 같은 AI 모델들이 강력하지만 숨겨진 결함이 있다는 결론을 내립니다: 그들은 깊은 논리 대신"치트"(단축키) 를 학습하는 경향이 있습니다.
- ALBERT는 새로운 관련 작업을 더 빠르게 학습하는 데 도움이 되는 깊은 논리 (For 루프) 를 학습하는 데 더 뛰어납니다.
- BERT는 표면적인 트릭에 갇히게 되어 새로운 상황에 적응하는 데 서툴러지고 이전 것을 잊어버리게 됩니다.
이 연구는 AI 가 잊지 않고 영구적으로 학습 (지속 학습) 할 수 있도록 하려면, 단축키에 의존하는 모델에서 벗어나 세계의 근본적인"알고리즘"을 이해하도록 설계된 아키텍처로 나아가야 한다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.