← 최신 논문
🤖 machine learning

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

이 논문은 표준 트랜스포머가 특정 작업에 대해 최적의 경우가 드문 반면, 비선형성을 최적화하면 고도로 작업 특화된 아키텍처가 알고리즘 작업에서 성능을 크게 향상시킬 수 있는 데 반해, 더 보편적으로 호환 가능한 설계는 언어 및 코드 영역 전반에 걸쳐 완만한 이득을 제공한다는 점을 입증한다.

원저자: Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 생각하는 법을 가르치려 한다고 상상해 보세요. 오랫동안 과학자들은 이 로봇들을 위해 '트랜스포머(Transformer)'라고 불리는 동일한 기본 설계도를 사용해 왔습니다. 트랜스포머를 만능 맥가이버 칼(Swiss Army knife)이라고 생각해 보세요. 이것은 시 쓰기부터 언어 번역까지 거의 모든 일에 놀라울 정도로 잘 작동하는 특정한 도구 세트(수학적 함수)를 가지고 있습니다. 이 하나의 디자인이 매우 폭넓게 작동하기 때문에, 많은 사람들은 이것이 모든 작업에 적합한 '완벽한' 도구일 것이며, 더 나은 결과를 얻는 유일한 방법은 그저 로봇을 더 크게 만들고 더 많은 데이터를 먹이는 것이라고 믿기 시작했습니다.

하지만 여기에는 함정이 있습니다. 맥가이버 칼이 병을 따거나 밧줄을 자를 수 있다고 해서, 그것이 두 작업 모두에 '최선'의 도구라는 뜻은 아닙니다. 전용 코르크 따개가 병을 더 빨리 따고, 날카로운 요리사용 칼이 밧줄을 더 깔끔하게 자릅니다. 인공지능의 세계에서 이러한 '최선의 도구'를 **귀납적 편향(inductive biases)**이라고 부릅니다. 귀납적 편향을 로봇의 자연스러운 본능이나 특정 유형의 패턴을 빠르게 학습할 수 있도록 내장된 지름길이라고 생각하면 됩니다. 과학자들이 던지는 큰 질문은 이것입니다. 트랜스포머의 '맥가이버 칼' 같은 본능이 실제로 모든 작업에 최선인가, 아니면 우리가 로봇에게 설계되지 않은 일을 하도록 강요하고 있는 것인가?

"트랜스포머가 정말 모든 것을 할 수 있을까?(Can Transformers Really Do It All?)"라는 제목의 이 논문은 그 답을 찾기 위해 설정되었습니다. 연구진은 단순히 추측만 한 것이 아니라, 특정 작업을 위한 '맞춤형 도구'를 설계할 수 있는지 확인하기 위해 영리한 실험을 구축했습니다. 그들은 표준 트랜스포머를 가져와서, 정보가 어떻게 처리될지를 결정하는 핵심적인 '사고' 부분(비선형 함수)을 백지 상태로 교체했습니다. 그런 다음, 컴퓨터가 단순히 정답을 암기하는 것을 방지하는 특별한 훈련 방법을 사용하여, 비디오 게임이나 수학 문제와 같이 특정 작업에 딱 맞는 완벽한 형태를 학습하도록 했습니다. 그들이 완벽한 맞춤형 형태를 찾아낸 후, 이를 고정(freeze)하고 이 새로운 디자인이 다른 작업에서 얼마나 잘 작동하는지 테스트했습니다.

결과는 "와우(wow)"와 "워(whoa)"가 섞인 모습이었습니다. 연구진이 알고리즘 작업(로봇에게 수학을 가르치거나, 숫자 목록을 기억하거나, 괄호의 균형이 맞는지 확인하는 등의 작업)을 테스트했을 때, 결과는 극적이었습니다. 맞춤형 로봇들은 이러한 작업들을 2~3배 더 빠르게 학습했고, 훨씬 더 안정적이었으며(무작위로 실패하지 않음), 본 적 없는 더 긴 시퀀스에도 일반화할 수 있었습니다. 하지만 여기에는 엄청난 절충안(trade-off)이 있었습니다. 이 맞춤형 디자인들은 믿기 힘들 정도로 까다로웠습니다. 수학을 하도록 최적화된 로봇은 목록을 기억하는 데 젬병이었고, 그 반대도 마찬가지였습니다. 논리적이고 규칙 기반인 이러한 작업들에 대해서는, 표준 트랜스포머가 실제로 꽤 서투르며, 한 수학 문제에 대한 '완벽한' 도구가 다른 수학 문제에는 쓸모없다는 것이 드러났습니다.

언어와 코드에 대해서는 이야기가 달랐습니다. 연구진이 이야기, 셰익스피어 희곡 또는 컴퓨터 코드를 쓰는 데 로봇을 최적화하려고 했을 때, 맞춤형 디자인들이 표준 디자인보다 약간 더 나은 성능을 보였지만, 그 개선 폭은 작고 일관적이었습니다. 더 중요한 점은, 언어를 위한 이 맞춤형 디자인들이 훨씬 더 유연했다는 것입니다. 영어를 위해 최적화된 로로봇은 컴퓨터 코드도 어느 정도 잘 다룰 수 있었습니다. 이는 언어의 경우, 표준 트랜스포머가 이미 '국소 최적점(local optimum)'—즉, 거대한 변화 없이는 깨기 어려운 꽤 괜찮은 지점—에 매우 근접해 있음을 시사합니다.

궁극적으로 이 논문은 트랜스포머가 훌륭한 범용 도구이긴 하지만, 모든 것에 대한 완벽한 해결책은 아니라는 점을 시사합니다. 수학과 알고리즘 같은 엄격한 논리적 작업의 경우, 표준 디자인은 최적의 상태와 거리가 멀며, 우리는 이를 위해 매우 다른 전문화된 로봇을 만들어야 할 수도 있습니다. 언어의 경우, 표준 디자인은 이미 꽤 훌륭하며, 이를 약간 더 좋게 다듬을 수는 있지만, 우리가 놓치고 있는 거대한 잠재력은 없습니다. 결론은 모든 인간의 기술에 완벽한 단 하나의 '마법의 탄환' 같은 아키텍처는 존재하지 않는다는 것입니다. 때때로 최선의 결과를 얻기 위해서는, 하나의 도구가 모든 것을 하도록 강요하는 것을 멈추고, 특정 작업에 맞는 올바른 도구를 설계하기 시작해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →