Explaining Attention with Program Synthesis
이 논문은 프로그램 합성을 사용하여 트랜스포머 어텐션 헤드를 인간이 읽을 수 있고 실행 가능한 파이썬 프로그램으로 근사하는 확장 가능한 파이프라인을 제안하며, 이러한 기호적 대리물이 어텐션 패턴을 정확하게 재현하고 모델 성능에 미치는 영향을 최소화하면서 신경망 헤드의 상당 부분을 대체할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대의 언어 모델(이 채팅 뒤에 있는 AI와 같은)을 거대하고 복잡한 오케스트라라고 상상해 보십시오. 이 오케스트라 내부에는 수천 명의 음악가(이를 "어텐션 헤드"라고 부릅니다)가 각기 다른 악기를 연주하고 있습니다. 각 음악가는 다른 음악가들의 연주와 악보(입력된 텍스트)를 들으며, 언제 크게 연주할지, 언제 작게 연주할지, 그리고 어떤 음을 낼지를 결정합니다.
오랫동안 과학자들은 각 음악가가 무엇을 하고 있는지 이해하려고 노력해 왔지만, 그 설명은 모호했습니다. 그들은 "이 음악가는 명사를 좋아하는 것 같다"라거나 "저 음악가는 문장의 시작 부분에 집중한다"라고 말하곤 했습니다. 이것은 교향곡을 두고 "행복하게 들린다"라거나 "슬프게 들린다"라고 묘사하는 것과 같습니다. 도움이 되기는 하지만, 음악이 정확히 어떻게 만들어지는지는 알려주지 못합니다.
새로운 접근 방식: 악보 쓰기
이 논문은 오케스트라를 이해하는 다른 방법을 제안합니다. 단순히 음악을 묘사하는 대신, 연구자들은 각 음악가가 정확히 무엇을 해야 하는지 알려주는 실제 악보(실행 가능한 코드)를 쓰려고 시도했습니다.
그들이 수행한 단계는 다음과 같습니다:
- 음악가 관찰하기: 먼저, 연구자들은 AI 모델이 수천 개의 문장을 읽는 과정을 관찰했고, 각 "음악가"(어텐션 헤드)가 어떻게 반응하는지 정확히 기록했습니다. 그들은 각 헤드가 어떤 단어에 주의를 기울이는지 기록했습니다.
- 유령 작가에게 요청하기: 이 기록들을 가져가서, 또 다른 매우 똑똑한 AI("프로그램 합성" 에이전트)에게 그 반응을 흉내 낼 수 있는 간단한 파이썬 프로그램을 작성하도록 요청했습니다. 이것은 마치 유령 작가에게 음악가의 연주를 보고, *"만약 이전 단어가 마침표라면 다음 단어를 보라. 만약 단어가 이름이라면 동사를 찾아라"*와 같이 그들이 따르고 있는 정확한 규칙을 적어달라고 요청하는 것과 같습니다.
- 유령 작가 테스트하기: 유령 작가가 생성한 코드를 가져와 새로운 문장에 실행해 보며, 원래의 AI의 행동과 일치하는지 확인했습니다. 그들은 코드가 실제 모델과 얼마나 유사한지 확인하기 위해 유사도 테스트와 같은 점수 산정 방식을 사용했습니다.
- 거대한 교체: 이 부분이 가장 흥-미진진한 부분입니다. 연구자들은 원래의 복잡한 신경망 "음악가"들을 오케스트라에서 빼내고, 방금 작성한 단순하고 인간이 읽을 수 있는 코드로 교체했습니다. 그들은 오케스트라가 여전히 동일한 소리를 낼 수 있는지 확인하고자 했습니다.
그들이 발견한 것
결과는 놀라울 정도로 성공적이었습니다:
- 많은 음악가가 단순한 규칙을 따른다: 연구자들은 AI의 어텐션 헤드 중 아주 많은 수가 실제로 매우 논리적이고 상징적인 규칙을 따르고 있다는 것을 발견했습니다. 예를 들어, 어떤 헤드는 단순히 "문장의 첫 단어를 본다"라는 규칙을 가지고 있었고, 다른 헤드는 "쉼표를 찾는다"라거나 "새로운 문장을 시작하는 단어를 찾는다"라는 규칙을 가지고 있었습니다.
- 오케스트라는 여전히 연주한다: 복잡한 신경망 음악가의 **25%에서 40%**를 이 단순한 코드 스크립트로 교체했을 때도, 오케스트라(AI 모델)는 거의 흐름을 놓치지 않았습니다. 모델의 질문 답변 능력이나 이야기 이해 능력은 거의 동일하게 유지되었습니다.
- 모델이 커질수록 해독하기 쉽다: 흥미롭게도, 모델이 더 크고 발전될수록(Llama-3B와 같이), 이러한 단순한 코드 규칙을 찾는 것이 더 쉬웠습니다. 모델이 커질수록 각 음악가가 매우 구체적이고 이해하기 쉬운 직무를 갖게 되어 더 체계적으로 변하는 것처럼 보입니다.
시사점
이 논문은 우리가 항상 AI를 신비로운 "블랙박스"로 취급할 필요는 없다는 것을 보여줍니다. 모델이 작동하는 방식의 상당 부분에 대해, 우리는 복잡하고 설명 불가능한 수학을 단순하고 인간이 읽을 수 있는 컴퓨터 코드로 대체할 수 있습니다.
이것은 복잡한 마술이 사실은 마법이 아니라, 누구나 적고 따라 할 수 있는 특정한 일련의 지침이라는 것을 깨닫는 것과 같습니다. 연구자들은 현대 AI의 많은 부분에 대해, "마법"을 "지침"으로 바꾸어도 공연을 망치지 않는다는 것을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.