Query Circuits: Explaining How Language Models Answer User Prompts
이 논문은 개별 출력에 대해 충실하고, 희소하며, 계산 가능한 설명을 제공하기 위해 언어 모델 내의 입력 특정 정보 흐름을 추적하는 방법인 "쿼리 회로(query circuits)"를 소개하며, 이는 새로운 지표인 정규화된 편차 충실도(Normalized Deviation Faithfulness, NDF)를 통해 검증되었고 여러 벤치마크에 걸쳐 입증되었습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대 언어 모델(LLM)을 수백만 개의 도로, 교차로, 신호등이 있는 거대하고 북적이는 도시라고 상상해 보세요. 여러분이 모델에게 질문(프롬프트)을 던지는 것은, 답변을 전달하기 위해 이 도시를 통과하는 배달 트럭을 보내는 것과 같습니다.
오랫동안 연구자들은 이 도시가 어떻게 작동하는지 이해하기 위해 일반적인 교통 패턴을 지도화하려고 노력해 왔습니다. 예를 들어, "경로 A"는 모델이 숨겨진 물체를 찾아야 할 때 항상 사용되며, "경로 B"는 수학 문제를 풀 때 사용된다는 것을 그들은 알고 있습니다. 이것들을 **역량 회로(capability circuits)**라고 부릅니다.
하지만 일반적인 경로를 아는 것만으로는 왜 오늘 여러분의 특정 배달을 위해 트럭이 특정 경로를 택했는지 설명할 수 없습니다. 아마도 공사 구간이 있었거나, 갑작스러운 우회로가 생겼거나, 혹은 이번 여정에만 영향을 미친 독특한 신호등이 있었을 수도 있습니다.
이 논문은 이 도시를 바라보는 새로운 방식인 **쿼리 회로(Query Circuits)**를 소개합니다. 연구자들은 일반적인 지도를 보는 대신, 여러분의 특정 질문을 위해 트래킹된 정확하고 미세한 경로를 추적하고자 합니다.
이들의 발견을 쉬운 비유를 통해 정리하면 다음과 같습니다.
1. 문제점: "대리(Surrogate)" 지도가 틀렸다
이전에는 특정 여정을 이해하기 위해, 도시를 아주 작고 단순화된 모델(대리 모델)로 만들어서 그 경로를 추적하려 했습니다.
- 비유: 뉴욕시의 복잡한 교통 정체를 이해하기 위해 레고 블록으로 도시의 장난감 모델을 만든다고 상상해 보세요. 여러분은 그 레고 모델 위에서 경로를 추적하며, 그것이 실제 도시와 일치하기를 바랍니다.
- 문제점: 이 논문은 이러한 레고 모델이 실제 도시와 완벽하게 일치하지 않는 경우가 많다고 주장합니다. 모델은 세부 사항을 놓치기 쉽고, 이를 만드는 과정도 느리고 비용이 많이 듭니다. 저자들은 별도의 장난감 버전 없이 실제 도시(실제 모델)에서 직접 경로를 추적하고 싶어 했습니다.
2. 해결책: "Best-of-N" 로또
저자들은 하나의 특정 질문에 대한 정확한 경로를 찾는 것이 놀라울 정도로 어렵다는 것을 발견했습니다. 단지 하나의 질문에 대해서만 교통 신호를 관찰하면, 데이터가 종종 "노이즈"(라디오의 잡음 같은 현상)를 포함하고 있어 진정한 경로를 파악하기 어렵습니다.
- 비유: 여러분이 당첨된 로또 티켓을 찾으려고 하는데, 티켓의 숫자가 약간 흐릿하게 보이는 상황을 상상해 보세요. 단 하나의 티켓만 보고 당첨자를 고르려 한다면, 잘못된 것을 고를 수도 있습니다.
- 해결책: 저자들은 **Best-of-N (BoN)**이라고 불리는 방법을 제안합니다.
- 원래의 질문을 가져옵니다.
- 모델에게 동일한 질문을 9가지 다른 방식(패러프레이징)으로 질문합니다. 이는 "하늘은 무슨 색인가요?"라고 묻는 것과 "맑은 날의 하늘색을 묘사해 주세요"라고 묻는 것의 차이와 같습니다.
- 10가지 버전 모두에 대해 경로를 추적합니다.
- 승자를 선택합니다: 가장 잘 작동한 경로를 선택합니다.
- 결과: 원래의 질문은 "흐릿"했을지라도, 재구성된 버전 중 하나는 모델이 어떻게 답했는지를 정확하게 드러낼 만큼 명확했습니다. 여러 버전을 확인함으로써, 그들은 모델이 어떻게 답했는지를 정확하게 설명해 주는 "당첨 티켓"을 찾아냈습니다 именно.
3. 새로운 성적표: NDF
우리가 올바른 경로를 찾았는지 알기 위해서는 성공을 측정할 방법이 필요했습니다. 기존의 성적표(NFS라고 불림)는 복잡한 질문에 대해 제대로 작동하지 않았습니다. 예를 들어, 말도 안 되게 "200%"나 "-50%" 같은 점수를 내놓기도 했습니다.
- 비유: 이는 마치 여러분이 시속 60마일로 달리고 있는데, 속도계가 가끔은 뒤로 100마일로 가고 있다거나 앞으로 500마일로 가고 있다고 표시하는 것과 같습니다.
- 해결책: 그들은 **NDF (Normalized Deviation Faithfulness)**라는 새로운 점수를 발명했습니다. 이는 항상 0과 1 사이를 유지하는 신뢰할 수 있는 속도계입니다.
- 1.0은 그들이 찾은 경로가 완벽하다는 것(모델의 답변을 정확히 설명함)을 의미합니다.
- 0.0은 그 경로가 쓸모없음을 의미합니다.
- 이 새로운 성적표 덕분에, 의료 시험이나 천문학 같은 어려운 주제에서도 그들의 발견을 신뢰할 수 있게 되었습니다.
4. 거대한 놀라움: 도시는 대부분 비어 있다
가장 흥ante로운 발견은, 단 하나의 질문에 대해 모델이 도시 전체를 사용하지 않는다는 점입니다. 모델은 오직 매우 작고 특정한 구역만을 사용합니다.
- 비유: 여러분은 배달 트럭이 A 지점에서 B 지점으로 가기 위해 도시 도로의 50%를 사용해야 한다고 생각할 수도 있습니다. 하지만 저자들은 특정 질문에 대해 트럭이 단 **1.3%**의 도로만을 사용한다는 것을 발견했습니다.
- 증거: 저자들은 만약 98.7%의 도시를 폐쇄하고 트럭이 오직 그 작은 1.3%의 경로만 사용할 수 있게 제한하더라도, 모델이 여전히 약 60%의 확률로 질문에 올바르게 답할 수 있다는 것을 보여주었습니다. 이는 모델의 "두뇌"가 개별 작업에 대해 믿기 힘들 정도로 희소하고 효율적이라는 것을 증명합니다.
요약
이 논문은 AI가 특정 질문에 정확히 어떻게 답하는지 설명하는 새로운 도구를 소개합니다.
- "장난감 모델"을 사용하는 대신 실제 AI 내부를 직접 들여다보았습니다.
- 같은 질문을 다양한 방식으로 던지는 것이 AI가 생각하는 방식의 숨겨진 "진실"을 밝히는 데 도움이 된다는 것을 깨달았습니다.
- 자신들의 설명이 맞는지 측정하는 더 나은 방법을 만들었습니다.
- 어떤 단일 질문에 대해서든, AI가 업무를 수행하기 위해 자신의 거대한 두뇌 중 아주 작은 특정 부분만을 사용한다는 것을 증명했습니다.
이 연구는 "AI가 일반적으로 수학을 어떻게 하는가"를 아는 단계에서 "AI가 이 수학 문제를 정확히 어떻게 풀었는가"를 이해하는 단계로 우리를 이동시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.