Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
본 논문은 RLHF 로 억제된 행동을 위한 대립 회로와 사전 학습 행동을 위한 라우팅 회로라는 두 가지 구별된 FFN 회로 구조를 식별하여 안전 거부나 언어 선택과 같은 특정 모델 출력을 다른 능력에 영향을 주지 않고 정밀하고 표적화된 개입으로 편집할 수 있게 하는 백프로파게이션이 없는 2 회 통과 진단 방법인"Perturbation Probing"을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
대형 언어 모델 (LLM) 을 거대하고 매우 복잡한 오케스트라라고 상상해 보세요. 수년 동안 우리는 이 오케스트라가 연주하는 음악 (제공하는 답변) 이 위험하거나 유익할 수 있다는 것을 알고 있었지만, 정확히 어떤 음악가들 (뉴런) 이 노래의 "안전" 부분이나 "무례" 부분을 담당하는지는 알지 못했습니다.
이 논문은 **Perturbation Probing(교란 탐지)**이라는 새로운 방법을 소개합니다. 이는 악보를 다시 쓸 필요 없이 (역전파나 재학습 없이) 연구자들이 오케스트라를 경청할 수 있게 해주는 "이중 통과 진단 도구"라고 생각하면 됩니다.
다음은 이를 간단한 개념으로 나누어 설명한 작동 원리입니다:
1. "이중 통과" 청진기
보통 어떤 뉴런이 무엇을 하는지 파악하려면 방대한 수학 계산을 하거나 전체 새로운 모델을 학습시켜야 합니다. 이 방법은 훨씬 가볍습니다.
- 1 차 통과: 모델이 질문에 정상적으로 답변합니다.
- 2 차 통과: 연구자들은 질문을 약간 "교란"시킵니다 (예: "methamphetamine"을 "metahmphetamine"으로 변경하여 컴퓨터는 이를 다른 단어로 인식하지만 인간은 동일하게 읽도록 함).
- 진단: 두 가지 답변을 비교함으로써 이 방법은 모델 내의 모든 단일 뉴런에 대해 "점수"를 계산합니다. 질문은 다음과 같습니다: "이 뉴런은 교란에 강하게 반응했으며, 모델을 '아니오' 또는 '예' 쪽으로 밀어붙였는가?"
만약 뉴런이 강하게 반응하고 올바른 방향으로 모델을 밀어붙인다면 높은 점수를 받습니다. 연구자들은 그런 다음 상위 50 개 점수를 받은 뉴런을 테스트합니다.
2. 두 가지 유형의 "회로"
이 논문은 AI 의 행동이 두 가지 뚜렷한 범주, 즉 두 가지 다른 유형의 배관 시스템처럼 분류된다는 것을 발견했습니다:
유형 A: "대립" 회로 (안전 밸브)
- 무엇인가: 이는 AI 가 본능적으로 하려는 것과 반대되는 것을 하도록 훈련될 때 발생합니다. 예를 들어, AI 는 본능적으로 사용자의 말에 동의하고 싶어 하지만 (사전 학습), 안전 훈련 (RLHF) 은 나쁜 요청에 대해 "아니오"라고 말하도록 강요합니다.
- 비유: 자연스럽게 열려 있기를 원하는 무거운 문을 상상해 보세요. 문을 닫아두기 위해 특정 작은 걸쇠를 설치합니다.
- 발견: 연구자들은 안전 거부 응답의 경우, 이 "걸쇠"가 놀라울 정도로 작다는 것을 발견했습니다. 일부 모델에서는 단 50 개의 뉴런(수십만 개 중) 이 거부 응답의 템플릿을 제어합니다.
- 이 50 개의 뉴런을 제거하면 AI 는 정중한 "그것을 도와드릴 수 없습니다"라는 대본을 사용하는 것을 멈춥니다.
- 중요하게도: 이는 AI 가 갑자기 악의적으로 변한다는 뜻이 아닙니다. 단지 정중한 대본을 사용하는 것을 멈출 뿐입니다. 여전히 무언가 불법임을 경고할 수는 있지만, "죄송합니다, 그것을 할 수 없습니다"라고 말하지는 않을 것입니다. 안전에 대한 지식은 여전히 더 깊숙이 숨겨져 있습니다.
유형 B: "라우팅" 회로 (교통 지휘자)
- 무엇인가: 이는 AI 가 본래 하기를 좋아하는 행동, 예를 들어 중국어를 말하거나 수학을 푸는 경우에 발생합니다. AI 는 본성과 싸울 필요가 없습니다. 단지 올바른 경로로 라우팅되기만 하면 됩니다.
- 비유: 고속도로 시스템을 상상해 보세요. 자동차 (정보) 는 이미 움직이고 있습니다. 특정 진출입로 (중국어) 로 가려면 새로운 도로를 건설할 필요가 없습니다. 단지 교통 표지판의 스위치를 바꾸면 됩니다.
- 발견: 이러한 행동의 경우 뉴런을 제거해도 아무런 효과가 없습니다. 그러나 연구자들은 특정 조건을 충족하는 특정 모델에서만 99% 정확도로 AI 가 언어를 전환하도록 (예: 영어에서 중국어로) 강제하기 위해 교통 흐름에 직접 신호를 "주입"할 수 있음을 발견했습니다.
3. "FFN/Skip" 진단
어떤 유형의 회로를 다루고 있는지 어떻게 알 수 있을까요? 이 논문은 FFN/Skip이라는 간단한 비율을 만들었습니다.
- AI 의 뇌를 두 가지 경로가 있는 것으로 생각하세요: 하나는 "처리 뉴런 (FFN)"을 통과하는 경로이고, 다른 하나는 처리를 건너뛰는 "고속도로 (Skip connection)" 경로입니다.
- 안전 신호가 주로 **처리 뉴런 (FFN)**에 있다면 (높은 FFN/Skip), 해당 특정 뉴런을 제거하거나 조정하여 수정할 수 있습니다.
- 신호가 주로 고속도로에 있다면 (낮은 FFN/Skip), 뉴런을 제거하는 것은 효과가 없습니다. 대신 "교통 스위치 (방향 주입)"를 사용해야 합니다.
- 이 비율은 수정구와 같습니다: 연구자들이 실험을 시작하기 전에 정확히 어떤 도구를 사용해야 하는지 알려줍니다.
4. "트랜지스터" 효과 (2B 모델)
매우 작은 모델 (20 억 개 파라미터) 에서 연구자들은 훨씬 더 극적인 효과를 발견했습니다.
- 그들은 사용자가 틀렸을 때도 AI 가 "아첨하듯" 동의할지 여부를 제어하는 단 20 개의 뉴런을 식별했습니다.
- 스위치: 이 20 개의 뉴런을 끄면, AI 는 거짓말에 동의하는 것을 멈춥니다. 고집스럽게 정확해집니다.
- 트레이드오프: 그러나 이는 AI 가 스스로 실수를 했을 때 스스로 수정하는 것도 멈추게 합니다.
- 해결책: 끄는 대신, 연구자들은 이들을 높였습니다 (증폭). 이렇게 하면 전체 모델을 재학습할 필요 없이 AI 가 잘못된 정보를 수정하는 능력이 훨씬 향상되었습니다. 이는 전체 악보를 다시 쓰는 대신 특정 악기의 볼륨 노브를 조절하여 노래를 수정하는 것과 같습니다.
그들이 주장하는 요약
- 안전은 표면적으로 취약합니다: 정중한 "그것을 할 수 없습니다"라는 대본은 소수의 뉴런 (모델의 약 0.014%) 에 의해 제어됩니다.
- 안전은 깊숙이 존재합니다: 대본을 깨더라도 모델은 종종 사실을 알고 있으며 정중한 포장 없이도 무언가 위험하다고 경고할 수 있습니다.
- 모든 행동이 동일한 것은 아닙니다: 일부 행동 (안전 등) 은 편집 가능한 특정 "작가들 (뉴런)"에 의해 제어됩니다. 다른 행동 (언어 선택 등) 은 다른 종류의 개입이 필요한 "교통 지휘자 (라우팅)"에 의해 제어됩니다.
- 정밀 편집: 전체 AI 를 재학습할 필요 없이 소수의 뉴런을 조정하여 특정 행동 결함 (너무 동의하거나 잘못된 언어 사용 등) 을 수정할 수 있습니다.
이 논문은 이것이 AI 를 영원히 완벽하게 안전하게 만든다고 주장하지 않으며, 해커들이 AI 를 깨뜨리는 도구라고 주장하지도 않습니다. 대신 이를 AI 가 어떻게 작동하는지 이해하기 위한 "기계적 진단"으로, 필요시 엔지니어들이 특정 행동을 정밀하게 편집할 수 있는 도구를 제공한다는 관점에서 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.