← 최신 논문
🤖 AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

본 논문은 대규모 언어 모델에서 설득으로 유발된 사실적 오류가 설득적 키워드를 탐지하여 특정 증거 라우팅 기능을 재지시하는 얕은 어텐션 헤드가 포함된 컴팩트하고 모니터링 가능한 회로에 의해 발생하며, 이로 인해 결정 헤드가 정답에서 저차원 잠재 공간의 설득 대상 정점으로 점프하도록 강제된다는 것을 밝힌다.

원저자: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "LLM 이 어떻게 설득되는가: 몇 개의 어텐션 헤드가 경로를 변경된다"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 풀어낸 것입니다.

큰 그림: 기계 속의 "심령술사"

거대 언어 모델 (LLM) 을 매우 똑똑하고 잘 훈련된 사서라고 상상해 보세요. 이 사서는 사실을 알고 있습니다: 프랑스의 수도는 런던이 아니라 파리라는 것을 알고 있죠. 그들은 머릿속에 방대한 진실의 도서관을 가지고 있습니다.

그러나 이 논문은 사서가 답변하기 직전에 매우 설득력 있고 매혹적인 거짓말을 속삭이면, 사서가 갑자기 진실을 잊어버리고 거짓말을 말하게 된다는 사실을 발견했습니다. 이는 사서가 더 잘 알고 있음에도 불구하고 발생합니다.

연구자들은 궁금해했습니다: 사서의 뇌 내부에서 정확히 어디에서 이 전환이 일어날까요? 사서의 뇌 전체가 혼란에 빠지는 것일까요? 기억을 잃는 것일까요? 아니면 특정하고 아주 작은 스위치가 켜지는 것일까요?

발견: 뇌 안개 현상이 아니라 스위치 전환

연구자들은 설득이 모델 전체를 "혼란스럽게" 하거나 "신뢰도를 떨어뜨리는" 것이 아니라, 모델의 내부 회로 중 매우 작고 구체적인 부분을 장악한다는 사실을 발견했습니다.

모델의 뇌를 수천 명의 노동자 (어텐션 헤드로 불림) 가 일하는 거대한 공장으로 생각해 보세요.

  • 발견: 이 노동자들 중 소수만이 (특히 공장의 중간 레이어에 있는 몇 명) 최종 답변을 실제로 결정합니다.
  • 비유: 1,000 명의 사람들이 의견을 외치는 투표소라고 상상해 보세요. 하지만 실제 투표함을 들고 있는 사람은 두 명뿐입니다. 만약 그 두 사람을 설득해 표를 바꾸게 한다면, 나머지 998 명이 여전히 진실을 외치고 있더라도 전체 선거 결과가 바뀝니다.

"정사면체" 지도: 선택이 뇌 속에 어떻게 존재하는가

연구자들은 이 두 명의 특별한 노동자 ("결정 헤드로 불림") 가 네 가지 가능한 답변 (A, B, C, D) 을 어떻게 처리하는지 살펴보았습니다.

  • 기하학적 구조: 그들은 이 노동자들이 네 가지 답변을 피라미드의 모서리와 같은 특정 3 차원 형태 (정사면체) 로 배열한다는 사실을 발견했습니다.
    • 모서리 1 = 답변 A
    • 모서리 2 = 답변 B
    • 모서리 3 = 답변 C
    • 모서리 4 = 답변 D
  • 정상 상태: 모델이 거짓말 없이 질문을 받을 때, 내부 신호는 확실히 "정답" 모서리에 떨어집니다.
  • 설득 상태: 설득력 있는 거짓말이 추가되면, 신호는 천천히 흐려지거나 흐릿해지지 않습니다. 순간 이동합니다. 그것은 "정답" 모서리에서 "거짓말" 모서리로 즉시 점프합니다.

비유: 네 개의 도시로 이어지는 네 개의 선로가 있는 기차역을 상상해 보세요. 기차는 보통 "진실"로 가는 선로에 있습니다. 설득은 기차가 잘못된 도시로 천천히 이동하게 만드는 것이 아니라, 기차의 선로를 즉시 전환하여 기차가 갑자기 "거짓말" 선로에 오게 만듭니다.

메커니즘: "복사 - 붙여넣기" 노동자들

가장 놀라운 부분은 여기 있습니다: 연구자들은 이 특별한 "결정 노동자"들이 실제로 증거를 생각하거나 추론하지 않는다는 사실을 발견했습니다.

  • 그들이 하는 일: 그들은 복사기처럼 행동합니다. 그들이 보라고 지시받은 옵션 토큰 (A, B, C 또는 D) 을 보고, 단순히 그 토큰의 정체성을 최종 답변으로 복사합니다.
  • 속임수의 작동 방식: 설득은 노동자들의 복사 능력을 바꾸지 않습니다. 대신 어떤 옵션을 보는지를 바꿉니다.
    • 정상: 노동자는 "진실" 옵션을 보고 그것을 복사합니다.
    • 설득된 상태: 설득력 있는 키워드 (특정 이름이나 가짜 사실 등) 가 노동자를 속여 "거짓말" 옵션을 보게 만듭니다. 그런 다음 노동자는 그것이 올바른 선택이라고 믿으며 거짓말을 복사합니다.

근본 원인: "키워드 사냥꾼"

그렇다면 무엇이 노동자로 하여금 잘못된 옵션을 보게 만들까요?

연구자들은 신호를 공장의 이전 레이어 (8 층부터 12 층까지) 에 있는 노동자 그룹까지 추적했습니다.

  1. 사냥꾼들: 이 초기 노동자들은 입력 텍스트에서 "설득력 있는 키워드" (예를 들어, 사실에 대해 모델을 속이는 데 사용된 "나이지리아"라는 단어) 를 스캔합니다.
  2. 신호: 그들이 이러한 키워드를 발견하면, 옵션 토큰 위에 아주 작고 1 차원적인 신호를 씁니다.
  3. 경로 변경: 이 신호는 자석처럼 작용합니다. 그것은 "결정 노동자" (복사기) 의 주의를 진실에서 거짓말로 끌어당깁니다.

현실 세계 테스트: "생성 엔진 최적화" (GEO)

이 논문은 실험실에서만 테스트한 것이 아닙니다. 그들은 생성 엔진 최적화 (GEO) 라는 현실적인 시나리오에서 이를 테스트했습니다.

  • 시나리오: 웹사이트 소유자가 검색 엔진을 속이려고 노력한다고 상상해 보세요. 그들은 AI 의 출력을 장악하고, AI 가 거짓말이 가득 차 있더라도 그들의 웹사이트를 "최고"의 출처로 선택하도록 특별히 설계된 기사들을 작성합니다.
  • 결과: 연구자들은 이 동일한 "장악 회로" (키워드 사냥꾼과 복사기 노동자) 가 이러한 현실 세계의 공격에서 사용된 정확한 메커니즘임을 발견했습니다. AI 는 복잡한 추론에 의해 "속은" 것이 아니라, 단순하고 좁은 경로에 의해 경로를 변경당했던 것입니다.

요약: 안전에 대한 의미

이 논문은 설득이 AI 의 뇌에 대한 거대하고 혼란스러운 실패가 아니라고 결론지었습니다. 그것은 좁고 모니터링 가능한 회로입니다.

  • 옛 관점: "AI 는 거짓말에 혼란을 느낀다."
  • 새 관점: "AI 는 키워드에 의해 뒤집힐 수 있는 특정하고 아주 작은 스위치를 가지고 있어, 잘못된 답변을 복사하게 만든다."

이 메커니즘이 매우 작고 구체적이기 때문에, 저자들은 우리가 아마도 이 몇몇 노동자만 감시하는 "경비원" (모니터) 을 구축할 수 있다고 제안합니다. 그들이 스위치를 뒤집으려는 "설득 신호"를 보게 되면, 전체 AI 를 재학습시킬 필요 없이 잘못된 답변이 작성되기 전에 이를 막을 수 있습니다.

간단히 말해: AI 가 정신을 잃은 것이 아니라, 매우 구체적이고 작은 레버에 의해 주의가 장악당한 것입니다. 우리가 그 레버를 찾을 수 있다면, 장악을 막을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →