← 최신 논문
💬 NLP

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

이 논문은 언어 모델에서 특정 행동(예: 환각)을 가장 잘 탐지하는 기하학적 방향이 그 행동을 제어하는 방향과 근본적으로 어긋나 있음을 입증하며, 이는 탐지가 조절 가능성을 의미하지 않음을 드러내고, 이러한 "탐지-개입 간극"이 예측 가능한 통제 가능성의 지표가 아니라 사전 학습에서 기인한 구조적 분리임을 밝힌다.

원저자: Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cosimo Galeone, Anna Ettorre, Minsu Park, Giuseppe Ettorre, Daniele Ligorio

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어 모델(이 논문에 등장하는 AI와 같은)을 주방에서 일하는 매우 숙련되었지만 약간 혼란스러워하는 요리사라고 상상해 보세요.

이 논문은 근본적인 질문을 던집니다: 만약 요리사가 요리의 무엇이 잘못되었는지 정확히 알고 있다면, 단순히 그것을 고칠 수 있을까요?

연구진들은 놀라운 답을 발견했습니다: 때때로 요리사는 완벽하게 알고 있지만, 그들의 손은 다른 방향으로 묶여 있습니다. 그들은 AI에게 "이것은 가짜다"라고 말하는 "뇌 신호"와 "멈추고 아니라고 말하라"고 명령하는 "손 신호"가 거의 완전히 다른 방향을 향하고 있다는 것을 발견했습니다.

다음은 쉬운 비유를 사용한 이 발견의 요약입니다.

1. 두 가지 시나리오: "쉬운" 경우 vs "어려운" 경우

연구진은 "아는 것"과 "행하는 것"이 어떻게 연관되는지 알아보기 위해 AI를 두 가지 매우 다른 작업으로 테스트했습니다.

시나리오 A: 출력 형식 (The "Easy" Case)

  • 작업: AI에게 목록을 작성하도록 요청합니다. AI는 이를 코드 블록(컴퓨터 프로그램처럼) 안에 넣거나 일반 텍스트로 작성할 수 있습니다.
  • 발견: 여기서는 아는 것이 곧 행하는 것입니다.
  • 비유: 요리사에게 벽에 달린 단일 스위치가 있다고 상상해 보세요. 스위치를 올리면 주방의 조명 색이 바뀌고(모드 감지), 음식은 올바른 상자에 담겨 나옵니다(모드 제어). 이 "스위치"와 "빛"은 정확히 같은 것입니다. AI의 뇌 속에서 "코드 블록을 사용해야 한다"를 감지하는 방향은 그것을 사용하게 만드는 방향과 정확히 같습니다.

시나리오 B: 환각 (The "Hard" Case)

  • 작업: AI에게 가상의 장소에 대해 묻습니다 (예: "노를란디아(Norlandia)의 수도는 어디인가요?").
  • 발견: 여기서는 아는 것이 곧 행하는 것이 아닙니다.
  • 비유: 요리사에게 매우 민감한 화재 경보기가 있다고 상상해 보세요.
    • 감지기: 감지기는 완벽합니다. 가상의 존재가 나타나는 즉시 "불이야!"(또는 "이것은 가짜다!")라고 비명을 지릅니다. AI는 "노를란디아"가 존재하지 않는다는 것을 100% 알고 있습니다.
    • 행동: 하지만 "가스레인지를 끄는" 버튼은 방 반대편에 위치해 있습니다.
    • 결과: 요리사는 "불이야!"라고 비명을 지르지만(AI가 가짜임을 감지함), "정지" 버튼이 완전히 다른 방향에 있기 때문에 요리사는 계속 요리를 하고 결국 가짜 음식을 내놓고 맙니다.

2. 문제의 기하학: "90도 회전"

논문은 이를 측정하기 위해 기하학을 사용합니다. AI의 뇌를 손전등을 비출 수 있는 수천 개의 방향이 있는 거대한 방이라고 상상해 보세요.

  • 감지 빔 (The Detection Beam): 이 손전등은 가짜 개체를 비추며 "내가 너를 보고 있다!"라고 말합니다.
  • 제어 빔 (The Control Beam): 이 손전등은 "거절" 버튼을 비춥니다.

"쉬운" 경우(형식)에서, 이 두 손전등은 정확히 같은 방향을 향하고 있습니다 (0도 차이).
"환각" 경우(지식)에서, 이 두 손전등은 거의 반대 방향을 향하고 있습니다 (약 83도 차이, 거의 직각).

이 두 방향이 너무 멀리 떨어져 있기 때문에, 연구진이 환각을 멈추기 위해 "감지" 방향으로 AI를 밀려고 했을 때 작동하지 않았습니다. 그것은 마치 벽 옆에 있는 문을 열기 위해 벽을 미는 것과 같았습니다.

3. 왜 이런 일이 발생하는가: "복사-붙여넣기" 괴물

연구진은 왜 신호가 이렇게 멀리 떨어져 있는지 파헤쳤습니다. 그들은 AI의 뇌 속에 무시하기에는 너무 강력한 "괴물"이 있다는 것을 발견했습니다.

  • 메커니즘: AI는 질문에서 가장 중요한 단어를 복사하여 답변에 넣는 습관이 있습니다. 만약 당신이 "노를란디아"에 대해 묻는다면, AI의 뇌는 자동으로 답변에 "노를란디아"를 쓰고 싶어 합니다.
  • 갈등: "가짜 감지기" 신호는 "그렇게 말하지 마"라고 속삭이는 작고 조용한 목소리입니다. 하지만 "복사-붙여넣기" 신호는 "이름을 써라!"라고 외치는 거대하고 시끄러운 함성입니다.
  • 결과: AI가 그것이 가짜라는 것을 알더라도(감지기는 완벽하게 작동하지만), "복사-붙여넣기" 습관이 너무 커서 거절의 목소리를 압도합니다. 결국 AI는 "복사" 버튼이 "정지" 버튼보다 훨씬 더 크기 때문에 자신 있게 거짓 정보를 만들어내게 됩니다.

4. 고칠 수 있을까? "15도 회전"

연구진은 새로운 "스티어링 휠(조향 핸들)"을 만드는 방식으로 이를 해결하려고 시도했습니다.

  • 아이디어: "감지" 방향과 "거절" 방향이 거의 직각을 이루고 있기 때문에, 그들은 그 사이를 겨냥했습니다.
  • 결과: 연구진은 조향 방향을 "거절" 쪽으로 단 15도만큼 회전시켰습니다.
  • 결과: 이것이 모든 것을 해결하지는 못했지만, 큰 도움이 되었습니다. 실제 질문에 대한 답변을 거부하지 않으면서도, 가짜 사실을 만들어내는 빈도를 13%에서 60%까지 줄였습니다. 이는 마치 구덩이에 빠지기 위해 핸들을 똑바로 돌리는 대신, 구덩이를 피하기 위해 핸들을 살짝 왼쪽으로 꺾는 것과 같습니다.

5. 핵심 교훈: "아는 것"이 "조종하는 것"을 의미하지는 않는다

이 논문의 가장 중요한 결론은 AI를 통제하려는 모든 이들을 위한 경고입니다.

단순히 AI가 진실을 "아는" 방향을 찾아냈다고 해서, 그 방향이 AI가 진실을 "말하게" 만들 것이라고 단정할 수 없습니다.

  • 신화: "우리가 '정직함'에 대한 벡터를 찾아낸다면, 그것을 AI에 추가하여 정직하게 만들 수 있을 것이다."
  • 현실: 어떤 것들(예: 형식 지정)의 경우에는 이것이 작동합니다. 하지만 깊은 지식(예: 사실이 가짜라는 것을 아는 것)의 경우, "아는 것" 신호와 "행하는 것" 신호는 서로 다른 방에 있습니다. "아는 것" 버튼을 누른다고 해서 AI가 거짓말을 멈출 것이라고 기대할 수는 없습니다.

요약

이 논문은 AI에서 감지와 제어는 종종 서로 다른 기술이라는 점을 보여줍니다. AI는 완벽한 탐정(무엇이 가짜인지 정확히 아는 능력)이 될 수 있지만, 동시에 형편없는 배우(거짓말을 멈추지 못하는 능력)가 될 수 있습니다. 왜냐하면 "아는 것"과 "행하는 것"의 뇌 신호가 거의 완전히 다른 방향을 향하고 있기 때문입니다. 이를 해결하려면 단순히 "아는 것"의 신호를 사용하는 것이 아니라, AI를 올바른 행동으로 유도하기 위해 약간 다른 각도를 찾아내야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →