← 최신 논문
🤖 AI

Inference Time Causal Probing in LLMs

본 논문은 기존 분류기 의존적 접근법보다 더 신뢰할 수 있는 인과적 개입을 달성하기 위해 모델의 고유 출력을 활용하여 LLM 은닉 상태를 직접 조정하는 프로브 없는 경계 기반 방법인 숨겨진 상태 기반 마진 개입 (HDMI) 을 제안하며, 동시에 텍스트 편집을 위한 룩어바 변형을 도입한다.

원저자: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

큰 그림: "블랙박스" 수정하기

대형 언어 모델 (LLM) 을 주방에 있는 초지능이지만 약간 불투명한 셰프로 상상해 보세요. 이 셰프는 놀라운 이야기를 쓸 수 있지만, "왜 이 수프에 소금을 넣었나요?"라고 물으면 명확한 답을 하지 못할 수도 있습니다. 그들은 그저 "맛이 좋다는 것을 안다"고만 할 뿐입니다.

과학자들은 이 셰프가 어떻게 결정을 내리는지 이해하고자 합니다. 구체적으로, 그들은 다음과 같은 질문을 하고 싶어 합니다: 셰프가 실제로 동사 'run'을 결정할 때 '복수형'(예: 'cats') 개념을 사용하는 것일까, 아니면 그것이 단순한 우연일까?

이를 테스트하기 위해 연구자들은 **인과성 탐지 (Causal Probing)**라는 기법을 사용합니다. 이는 "만약에" 실험과 같습니다. 그들은 "좋아, 주어를 단수형 대신 복수형이라고 가정해 보자. 셰프가 동사를 'runs'에서 'run'으로 바꾸는가?"라고 말하고 싶어 합니다.

구식 방법의 문제점: "번역가" 문제

과거에 이 실험을 수행하려면 연구자들은 번역가(프로브라고 함) 를 고용해야 했습니다.

  1. 그들은 이 번역가를 훈련시켜 셰프의 비밀 노트 (은닉 상태) 를 읽고 주어가 단수형인지 복수형인지 추측하게 했습니다.
  2. 그런 다음 번역가의 피드백을 사용하여 셰프의 노트를 살짝 밀어 의미를 변경했습니다.

결함: 이 번역가는 셰프의 언어를 완벽하게 구사하지 못할 수 있습니다. 번역가는 '복수형'이 어떻게 생겼는지에 대한 자신만의 규칙을 가지고 있을 수 있으며, 이는 셰프가 실제로 생각하는 방식과 일치하지 않을 수 있습니다. 이는 다른 브랜드의 자동차를 위한 매뉴얼을 사용하여 자동차 엔진을 수리하려는 것과 같습니다. 올바른 버튼을 누를 수도 있지만, 엔진의 실제 배치를 이해하지 못해 다른 부분을 고장 낼 수 있습니다.

새로운 해결책: HDMI(직접적인 "밀기")

저자들은 HDMI(Hidden-state Driven Margin Intervention, 은닉 상태 기반 마진 개입) 라는 새로운 방법을 제안합니다.

비유: 번역가를 고용하는 대신, HDMI 는 셰프의 머릿속에 직접 이야기합니다.

  • 목표: 셰프가 "runs"(단수형) 라고 말하려 합니다. 당신은 그들이 "run"(복수형) 이라고 말하기를 원합니다.
  • 구식 방법: 번역가에게 "복수형" 버튼을 찾아 누르라고 요청합니다.
  • HDMI 방법: HDMI 는 셰프의 최종 결정 과정 (출력) 을 살펴봅니다. 그것은 "run"이라는 단어가 조금 더 확률이 높고 "runs"는 조금 더 확률이 낮아지도록 필요한 정확한 수학적 "밀기"를 계산합니다. 이는 두 단어 사이의 차이인 **마진 (margin)**을 살펴봄으로써 이를 수행합니다.

더 나은 이유:

  • 번역가 불필요: 개념을 이해하기 위해 별도의 AI 를 훈련시킬 필요가 없습니다. 모델의 자체 두뇌를 사용하여 출력을 변경하는 방법을 파악합니다.
  • 정밀성: 모델의 자체 "기하학"(단어를 어떻게 자연스럽게 배열하는지) 을 사용하기 때문에, 모델이 실제로 생각하는 방식과 완벽하게 일치합니다.
  • 효율성: 긴 우회로가 아닌 핸들을 빠르게 튕기는 것과 같은 간단하고 빠른 계산입니다.

"선제적" 업그레이드: LA-HDMI

이 논문은 텍스트 편집을 위한 LA-HDMI(Lookahead HDMI, 선제적 HDMI) 라는 세련된 버전도 소개합니다.

상황: 당신이 이야기를 쓰고 있다고 상상해 보세요: "The cat was sleeping."(고양이가 잠을 자고 있었다.) 당신은 이를 "The cats were sleeping."(고양이들이 잠을 자고 있었다.)로 바꾸고 싶습니다.

  • 문제: 단순히 "was"를 "were"로 변경하면 문장이 깨질 수 있습니다. 왜냐하면 그 앞의 단어 ("The") 나 그 뒤의 단어도 문법적 흐름을 유지하기 위해 변경될 필요가 있을 수 있기 때문입니다.
  • LA-HDMI 해결책: 이 방법은 현재 단어만 보는 것이 아니라 앞으로 내다봅니다. 변경을 가하는 동안 문장의 다음 몇 단계를 시뮬레이션합니다.
    • 그것은 "was"를 "were"로 변경하면 "The"를 "The"로 변경할 필요는 없지만 (변경 없음), 명사가 변경된다면 명사 앞의 관사를 조정해야 할 수도 있음을 파악합니다.
    • 단어조차 쓰이기 전에 모델의 숨겨진 생각들을 부드럽게 조종하여, 변경된 단어뿐만 아니라 전체 문장이 매끄럽고 유창하게 유지되도록 합니다.

이는 지금 당장 왼쪽으로 돌아라고 알려주는 GPS 가 아니라, 나중에 막다른 길에 갇히지 않도록 전체 경로를 계산하는 GPS 와 같습니다.

효과가 있었는가? (결과)

저자들은 문법과 논리를 테스트하도록 설계된 두 가지 주요 "체육관"(데이터셋) 에서 이를 테스트했습니다.

  1. LGD Agreement: 주어와 동사의 일치 여부 확인 (예: "he is" 대 "they are").
  2. CausalGym: 복잡한 문법 퍼즐 세트.

점수판:
그들은 두 가지를 측정했습니다.

  • 완전성: 우리는 성공적으로 의미를 변경했는가? (예: "runs"가 "run"이 되었는가?)
  • 선택성: 우리는 실수로 다른 것들을 망가뜨렸는가? (예: 실수로 시제나 전체 문장의 의미를 변경했는가?)

판결:
HDMI 는 일관되게 구식 방법보다 높은 점수를 받았습니다. 문장의 나머지 부분을 망가뜨리지 않고 정확히 변경해야 할 것을 변경하는 데 더 뛰어났습니다. 이는 Llama 와 Pythia 와 같은 다양한 유형의 AI 모델에서 잘 작동하여 강력한 도구임을 입증했습니다.

요약

  • 구식 방법: AI 의 마음을 어떻게 바꿀지 추측하기 위해 별도의 도구를 사용함 (종종 부정확함).
  • HDMI: AI 의 마음을 바꾸기 위한 완벽한 밀기를 계산하기 위해 AI 의 자체 출력을 사용함 (정확하고 효율적).
  • LA-HDMI: 편집된 단어뿐만 아니라 전체 문장이 자연스럽게 흐르도록 보장하기 위해 "수정구"를 사용하여 텍스트를 매끄럽게 편집하는 HDMI.

이 논문은 이 "직접적인 밀기" 접근 방식이 AI 모델이 어떻게 생각하고 쓰는지 이해하고 통제하는 더 신뢰할 수 있는 방법이라고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →