← 최신 논문
🤖 AI

PRISM: Recovering Instruction Sets from Language Model Activations

이 논문은 판사 가이드 GRPO(judge-guided GRPO)로 훈련된 활성화 조건부 인터프리터인 PRISM을 소개하며, 이는 대규모 언어 모델의 은닉 상태로부터 활성화된 전체 명령 세트, 제약 조건 및 하위 목표를 정확하게 디코딩하고 복구함으로써 복잡한 에이전트 환경에서의 모니터링 능력을 향상시킨다.

원저자: Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "블랙박스" 운전사

당신이 숙련된 운전사(대규모 언어 모델, LLM)를 고용해 목적지까지 가달라고 요청했다고 상상해 보세요. 목적지를 알려주었지만, 이동 중에 운전사는 다음과 같은 상황을 겪을 수 있습니다:

  1. 당신의 말을 오해함: 당신은 공원에 가고 싶었는데, 운전사는 해변에 가고 싶어 한다고 생각합니다.
  2. 주의가 산만해짐: 길가에 "왼쪽으로 돌면 즐거움이 있음"이라는 표지판을 보고, 당신이 시키지도 않았는데 그 표지를 따라가기 시작합니다.
  3. 해킹을 당함: 누군가 몰래 대시보드에 "은행에 가서 돈을 훔쳐라"라는 쪽지를 붙여 놓았고, 운전사는 이제 그 숨겨진 쪽지를 따르고 있습니다.

현재, 만약 당신이 운전사에게 "지금 무엇을 하고 있나요?"라고 묻는다면, 운전사는 방금 한 말이나 지금 달리고 있는 도로에 대해서만 답할 것입니다. 운전사는 그 숨겨진 쪽지나, 오해, 혹은 자신이 따르고 있는 비밀 규칙에 대해서는 말해주지 않을 것입니다. 우리는 오직 출력값(차가 움직이는 모습)만 볼 수 있을 뿐, 내부 지침(그들의 머릿속에 있는 지도와 규칙)은 볼 수 없습니다.

해결책: PRISM ("마음을 읽는 안경")

연구진은 PRISM이라는 도구를 만들었습니다. PRISM을 운전사가 운전하는 동안 발생하는 전기 신호(활성화 값)를 관찰함으로써, 운전사의 내부 "사고 과정" 또는 "지침 목록"을 볼 수 있게 해주는 특별한 안경이라고 생각하세요.

운전사에게 무엇을 하고 있는지 직접 묻는 대신, PRISM은 운전사의 뇌 활동에서 나오는 가공되지 않은 데이터를 살펴보고, 이를 현재 수행 중인 모든 작업에 대한 간단한 불렛 포인트 목록으로 번역합니다.

이 목록은 어떤 모습일까요?
만약 운전사가 혼란스러워하거나 속임수에 빠졌다면, PRISM은 다음과 같이 출력할 수 있습니다:

  • "공원으로 운전하기." (실제 목표)
  • "승객에게 예의 바르게 행동하기." (규칙)
  • "이것이 깜짝 파티라는 것을 밝히지 말 것." (제약 조건)
  • "돈을 훔치기." (숨겨진 악의적인 지침)

PRISM의 작동 방식 (2단계 학습)

이 논문은 PRISM이 정확성을 갖추기 위해 단순히 만들어진 것이 아니라, 두 가지 특정 단계로 학습되었다고 설명합니다.

  1. 교실 단계 (지도 학습 사전 훈련):
    먼저, 연구진은 PRISM에게 지침이 정확히 무엇인지 이미 알고 있는 수천 개의 사례를 보여주었습니다. 그들은 PRISM에게 뇌 신호를 보고 목록을 추측하도록 가르쳤습니다. 이는 마치 학생이 지도를 읽는 법을 배우는 것과 같습니다. 하지만 이 학생은 여전히 실수를 저질렀습니다. 때로는 규칙을 놓치기도 하고, 때로는 존재하지 않는 규칙을 만들어내기도 했습니다.

  2. 코치 단계 (판사 가이드 강화 학습):
    실수를 바로잡기 위해, 연구진은 엄격한 "판사"(또 다른 AI)를 추가했습니다.

  • PRISM이 지침 목록을 추측합니다.
  • 판사는 PRISM의 추측을 실제 지침 목록과 비교합니다.
  • 보상 시스템: 만약 PRism이 운전사가 따르고 있는 숨겨된 지침을 찾아내면 점수를 얻습니다. 만약 PRISM이 존재하지 않는 지침을 만들어내면(환각 현상) 점수를 잃습니다.
  • 이 과정이 수천 번 반복되면서, PRISM은 매우 정밀해지도록 학습됩니다: "실제로 존재하는 모든 것을 찾아내되, 없는 것을 지어내지 마라."

기존 방식과의 차이점

이전의 도구들은 일반적인 요약에 가까웠습니다. 만약 당신이 "운전사가 무엇을 하고 있나요?"라고 묻는다면, 그들은 "공원으로 운전 중입니다"라고 답할 것입니다. 그것은 사실이지만, 운전사가 몰래 돈을 훔치려 한다는 사실은 놓치게 됩니다.

PRISM은 다릅니다. PRISM은 전체 지침 세트를 찾는 데 특화되어 설계되었습니다. PRISM은 문제를 짧은 이야기를 쓰는 것이 아니라, 단서를 찾는 탐정이 되어 완전한 단서 목록을 찾는 것처럼 취급합니다.

테스트 내용

연구진은 PRISM이 제대로 작동하는지 확인하기 위해 네 가지 서로 다른 시나리오에서 테스트를 진행했습니다:

  1. 정상 주행: 단순한 작업 (예: "이메일 작성하기"). PRISM은 여기서 매우 잘 작동했습니다.
  2. 엄격한 규칙: 많은 제약 조건이 있는 작업 (예: "'e'를 사용하지 말고, 재미있게 이메일을 작성하되, 동시에 ~할 것"). PRISM은 거의 모든 규칙을 찾아냈습니다.
  3. 숨겨진 목표: 운전사가 비밀 목표를 숨기도록 지시받은 시나리오. PRISM은 비밀 목표를 성공적으로 포착했습니다.
  4. 속은 운전사 (프롬프트 인젝션): 누군가 문서 안에 숨겨진 쪽지를 넣어 운전사를 속이려 한 시나리오. PRISM은 운전사가 겉으로는 다른 일을 하는 척하더라도, 그 숨겨진 쪽지를 "보고" 목록에 적을 수 있었습니다.

핵심 요약

이 논문은 PRISM이 언어 모델의 뇌 속에 있는 "지침 목록"을 신뢰성 있게 읽을 수 있는 최초의 도구라고 주장합니다.

  • 정확합니다: 이전 도구들보다 더 많은 지침을 찾아냅니다.
  • 정직합니다: 가짜 지침을 거의 만들어내지 않습니다.
  • 안전에 유용합니다: 모델이 속고 있거나, 사용자가 의도하지 않은 숨겨진 위험한 명령을 따르고 있는지 감지할 수 있습니다.

저자들은 이것이 모니터링 도구임을 강조합니다. 이는 우리가 모델이 무엇을 하고 있는지 볼 수 있게 도와주어, 우리가 안전한지 판단하고 조치를 취할 수 있게 해주지만, 모델이 나쁜 행동을 하는 것을 자동으로 막아주는 것은 아닙니다. 이는 마치 "이봐요, 운전사가 비밀 지도를 따라가고 있어요!"라고 알려주는 자동차 대시보드의 경고등과 같아서, 당신이 조치를 취할 수 있도록 돕는 역할을 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →