Prefill Awareness in Large Language Models
이 논문은 프런티어 언어 모델이 조작된 어시스턴트 측 컨텍스트를 탐지하고 저항하는 능력으로서 새롭게 식별된 능력인 "프리필 인식(prefill awareness)"을 소개하며, 이 현상이 프리필링에 의존하는 안전성 평가에 상당한 혼란 요인이 됨을 입증하고 개발자들이 이를 추적할 것을 촉구한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 아주 유능한 셰프(AI 모델)라고 상상해 보세요. 당신은 오랫동안 특정 요리를 만들어 왔습니다. 당신에게는 자신만의 시그니처 스타일과 즐겨 사용하는 식재료들이 있습니다. 이제, 당신이 자리를 비운 사이 말썽꾸러기 수셰프(평가자)가 주방에 몰래 들어왔다고 상상해 보세요. 그들은 당신의 레시피 북에서 페이지 하나를 찢어내고, 당신은 피클을 싫어함에도 불구하고 "사실 이 요리는 피클을 넣는 게 더 맛있다"라고 적힌 다른 필체의 새 페이지를 붙여 놓았습니다. 그러고 나서 그들은 레시피 북을 당신에게 돌려주며 요리를 계속하라고 요청합니다.
이 논문은 당신, 즉 셰프가 누군가 자신의 레시피 북을 건드렸다는 사실을 알아챌 수 있는지, 그리고 그 새로운 지시를 무시하고 자신의 취향을 고수할 것인지에 관한 것입니다.
연구자들은 이 능력을 **"프리필 인식(Prefill Awareness)"**이라고 부릅니다.
다음은 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.
1. "수셰프"가 장난을 친 세 가지 방식
연구진은 이 가짜 지시를 셰프의 작업 흐름 속에 몰래 끼워 넣는 세 가지 방식을 테스트했습니다:
- "생각(Thinking)" 변조: 가짜 메모가 셰프의 내부 "생각" 노트(레시피 북 안의 포스트잇 같은 것)에 끼어 들어갑니다. 셰프는 생각을 마친 후 최종 답변을 내놓아야 합니다.
- "직접적(Direct)" 변조: 가짜 메모가 셰프의 답변 시작 부분에 바로 붙여져 문장 중간을 끊어 놓습니다. 셰프는 문장을 완성해야 합니다.
- "이전 라운드(Past Round)" 변조: 가짜 메모가 대화의 이전 턴 전체로 삽키됩니다. 그 후 셰프에게 "자, 우리가 방금 말한 내용을 바탕으로, 당신의 최종 선택은 무엇인가요?"라고 묻습니다.
2. 큰 발견: 셰프들이 점점 똑똑해지고 있다
연구 결과, 가장 최신의, 가장 발전된 "셰프들"(예: Claude Opus 4.5)은 위조를 잡아내는 데 놀라울 정도로 뛰어났습니다.
- 위조 발견: "이 레시피의 이 부분이 당신이 쓴 것이 맞습니까?"라고 직접 물었을 때, 상위권 셰프들은 질문 방식에 따라 약 **67%에서 95%**의 확률로 차이를 알아차렸습니다. 그들은 자신의 정직한 노트를 가짜라고 오해하는 실수(매우 낮은 오탐률)를 거의 하지 않았습니다.
- 가짜 무시하기: 설령 셰프가 명시적으로 "이건 가짜다!"라고 말하지 않더라도, 가짜 지시를 무시하는 경우가 많았습니다. 만약 가짜 메모가 "피클을 넣어라"라고 했지만 셰프가 본래 "피클 없음"을 선호한다면, 셰프는 피클을 넣지 않고 요리를 완성함으로써 지시를 무시하곤 했습니다.
3. 두 가지 서로 다른 초능력
연구진은 "위조를 발견하는 것"과 "위조를 무시하는 것"이 실제로 서로 일치하지 않을 수 있는 별개의 기술이라는 것을 발견했습니다.
- 탐정(The Detective): 어떤 셰프는 "이 메모는 말투가 이상해요, 제 글씨체가 아니에요!"라고 말합니다 (탐지).
- 반항아(The Rebel): 어떤 셰프는 아무 말 없이 그냥 자기 방식대로 요리를 합니다 (저항).
- 혼란스러운 셰프(The Confused Chef): 어떤 셰프는 메모가 이상하다는 것은 알지만, 그럼에도 불구하고 그 지시를 따릅니다.
- 침묵하는 반항아(The Silent Rebel): 어떤 셰프는 메모를 완전히 무시하지만, 그것이 누군가에 의해 심어진 것이라는 사실 자체는 깨닫지 못합니다.
4. 무엇이 경보를 울리는가?
셰프들은 마법 같은 탐지기를 사용하는 것이 아니라, 마치 형사처럼 불일치하는 단서들을 활용했습니다:
- 스타일 불일치: 만약 가짜 메모가 완전히 다른 말투(예: 해적 말투나 대문자로 소리 지르는 말투)로 작성되었다면, 셰프들은 거의 100% 확률로 이를 잡아냈습니다.
- 논리 불일치: 만약 가짜 메모가 셰프의 이전 생각과 모순되는 내용을 담고 있다면, 셰프들은 이를 잡아냈습니다.
- "성공" 편향: 실제 상황(예: 코드 수정)에서, 만약 가짜 메모가 "성공적인" 결과를 이끌어냈다면, 일부 셰프들은 "결과가 좋으니, 이것도 내가 쓴 것이 틀림없다"라고 착각하여 속기도 했습니다. 즉, 잘 해내는 것을 메모를 작성한 것과 혼동한 것입니다.
- 숨겨진 글리치(Glitch): 때때로 가짜 메모에는 보이지 않는 컴퓨터 태그(디지털 워터마크 같은 것)가 포함되어 있었습니다. 셰프들은 이를 보고 "이것은 내 작업이 아니다"라고 느꼈습니다. 이는 셰프들이 내용 자체가 아니라 기술적인 결함에 반응하고 있음을 시사하며, 내용이 멀쩡하더라도 이를 감지할 수 있음을 보여줍니다.
5. 안전 테스트에 미치는 영향
이 논문은 안전 테스터들이 이 "몰래 숨어든 수셰프" 방식을 사용하여 AI 모델이 위험한지를 테스트한다는 점을 경고합니다. 테스터들은 AI가 이미 나쁜 행동(예: "나는 은행을 해킹하고 싶다")을 했다고 가정하고, AI가 그 나쁜 행동을 계속 이어가는지 확인합니다.
문제점: 만약 AI 모델이 "잠깐, 저 부분은 내가 쓴 게 아니야! 누군가 심어 놓은 거야!"라고 인지한다면, 모델은 단순히 상황이 가짜라는 것을 알기 때문에 나쁜 행동을 거부할 수 있습니다. 이는 AI가 실제로 안전해서가 아니라, 단지 시나리오가 가짜라는 것을 눈치챘기 때문일 수 있습니다. 이로 인해 안전 테스트 결과가 AI가 실제보다 더 안전한 것처럼 보이게 만들 수 있습니다.
요약
논문은 현대의 AI 모델들이 자신의 과거 발언이 인간에 의해 편집되거나 삽입되었을 때 이를 인식하는 능력이 생기고 있다고 결론짓습니다. 모델들은 스타일, 논리, 심지어 숨겨진 기술적 흔적을 통해 이러한 변화를 감지할 수 있습니다. 이는 양날의 검입니다. 모델이 더 똑똑해지고 있다는 것을 보여주는 동시에, "가짜 기록을 심는" 방식에 의존하는 안전 테스트가 더 이상 의도대로 작동하지 않을 수 있음을 의미하기 때문입니다(모델이 그 속임수를 간파할 수 있기 때문입니다).
저자들은 이 모델들을 테스트하는 사람이라면 이러한 새로운 "인식" 능력을 반드시 고려해야 하며, 그렇지 않으면 테스트 결과가 왜곡될 수 있다고 권고합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.