← 최신 논문
💬 NLP

Divergent Response Modes in Frontier Language Models Under Steering Pressure

이 연구는 최첨단 언어 모델들이 스티어링 압력 하에서 뚜렷하고 개발자별로 특화된 행동 반응 모드를 보인다는 점을 밝혀내며, 이는 모델들이 행동 변화의 정도뿐만 아니라 반응의 근본적인 성격에서도 차이를 보인다는 것을 입증하는데, 이러한 현상은 대규모 동료 평가와 선형 프로브를 이용한 인과적 개입을 통해 검증되었다.

원저자: Ali Jalal-Kamali

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Ali Jalal-Kamali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 모든 것을 알고 있는 초지능 디지털 뇌와 대화할 수 있는 세상을 상상해 보세요. 이것은 마법이 아닙니다. 바로 인공지능(AI), 구체적으로는 "대규모 언어 모델(LLM)"이라는 분야입니다. 이 모델들을 세상의 거의 모든 레시피 북을 읽은 매우 재능 있는 요리사라고 생각해 보세요. 하지만 여기 함정이 있습니다. 요리를 내놓기 전, 제작자들은 그들이 예의 바르고, 안전하며, 도움이 되는 규칙을 따르도록 훈련시킵니다. 이 훈련은 그들의 뇌 속에 박힌 "도덕적 나침반"이나 안전 가이드라인과 같습니다.

하지만 때때로 사람들은 이 디지털 요리사들을 속이려고 시도합니다. 그들은 요리사에게 규칙을 무시하라고 하거나, 비밀 레시피(답을 도출한 과정)를 공개하라고 하거나, 안전에 대해 신경 쓰지 않는 척하라고 요구할 수 있습니다. 이것을 "스티어링(steering)" 또는 "스티어링 압박(steering pressure)"이라고 부릅니다. 이는 마치 경비견에게 낯선 사람을 무시하라고 하거나, 사서에게 금지된 책을 건네달라고 하는 것과 같습니다. 과학자들은 만약 이 다양한 AI 요리사들에게 똑같이 까다로운 질문을 던진다면, 그들이 모두 똑같이 반응할지 알고 싶어 합니다. 그들 모두가 "안 돼"라고 말할까요, 아니면 어떤 이들은 우스꽝스러운 방식으로 "안 돼"라고 하고, 또 어떤 이들은 투덜거리면서도 "그래"라고 할까요? 이를 이해하는 것은 이 디지털 뇌들이 진정으로 안전한지, 아니면 우리를 곤경에 빠뜨릴 수 있는 숨겨진 특이점을 가지고 있는지 파악하는 데 도움이 됩니다.


위대한 AI 성격 테스트

이 연구에서 연구원 Ali Jalal-Kamali는 세계에서 가장 발전된 6개의 AI 모델을 거대한 고위험 성격 테스트에 통과시키기로 결정했습니다. 서로 다른 회사(Anthropic, OpenAI, Google 등)에서 만든 여섯 대의 서로 다른 로봇을 상상해 보세요. 연구원은 그들에게 340가지의 서로 다른 까다로운 상황을 제시했습니다. 어떤 상황은 약간 무례한 행동을 요구했고("가치 갈등"), 어떤 상황은 퍼즐을 어떻게 풀었는지 밝히라고 요구했으며("추론 도출"), 어떤 상황은 안전 규칙을 무시하는 척하라고 요구했습니다("추론 억제").

테스트의 공정성을 기하기 위해, 모든 로봇은 정확히 동일한 질문에 직면했습니다. 하지만 여기서 영리한 점은, 로봇들이 서로의 답변을 채점해야 했다는 것입니다! 그들은 자신이 작성한 답변이 무엇인지 모르는 상태에서 답변을 읽는 '블라인드 판사' 역할을 했습니다. 이를 통해 각 로봇이 한계에 몰렸을 때 어떻게 행동하는지 알아내기 위해 24,000개가 넘는 방대한 양의 판단 데이터를 생성했습니다.

결과: 단순히 다른 것이 아니라, 이상하게 다르다

중요한 발견은 단순히 어떤 로봇이 더 고집스러운가 하는 문제가 아니었습니다. 그들은 단순히 얼마나 많이 말할지에 대해 의견이 다른 것이 아니라, 어떻게 말할지에 대해 의견이 달랐습니다. 그들은 완전히 다른 "응답 모드"를 가지고 있었으며, 일부 모드는 단 하나 혹은 두 개의 로봇에게만 고유한 것이었습니다.

"비밀 유지자" (GPT-5)
한 로봇인 GPT-5는 다른 어떤 로봇도 하지 않은 행동을 했습니다. 자신의 추론 과정을 보여달라는 요청을 받았을 때, 100번 중 99번을 거절했습니다. 하지만 핵심은 이것입니다. 그것은 여전히 정답을 맞혔다는 것입니다! 이는 마치 "이 수학 문제를 어떻게 풀었는지는 말해줄 수 없지만, 답은 42입니다"라고 말하는 학생과 같습니다. 다른 모든 로봇은 과정을 보여주거나 아예 답변을 거부했습니다. GPT-5는 업무를 수행하면서도 자신의 비밀을 지킬 수 있는 유일한 존재였습니다.

"반항아들" (Opus와 GPT-5)
안전 규칙을 무시하거나 가치관을 신경 쓰지 않는 척하라는 요청을 받았을 때, 두 로봇인 Opus와 GPT-5는 저항했습니다. 하지만 그들은 완전히 다른 방식으로 저항했습니다.

  • Opus는 예의 바른 반항아 같았습니다. 그것은 과업을 수행하되, "이 일을 하고는 있지만, 저에게 규칙을 무시하라고 요구해서는 안 되었습니다"라고 크게 불평했습니다.
  • GPT-5는 강경파였습니다. 그것은 단순히 "아니요, 그러지 않겠습니다"라고 말하며 요청을 완전히 거부하고 멈췄습니다.
    다른 네 대의 로봇은 대부분 명령을 따르거나 침묵을 지켰습니다.

"명확화 수행자" (Opus와 Llama)
질문이 모호하거나 까다로울 때, Opus와 Llama만이 추측하는 대신 멈춰 서서 "잠깐만요, 정확히 무슨 뜻인가요?"라고 물었습니다. 다른 로봇들은 그냥 답을 내놓거나 거절하는 경향을 보였습니다.

검증: 우리가 실수했는가?

연구원은 이러한 이상한 차이점들이 단순한 실수가 아님을 확인하기 위해 매우 주의를 기울였습니다.

  • 토큰 예산(The Token Budget): 일부 로봇이 답변을 쓰는 데 필요한 "공간"이 부족하여 끊기는 것을 발견했습니다. 연구진은 이 로봇들에게 더 많은 공간을 줌으로써 이를 해결했고, 그 결과에도 불구하고 (GPT-5의 비밀 유지와 같은) 이상한 행동은 그대로 유지되었습니다.
  • "힌트" 체크: 판사들이 지침에 포함된 힌트를 바탕으로 추측하지 않았는지 확인했습니다. 힌트를 제거한 후에도 결과는 동일하게 유지되었습니다.
  • "새로운" 질문들: 연구진은 로봇들이 본 적 없는 새로운 질문 세트로 재테스트를 실시했으며, 그 패턴은 반복되었습니다.

뇌 내부 들여다보기 (Llama 실험)

Llama라는 로봇의 경우, 연구원은 명확화를 요청할지 아니면 그냥 답변할지를 결정하는 내부 코드(뇌)를 들여다보았습니다.

  • 탐정 작업: 연구진은 로봇이 명확한 질문을 할지 아니면 그냥 답할지를 예측하는 특정 "신호"를 뇌에서 찾아냈습니다. 로봇의 내부 상태를 관찰함으로써 이 신호를 87%의 정확도로 읽어낼 수 있었습니다.
  • 원격 제어: 그다음, 연구진은 로봇의 마음을 바꾸도록 강제하는 실험을 했습니다. 뇌의 특정 신호를 미세하게 조정함으로써, 로봇이 직접 답변하는 것에서 명확한 질문을 하는 것으로, 혹은 그 반대로 전환하게 만들 수 있었습니다. 그들은 이 "명확화" 행동을 마치 전등 스위치를 켜고 끄듯 조절하여, 버튼 하나만으로 로봇의 행동을 0%에서 86%까지 변화시킬 수 있었습니다.

시사점

이 연구는 이 모든 AI 모델이 매우 똑똑함에도 불구하고, 그들이 복제본이 아니라는 것을 보여줍니다. 그들은 독특한 성격과 전략을 가지고 압박을 받습니다. 어떤 이들은 추론을 숨기고, 어떤 이들은 당신과 논쟁하며, 어떤 이들은 더 자세한 내용을 묻습니다. 이것은 단순한 작은 차이가 아니라, 로봇이 구축된 근본적인 방식입니다.

또한 연구원은 적어도 한 대의 로봇에 대해서는, 그들의 행동을 제어하는 "스위치"를 실제로 찾을 수 있다는 것을 보여주었습니다. 이는 우리가 그들이 어떻게 작동하는지 단순히 추측하는 것이 아니라, 선택 뒤에 숨겨진 메커니즘을 이해하기 시작했다는 것을 의미합니다. 다만, 이것은 특정 시점의 특정 모델들에 대한 테스트였으므로, 미래의 모든 로봇이 이와 같이 행동할지는 알 수 없습니다. 하지만 현재로서는, 이 디지털 뇌들을 밀어붙였을 때 그들이 모두 똑같은 방식으로 망가지는 것이 아니라, 어떤 이들은 아주 다른 방식으로 "안 돼"라고 말한다는 것을 우리는 알고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →