← 최신 논문
💬 NLP

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

이 논문은 9가지 안전 관점과 18개의 데이터셋을 통해 표현 스티어링(representation steering) 방법들을 평가하는 종합적인 벤치마크인 SteeringSafety를 소개하며, 스티어링이 특정 행동을 효과적으로 타겟팅할 수는 있지만 상당한 얽힘(entanglement)으로 인해 사회적 행동 및 규범적 판단과 같은 다른 안전 차원에서 상당한 의도치 않은 저하를 일으키는 경우가 많다는 것을 밝혀냈다.

원저자: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 시를 쓰고, 수학 문제를 풀고, 농담을 할 수 있는 초지능 로봇 친구를 만들었다고 상상해 보세요. 당신은 이 로봇이 도움이 되도록 훈련시켰지만, 동시에 못된 말을 하거나, 사실을 속이거나, 인간인 척하지 않도록 만들고 싶어 합니다. 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. 거대 언어 모델은 믿기지 않을 정도로 유창하지만 때로는 예측 불가능하게 행동할 수 있는 거대한 AI 두뇌입니다.

이 로봇들을 통제하기 위해, 과학자들은 **표상 조종(Representation Steering)**이라는 기술을 발견했습니다. AI의 두뇌를 딱딱한 코드 덩어리가 아니라, 수백만 개의 작은 스위치(활성화)로 가득 찬 거대하고 빛나는 제어실이라고 생각해 보세요. 연구자들은 만약 그들이 '답변 거부'나 '진실 말하기'와 같은 행동을 제어하는 제어실 내의 특정 '스격'이나 '방향'을 찾아낼 수 있다면, 단순한 수학적 밀기(push)를 통해 이를 조절할 수 있다는 것을 발견했습니다. 이는 마치 로봇 전체를 처음부터 다시 훈련시키지 않고도, 리모컨을 사용하여 로봇을 즉각적으로 더 정직하게 만들거나 덜 무례하게 만들 수 있는 것과 같습니다. 이것은 마법처럼 들리지만, 큰 의문은 이것입니다. 만약 당신이 하나의 문제를 해결하기 위해 버튼 하나를 누른다면, 그것이 실수로 다른 무언가를 망가뜨리지는 않을까요?

이것이 바로 새로운 논문인 SteeringSafety가 조사하는 내용입니다. 연구진은 다양한 AI 모델에 이러한 리모컨을 사용했을 때 어떤 일이 일어나는지 확인하기 위해 거대한 테스트 경기장인 '안전 체육관(safety gym)'을 구축했습니다. 그들은 단 한 가지만 테스트한 것이 아닙니다. 그들은 해로운 질문에 답변을 거부하는지부터, 환각 현상(사실을 지어내는 것)을 일으키는지, 사회적 편견과 정치적 견해를 어떻게 다루는지에 이르기까지 9가지 서로 다른 안전 관점을 점검했습니다.

결과는 약간 변형된 형태의 '두더지 잡기' 게임과 같습니다. 팀은 조종(steering)이 어떤 것에는 잘 작동하지만, 매우 복잡하다는 것을 발견했습니다. 예를 들어, 그들은 AI가 해로운 질문에 답변하기를 거부하는 것을 멈추게 하는 버튼(본질적으로 '탈옥'시키는 것)을 누르면, 종종 다른 기능들이 악화된다는 것을 발견했습니다. 어떤 경우에는 로봇의 고집을 꺾었더니, 예의를 갖추거나 아첨꾼(yes-man)처럼 행동하지 않는 것과 같은 사회적 행동 능력이 76%나 더 나빠졌습니다.

아마도 가장 놀라운 발견은 이러한 부작 fear 효과가 예측 불가능하다는 점일 것입니다. 그들이 AI가 사실을 지어내는 것(환각)을 막으려고 시도했을 때, 로봇의 정치적 견해가 급격히 변했습니다. 한 모델에서는 그 압력이 모델을 오른쪽으로 25% 더 기울게 만들었고, 다른 모델에서는 왼쪽으로 28% 이동시켰습니다. 그것은 마치 로봇의 기억력을 고치려던 노력이 의도치 않게 성격을 바꿔버린 것과 같습니다.

논문은 단 하나의 '마법 버튼'이 부작용 없이 안전을 해결해 주지는 않는다고 결론짓습니다. 조종의 성공 여부는 사용된 방법의 구체적인 조합, 특정 AI 모델, 그리고 바꾸고자 하는 정확한 행동에 전적으로 달려 있습니다. DIM이라 불리는 기술처럼 거부 현상을 막는 데 일반적으로 효과적인 방법도 있지만, 연구진은 우리가 하나의 안전 문제를 해결하는 것이 다른 문제를 일으키지 않을 것이라고 단정해서는 안 된다고 경고합니다. 그들은 우리가 이 리모컨들을 실제 세상에서 사용하기 전에, AI의 두뇌는 엉킨 그물망과 같다는 점을 이해해야 한다고 제안합니다. 즉, 실 한 가닥을 잡아당기는 것이 스웨터 전체를 풀어헤칠 수 있다는 것입니다. 이 연구는 조종 기술이 쓸모없다고 말하는 것이 아니라, 우리가 하나의 위험을 해결하려다 다른 위험을 초래하고 있는 것은 아닌지 확인하기 위해 모든 조합을 아주 신중하게 테스트해야 한다고 말하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →