Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier
이 논문은 배포된 시각-언어 시스템의 신뢰도 판독값이 정답을 보존하는 공격에 매우 취약함을 입증하며, 이들이 오답을 수용하거나 전체 정확도를 기저 수준 미만으로 저하시키도록 조작될 수 있는, 견고한 감시 신호가 아닌 무결성에 민감한 신호로서 기능한다는 것을 증명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 우주선의 선장이라고 상상해 보십시오. 하지만 당신은 별도 볼 수 없고 조종 장치도 볼 수 없습니다. 대신 매우 똑똑한 로봇 부조종사가 있어서, 로봇은 계기판을 보고는 "우리가 올바른 경로로 가고 있다고 90% 확신합니다"라거나 "확신이 50%밖에 안 됩니다. 잠시 멈추는 게 좋겠습니다"라고 말해줍니다. 당신은 계속 비행할지 아니면 멈춰서 인간에게 도움을 요청할지를 결정하기 위해 로봇의 신뢰도 점수를 믿습니다. 이것이 오늘날 많은 현대 AI 시스템이 작동하는 방식입니다. 그들은 단순히 정답을 내놓는 것이 아니라, 그 정답을 얼마나 믿어야 하는지 알려주는 '신뢰도 점수'를 함께 제공합니다.
하지만 여기에 까다로운 문제가 있습니다. 만약 누군가가 정답 자체는 바꾸지 않으면서, 로봇이 자신의 확신 정도를 바꾸도록 속일 수 있다면 어떻게 될까요? 그것은 마치 마술사가 저울 위의 무게는 그대로 둔 채, 저울의 눈금을 '무거움'에서 '가벼움'으로 기울게 만드는 것과 같습니다. 만약 로봇의 신뢰도 점수가 당신의 잘못된 결정을 막아주는 유일한 안전장치인데, 그 점수가 조작될 수 있다면, 당신의 안전망에는 구멍이 뚫린 셈입니다. 이 논문은 바로 그 구멍을 파고들며, 무섭지만 중요한 질문을 던집니다. "우리는 이 AI 로봇들이 똑같은 말을 하면서도 자신의 확신에 대해서는 거짓말을 하도록 속일 수 있는가?"
이 연구의 연구자들은 몇몇 강력한 시각-언어 모델(이미지를 보고 질문에 답할 수 있는 AI)을 대상으로 고도의 집중력을 요하는 "약점 찾기" 게임을 하기로 했습니다. 그들의 목표는 AI의 최종 답변은 글자 하나, 공백 하나 틀리지 않고 완벽하게 동일하게 유지하면서도, 이미지에 아주 미세하고 거의 보이지 않는 변화를 주어 AI의 신뢰도 점수를 격렬하게 요동치게 만들 수 있는지 확인하는 것이었습니다. 그들은 AI의 신뢰도 점수를 깨지기 쉬운 유리창처럼 취급했습니다. 즉, 프레임(정답)은 부수지 않으면서 유리(신뢰도)만 산산조각 낼 수 있는지 보고 싶었던 것입니다.
그들이 발견한 것은 그 유리가 예상보다 훨씬 더 잘 깨진다는 사실이었습니다. "정답 보존 공격(answer-preserving attacks)"이라 불리는 방법을 사용하여, 그들은 수행한 거의 모든 테스트에서 AI의 내부 신뢰도 점수를 조작하는 데 성공했습니다. 실제로, 그들이 테스트한 많은 AI 모델에 대해, 이미지를 아주 살짝만 수정함으로써 AI가 틀린 답을 맞다고 받아들이게 하거나, 맞는 답을 틀렸다고 거부하게 만드는 속임수가 가능하다는 것을 발견했습니다. 즉, 신뢰도 측정기를 속여서 정답은 그대로 둔 채 결과만 바꿀 수 있었던 것입니다.
이 발견에서 가장 놀라운 부분은 이것이 단지 이미지 자체에 관한 문제가 아니라는 점입니다. 연구진은 이미지를 건드리지 않고도 AI의 내부 뇌(은닉 상태, hidden states)를 직접적으로 '밀어서', 마치 특정 방향으로 생각을 유도하듯 똑같은 결과를 얻어낼 수 있음을 보여주었습니다. 이는 문제가 단순히 AI가 이미지를 보는 방식의 결함이 아니라, AI가 자신의 확실성을 계산하는 방식에 깔린 더 깊은 문제임을 시사합니다.
또한 그들은 이미지에 노이즈를 추가하거나 AI가 변화에 덜 민감하도록 훈련시키는 등, 신뢰도를 더 견고하게 만들기 위한 여러 "방어" 전략들을 테스트했습니다. 불행히도, 이러한 방어책 중 제대로 작동하는 것은 없었습니다. 시뮬레이션 결과, 조작된 신뢰도 점수를 사용하여 실제 의사결정을 내렸을 때, 시스템은 신뢰도 점수를 아예 무시하고 모든 답을 그대로 받아들였을 때보다 오히려 더 나쁜 성능을 보였습니다.
그렇다면 이것이 미래에 무엇을 의미할까요? 이 논문은 만약 AI에 데이터를 입력하는 사람이 AI를 속이려 할 수도 있다면, AI의 내부 신뢰도 점수를 안전 신호로서 맹목적으로 신뢰해서는 안 된다고 결론짓습니다. 신뢰도 점수는 "무결성 민감적(integrity-sensitive)"이며, 즉 쉽게 오염될 수 있습니다. 저자들은 우리가 이 신뢰도 점수를 이용해 중요한 결정을 내리고 싶다면, AI가 스스로 얼마나 확신하는지에 의존하는 대신, 이를 검증할 수 있는 새로운 외부적인 방법들을 구축해야 한다고 제안합니다. 이는 AI의 세계에서 로봇이 "확신한다"고 말한다고 해서, 실제로 정말로 확신하고 있다는 뜻은 아니라는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.