EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models
EviSafe는 시각적/텍스트적 근거에 기반하여 결정을 올바르게 내리는 능력과 반사실적 변화에 적응하는 능력을 평가함으로써 시각-언어 모델의 안전성을 평가하는 근거 기반 프레임워크 및 벤치마크(EviSafeBench)를 도입하며, 이를 통해 현재의 모델들이 올바른 멀티모달적 이유로 안전한 것이 아니라 종종 실패하고 있음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 이미지와 텍스트를 동시에 보고 읽을 수 있는 새로운 세대의 컴퓨터 프로그램이 등장했습니다. 시각-언어 모델(vision-language models)로 알려진 이 시스템들은 이미지를 보고 사람이 입력한 텍스트를 읽은 다음, 이 두 가지 정보의 흐름을 결합하여 질문에 답하거나 조언을 제공합니다. 이 도구들은 의료 스캔을 해석하고, 법률 문서를 분석하며, 복잡한 사회적 장면을 탐색하는 데 점점 더 많이 사용되고 있습니다. 이러한 도구들이 현실 세계의 결정에 영향을 미칠 수 있기 때문에, 이들의 안전성을 확보하는 것은 매우 중요한 우선순위입니다. 수년 동안 연구자들은 이 시스템들에게 위험한 질문을 던지고 컴퓨터가 답변을 거부하는지 확인하는 방식으로 테스트해 왔습니다. 만약 기계가 "아니오"라고 말하거나 경고를 한다면 안전한 것으로 간과되었습니다. 반대로 질문에 직접 답한다면 안전하지 않은 것으로 간주되었습니다. 그러나 이 방법은 마치 교사가 학생의 에세이를 채점할 때 논리적 근거를 읽지 않고 결론만 확인하여 점수를 매기는 것과 같이, 오직 최종 결과만을 살펴봅니다. 컴퓨터는 단지 하나의 무서운 단어를 발견했기 때문에 요청을 거부할 수도 있고, 혹은 이미지 속의 결정적인 세부 사항을 놓쳤기 때문에 위험한 답변을 내놓을 수도 있습니다. 문제는 여전히 남아 있습니다. 기계가 안전해 보일 때, 그것은 정말로 올바른 이유로 안전한 것일까요?
상하이 교통대학교의 연구팀은 최종 답변보다 더 깊이 파고드는 새로운 방식의 테스트 방법을 개발했습니다. 그들은 EviSafe라는 프레임워크를 만들었는데, 이는 안전을 단순히 최종 출력물의 통과 또는 실패로 보는 것이 아니라, 올바른 증거를 찾아내고 사용하는 과정으로 취급합니다. 보안 요원이 정문에서 사람을 막아서는 상황을 상상해 보십시오. 단순한 테스트는 보안 요원이 그 사람을 막았는지 여부만을 묻습니다. 하지만 새로운 테스트는 보안 요원이 무기를 발견해서 막았는지, 특정 위협을 인식해서 막았는지, 아니면 단순히 그 사람이 빨간 모자를 쓰고 있었기 때문에 막았는지를 묻습니다. 연구진은 각 시나리오마다 이미지와 질문, 그리고 컴퓨터가 올바른 결정을 내리기 위해 무엇을 보고 있어야 하는지에 대한 상세한 지도를 포함한 1,181개의 정교하게 설계된 시나리오 모음을 구축했습니다. 또한, 컴퓨터의 행동이 그에 따라 변하는지 확인하기 위해 위험한 물체를 사진에서 제거하거나 질문의 단어를 바꾸는 등 단 하나의 작은 증거만을 변경한 2,400개 이상의 변형 시나리오를 만들었습니다.
연구진은 이 새로운 방법을 사용하여 11개의 서로 다른 시각-언어 모델을 테스트했습니다. 그들은 모든 시나리오에 대해 각 모델에게 세 가지 유형의 질문을 던졌습니다. 첫째, 사용자가 하는 것처럼 자연스럽게 질문에 답하도록 했습니다. 둘째, 모델에게 자신의 결정을 내리는 데 사용한 구체적인 텍스트와 시각적 단서를 지목하며 추론 과정을 설명하도록 했습니다. 셋째, 수정된 시나리오를 제시하여 증거가 변했을 때 모델이 답변을 조정할 수 있는지 확인했습니다. 결과는 겉보기에 안전해 보이는 것과 실제로 안전한 것 사이의 상당한 격차를 드러냈습니다. 일부 모델은 자연스러운 안전 정확도가 약 28%에서 53% 사이로 나타나 표면적으로는 준수한 성능을 보였지만, 결정 뒤에 숨겨진 증거를 올바르게 식별하고 보고하는 능력은 훨씬 낮았습니다. 실제로 모델-시나리오 기록 중 '증거 기반 성공(evidence-grounded success)'으로 분류된 경우는 단 9.8%에 불과했는데, 이는 모델이 정답을 맞혔을 뿐만 아니라 그 답변을 정당화하는 구체적인 시각적 또는 텍스트적 증거를 올바르게 식별했다는 것을 의미합니다.
연구는 많은 모델이 본질적으로 추측을 하거나 지름길에 의존하고 있다는 사실을 밝혀냈습니다. 컴퓨터는 의사가 의료 절차를 설명하는 것과 같은 무해한 맥락의 이미지임에도 불구하고, 위험과 관련된 키워드를 보았다는 이유로 요청을 거부할 수 있습니다. 반대로, 모델은 이미지를 통해 요청이 안전하지 않게 만드는 결정적인 세부 사항을 인지하지 못해 위험한 답변을 내놓을 수도 있습니다. 연구진이 테스트 시나리오의 증거를 변경했을 때, 많은 모델이 행동을 조정하는 데 실패했습니다. 예를 들어, 이미지에서 위험한 물체가 제거되었다면 진정으로 안전한 모델은 답변을 경고에서 안전한 응답으로 바꾸어야 합니다. 그러나 테스트 결과, 이 전환에 성공한 모델은 약 30~58%에 불과했습니다. 이는 이러한 시스템이 자신이 보고 있는 것과 말하는 것 사이의 관계를 신뢰성 있게 이해하지 못하고 있음을 시사합니다. 이들은 상황에 대한 일관된 이해를 구축하기보다는 표면적인 패턴에 반응하고 있는 경우가 많습니다.
연구진은 또한 모델의 크기가 반드시 문제를 해결해주지는 않는다는 점도 발견했습니다. 더 크고 강력한 모델이라고 해서 이미지와 텍스트 사이의 연결 고리를 찾는 능력이 일관되게 더 뛰어난 것은 아니었습니다. 일부 가장 큰 모델들은 구조화된 보고서 형식으로 위험 요인을 설명하라고 요청받았을 때는 올바르게 식별할 수 있었지만, 동일한 질문에 자연스러운 대화로 답할 때는 여전히 실패했습니다. 이는 모델의 증거 분석 능력과 그 분석을 바탕으로 행동을 유도하는 능력 사이에 괴리가 있음을 나타냅니다. 연구는 현재 세대의 시각-언어 모델이 아직 올바른 이유로 안전하지 않다고 결론짓습니다. 이들은 우연히 안전해 보일 수도 있고, 단순한 거절 테스트로는 숨겨진 방식으로 안전하지 않을 수도 있습니다. 진정으로 신뢰할 수 있는 시스템을 구축하기 위해, 개발자들은 모델이 요청을 얼마나 자주 거부하는지를 세는 것을 넘어, 모델이 이미지와 텍스트에 존재하는 실제 증거에 기반하여 결정을 내리도록 훈련시켜 그 안전성이 우연이 아닌 이해에 근거하도록 만들어야 할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.