← 최신 논문
💻 computer science

How Should AI Safety Benchmarks Benchmark Safety?

이 논문은 210개의 AI 안전성 벤치마크를 검토하여 기술적 및 인식론적 결함을 식별하고, 더욱 타당하고 견고하며 책임 있는 안전 평가 프레임워크를 개발하기 위해 확립된 리스크 관리 및 측정 이론에 기반한 로드맵을 제안한다.

원저자: Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

게시일 2026-08-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 세대의 초지능 로봇들을 채점하려는 교사라고 상상해 보십시오. 당신은 이 로봇들이 세상 밖으로 나가도 안전할지, 아니면 실수로(혹은 의도적으로) 문제를 일으킬 수 있을지 알고 싶습니다. 이를 위해 당신은 운전면허 시험처럼 일련의 테스트를 제공합니다. 컴퓨터 과학의 세계에서 이러한 테스트를 "벤치마크(benchmarks)"라고 부릅니다. 벤치마크를 표준화된 장애물 경기라고 생각하십시오. 만약 로봇이 허들을 뛰어넘고, 퍼즐을 풀고, 함정을 피할 수 있다면, 우리는 그 로봇이 실제 세상에 나갈 준비가 되었다고 가정합니다. 하지만 여기 함정이 있습니다. 로봇이 당신이 만든 특정 허들을 잘 넘는다고 해서, 당신이 코스에 놓지 않은 바나나 껍질에 미끄러지지 않을 것이라거나, 지루하다는 이유로 불을 지르기로 결정하지 않을 것이라고 단정할 수는 없습니다. 이 논문은 AI 안전성을 테스트하는 방식의 복잡하고 혼란스러운 세계를 파고들며, 우리의 현재 "장애물 경기"가 너무 단순하고, 지나치게 경직되어 있으며, 때로는 실제 위험이 무엇인지에 대한 핵심을 완전히 놓치고 있다고 주장합니다.

이 논문의 저자들인 테크니컬 대학교 뮌헨(Technical University of Munich)과 코넬(Cornell) 같은 대학의 연구진은 AI 안전성 테스트의 현황을 거시적으로 살펴보기로 했습니다. 그들은 단순히 몇 개의 테스트를 훑어본 것이 아니라, 연구자들이 만들어낸 210개의 서로 다른 안전 벤치마크를 검토했습니다. 그들은 이 테스트들이 실제로 우리를 안전하게 지켜주고 있는지, 아니면 그저 우리에게 잘못된 안도감을 주고 있는 것인지 확인하고자 했습니다.

여기 큰 문제가 발견되었습니다: 대부분의 테스트가 엉뚱한 것을 보고 있다는 것입니다. 그들은 **81%**의 벤치마크가 "독성" 언어나 AI가 규칙을 어기도록 유도하는 간단한 속임수(이를 "탈옥(jailbreaks)"이라고 부름)와 같이 우리가 이미 알고 있고 경험했던 위험만을 점검하고 있다는 사실을 발견했습니다. 이는 자동차를 매끄럽고 직선적인 트랙에서만 테스트한 뒤, 그 자동차가 진흙투성이 산길에서도 잘 달릴 것이라고 가정하는 것과 같습니다. 이 테스트들은 AI가 저지를 수 있는 기괴하고 예측 불가능하며 완전히 새로운 방식의 오류, 즉 저자들이 "미지의 미지(unknown unknowns)"라고 부르는 문제들을 완전히 무시하고 있습니다.

나아가, 이 테스트들이 안전성을 측정하는 방식 또한 수학적으로 취약한 경우가 많습니다. 논문은 **79%**의 벤치마크가 안전을 단순한 "합격 또는 불합격" 스위치로 취급한다는 점을 지적합니다. 그들은 AI가 부적절한 요청을 얼마나 많이 거부했는지를 세고 이를 "안전 점수"라고 부릅니다. 하지만 저자들은 이것이 오해의 소지가 있다고 주장합니다. AI가 테스트에서 요청의 90%를 거부했다고 해서, 그것이 실제 세상에서도 90% 안전하다는 뜻은 아닙니다. 이는 마치 다리가 가벼운 미풍에도 잘 견뎠다고 해서, 허리케인을 견딜 수 있는지 확인하지 않은 채 다리가 안전하다고 말하는 것과 같습니다. 이 테스트들은 AI가 실패했을 때 발생할 해악의 '심각성'을 무시하며, 실제로 사람들이 얼마나 자주 그러한 위험한 요청을 하는지에 대해서도 고려하지 않습니다.

연구진은 또한 테스트와 현실 사이의 연결 고리가 자주 끊어져 있다는 것을 발견했습니다. 그들은 이를 "대리 관계의 사슬(proxy chain)"이라고 부릅니다. 예를 들어, 학생이 운전을 잘하는지 알고 싶어서 시뮬레이터로 주차 테스트를 한다고 가정해 봅시다. 이것이 대리 지표(proxy)입니다. 하지만 만약 그 시뮬레이터가 비가 오는 상황이나 다른 운전자들, 혹은 학생이 휴대폰에 한눈을 파는 상황을 반영하지 못한다면, 그 테스트 결과는 그 학생이 고속도로에서 정말 안전한지에 대해 알려주지 못합니다. 논문은 많은 AI 안전 테스트가 바로 그 시뮬레이터와 같다고 주장합니다. 즉, "거부율"이나 "키워드 매칭" 같은 것들을 측정하지만, 이러한 수치들이 실제 세상의 해악으로 반드시 이어지는 것은 아니라는 것입니다.

그렇다면 저자들은 대신 무엇을 해야 한다고 제안할까요? 그들은 깨진 테스트들을 고치기 위한 10가지 권고 사항이 담긴 새로운 로드맵을 제시합니다.

첫째, 이미 알고 있는 것만을 테스트하는 것을 멈춰야 합니다. 우리는 AI가 어떻게 새롭고 기괴하며 예상치 못한 방식으로 실패할 수 있는지를 적극적으로 찾아내는 테스트를 구축해야 합니다. 저자들은 고정된 질문 목록에만 매달리는 대신, 끊임없이 새로운 방식으로 AI를 망가뜨리려고 시도하는 도구들을 사용할 것을 제안합니다.

둘째, 더 나은 수학적 접근이 필요합니다. 단순히 "합격" 또는 "불합격"이라고 말하는 대신, 실제 위험을 계산해야 합니다. 이는 "이 나쁜 일이 일어날 확률은 얼마인가?"와 "만약 일어난다면 얼마나 심각할 것인가?"를 묻는 것을 의미합니다. 저자들은 원자력 발전이나 항공 분야에서 사용되는 "확률적 위험 평가(Probabilistic Risk Assessment)"라는 방법을 제안합니다. 그들은 모델이 테스트에서는 안전해 보일지라도, 실제 사용자 수와 위험한 요청이 발생하는 빈도를 고려하면 실제 위험이 훨씬 더 높을 수 있다는 계산법을 보여줍니다.

셋째, 우리의 테스트가 주장하는 바를 실제로 측정하고 있는지 확인해야 합니다. 이는 특정 상황에서 "안전"이 무엇을 의미하는지 매우 명확히 하고, 테스트가 깨끗하고 인위적인 실험실이 아닌 실제 세상을 반영하도록 만드는 것을 의미합니다. 또한 저자들은 십 대, 환자, 혹은 특정 지역 사회와 같이 AI의 영향을 받을 수 있는 사람들을 테스트 설계에 참여시켜야 한다고 주장합니다. 왜냐하면 그들이야말로 어떤 종류의 해악이 자신들에게 실질적인 위협이 되는지 가장 잘 알기 때문입니다.

이들의 아이디어가 효과가 있는지 증명하기 위해, 팀은 십 대들의 정신 건강에 관한 AI의 대화 방식에 초점을 맞춘 작은 예시 테스트를 구축했습니다. 그들은 단순히 AI가 규칙을 알고 있는지 묻는 데 그치지 않고, 실제 대화를 시뮬레이션했으며, 실제로 십 대들이 해당 도구를 얼마나 사용하는지를 바탕으로 잠재적 해악을 계산했습니다. 그 결과, 표준 테스트에서 "안전"해 보였던 모델들도 실제 세상의 수치를 적용했을 때는 여전히 상당한 문제를 일으킬 수 있음을 보여주었습니다.

결론적으로, 이 논문은 AI가 파멸할 운명이라거나 테스트할 수 없다는 말을 하는 것이 아닙니다. 현재의 테스트 방식이 마치 국물의 온도를 재는 데 자를 사용하는 것처럼, 작업에 적합하지 않은 도구를 쓰고 있다고 말하는 것입니다. AI를 진정으로 안전하게 지키기 위해서, 우리는 안전을 단순한 체크리스트로 취급하는 것을 멈추고, 변화하고, 우리를 놀라게 하며, 실험실이 아닌 실제 세상을 생각해야 하는 복잡하고 살아있는 시스템으로 취급해야 합니다. 저자들은 더 엄격하고 인간 중심적인 테스트 방식을 채택함으로써, 우리가 단순히 똑똑한 AI가 아니라 진정으로 모두에게 안전한 AI를 만들 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →