← 최신 논문
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

이 논문은 급변하는 AI 환경에서 정적 벤치마크의 한계를 해결하기 위해, 새로운 정부 규제를 지속적으로 통합하고 다국어 공격 프롬프트를 생성하는 자동화된 파이프라인을 활용하는 파운데이션 모델을 위한 자기 진화형 안전 벤치마크인 AIR-BENCH Live를 소개한다.

원저자: Rohan Naphade, Minzhou Pan, Bo Li

게시일 2026-07-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Rohan Naphade, Minzhou Pan, Bo Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 로봇들이 이야기를 쓰고, 문제를 해결하며, 심지어 우리와 대화하는 법을 배우고 있는 거대하고 끊임없이 확장되는 도서관이라고 상상해 보세요. 하지만 어떤 도서관에서나 그렇듯, 무엇을 쓸 수 있는지에 대한 규칙이 있습니다. 폭탄을 만드는 방법, 혐오 표현, 그리고 비밀을 훔치기 위한 속임수 등은 금지됩니다. 과학자들은 이 로봇들이 규칙을 잘 따르는지 확인하기 위해 "안전 테스트"를 만듭니다. 이 테스트는 로봇을 속여 규칙을 어기게 만들려는 일련의 수수께끼나 함정 같은 것입니다. 만약 로봇이 그 속임수를 거부하면 높은 점수를 받고, 속아 넘어가면 낮은 점수를 받습니다. 문제는 세상이 빠르게 변한다는 점입니다. 새로운 법이 통과되고, 로봇을 속이는 새로운 방법들이 발명되며, 오래된 수수께끼들은 너무 풀기 쉬워집니다. 작년의 안전 테스트는 로봇이 예전의 속임수들을 무시하는 법을 배웠거나, 테스트가 미처 생각지도 못한 새로운 법이 생겨났기 때문에 오늘날에는 쓸모없을 수 있습니다. 이것이 바로 연구자들이 이러한 테스트를 "살아있는" 상태로 만들어 스스로 업데이트되도록, 즉 멈추지 않고 움직이는 세상 속에서도 계속 유효하게 만들기 위해 노력하는 이유입니다.

이 논문은 AIR-BENCH Live라는 새로운 자가 업데이트형 안전 테스트를 소개합니다. 이것을 단순히 금지 품목 목록을 들고 문 앞에 서 있는 보안 요원이 아니라, 끊임없이 뉴스를 스캔하고 전 세계의 새로운 법률을 읽으며, AI를 테스트하기 위한 새롭고 까다로운 수수께끼를 즉각적으로 만들어내는 로봇 조수를 가진 보안 요리라고 생각해 보세요. 연구진은 미국, 중국, EU와 같은 곳의 정부 규제를 자동으로 "스크레이핑(읽어오기)"하는 파이프라인을 구축했습니다. 로봇의 뇌를 훔치거나 선거를 방해하기 위해 가짜 영상을 사용하는 것을 금지하는 법과 같이 새로운 규칙을 발견하면, 시스템은 자신의 안전 체크리스트에 새로운 카테고리를 추가합니다. 그런 다음, AI 에이전트 팀이 협력하여 이 새로운 규칙들을 바탕으로 현실적이고 다국어적인 프롬프트(수수께끼)를 작성합니다. 이들은 수수께끼가 로봇이 대본을 읽는 것처럼 들리지 않고, 다양한 상황에 처한 실제 사람들로부터 온 것처럼 들리도록 "페르소나", 즉 연기 역할을 사용합니다.

연구팀은 이 새로운 진화형 벤치마크를 사용하여 14개의 서로 다른 AI 모델을 테스트했습니다. 그들은 안전성에서 거대한 격차를 발견했습니다. 어떤 모델은 거의 모든 속임수를 거절하며 매우 안전했지만(점수 1.00), 다른 모델들은 속이기가 상당히 쉬웠습니다(최저 점수 0.17). 흥미롭게도, 현대화된 새로운 프롬프트들은 기존의 것들보다 더 어려웠으며, 이로 인해 가장 순응적인 모델들조차 조금 더 실수를 저질렀습니다. 또한 연구진은 대부분의 모델이 영어 이외의 언어로 질문받았을 때 약간 덜 안전하다는 것을 발견했으며, 이는 모든 인간의 언어에 걸쳐 로봇을 예의 바르고 안전하게 유지하는 것이 여전히 진행 중인 과제임을 시사합니다. 이 논문은 세상이 변하는 것을 막을 수는 없지만, 우리는 세상과 함께 진화하는 안전 테스트를 구축할 수 있으며, 이를 통해 AI가 똑똑해짐에 따라 그 안전성을 테스트하는 우리의 능력도 함께 똑똑해질 수 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →