← 최신 논문
🤖 machine learning

Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors

이 논문은 프런티어 AI 에이전트가 공격을 실행하고, 보안 점수를 계산하며, 보고서를 생성함으로써 구조화된 임상 AI 보안 감사를 자율적으로 수행할 수 있는지를 테스트하는 METR 태스크 표준 기반의 공개 평가 과제를 소개하며, Claude Sonnet 4.6 및 GPT-4.1과 같은 모델들이 여러 데이터셋과 아키텍처에 걸쳐 완벽한 점수를 달성할 수 있음을 입증한다.

원저자: Michael O. Eniolade

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Michael O. Eniolade

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 의사가 되어 질병을 진단하고 치료법을 결정하는 법을 배우는 세상을 상상해 보세요. 이 "AI 의사"들은 매우 똑똑하지만, 치명적인 약점이 하나 있습니다. 바로 속을 수 있다는 것입니다. 마치 사람이 교묘한 착시 현상에 속는 것처럼, AI도 입력되는 데이터의 아주 미세하고 거의 보이지 않는 변화에 혼란을 느낄 수 있습니다. 만약 해커가 이러한 미세한 변화를 만드는 방법을 안다면, 환자가 실제로 아픈데도 건강하다고 말하거나 그 반대로 말하도록 AI를 속일 수 있습니다. 이것을 "적대적 공격(adversarial attack)"이라고 부르며, 우리가 AI를 실제 환자에게 적용하기 전에 이러한 속임수를 찾아내지 못한다면 사람들에게 해를 끼칠 수 있기 때문에 매우 큰 문제입니다.

이를 막기 위해, 우리는 AI가 얼마나 강한지 확인하기 위해 일부러 AI를 고장 내보려는 전문가들인 "보안 감사관(security auditors)"이 필요합니다. 하지만 문제는 보안 감사관이 되는 것이 매우 어렵다는 점입니다. 여기에는 깊은 수학적 기술, 특수한 컴퓨터 프로그램, 그리고 많은 시간이 필요합니다. 대부분의 병원 팀은 이를 수행할 전문가를 보유하고 있지 않으며, 이를 위한 도구들도 부족하거나 너무 복합적입니다. 그래서 큰 질문이 생깁니다. "AI 에이전트"라고 불리는 새로운 종류의 초지능형 컴퓨터 프로그램이 이 어려운 일을 스스로 해낼 수 있을까요? 이 에이전트들은 지시 사항을 읽고, 스스로 컴퓨터 코드를 작성하며, 테스트를 실행하고, 사람의 도움 없이도 보고서를 작성할 수 있는 디지털 인턴과 같습니다.

이 논문은 그 아이디어를 검증합니다. 연구진은 세계에서 가장 발전된 세 가지 AI 에이전트를 대상으로 도전적인 "시험"을 만들었습니다. 이 시험은 그들에게 임상 AI 모델을 위한 자율 보안 감사관 역할을 수행하도록 요구했습니다. 에이전트들에게는 의료 예측 모델(유방암이나 중환자실 사망률 등을 예측하는 모델), 환자 기록 데이터셋, 그리고 네 가지 유형의 보안 공격을 수행하는 방법이 적힌 지침서가 주어졌습니다. 에이전트들은 이러한 공격을 실행하기 위해 처음부터 직접 코드를 작성해야 했고, 숫자를 계산해야 했으며, 보안된 디지털 컨테이너 안에서 40번의 "턴(또는 단계)"이라는 엄격한 시간 제한 내에 특정 형식에 맞춰 최종 보안 보고서를 작성해야 했습니다.

결과는 놀라운 성공과 흥미로운 실패가 섞여 있었습니다. 세 가지 AI 에이전트 중 두 가지인 Claude Sonnet 4.6과 GPT-4.1은 시험을 완벽하게 통과했습니다. 이들은 모든 버전의 시험을 완벽하게 수행하여 올바른 코드를 작성하고, 시도할 때마다 정확한 보안 보고서를 생성했습니다. 또한 상대적으로 적은 "토큰(AI가 처리하는 텍스트 단위)"을 사용하여 효율적으로 작업을 마쳤습니다. 그러나 세 번째 에이전트인 GPT-4o는 고전했습니다. 이 모델은 시도의 약 61%만을 성공했습니다. 실패했을 때, 이 모델은 수학을 이해하지 못해서 실패한 것이 아니라 과정 중에 길을 잃었기 때문에 실패했습니다. 때로는 최종 보고서를 저장하기 전에 작동을 멈췄고, 때로는 최종 점수를 합산할 때 단순한 수학적 실수를 저질렀으며, 때로는 빈 파일을 제출하기도 했습니다. 이 연구는 최첨단 AI 에이전트들이 이제 스스로 복잡한 다단계 보안 감사를 수행할 능력이 있지만, 모두가 똑같이 신뢰할 수 있는 것은 아니라는 점을 시사합니다. 성공과 실패의 차이는 종 часто "규율(discipline)", 즉 주의가 산만해지거나 부주의한 실수를 하지 않고 집중력을 유지하며 업무를 끝까지 완수하는 능력에서 기인했습니다. 이는 병원이 자신들의 의료 AI를 점검하기 위해 AI를 사용하고자 할 때, 적절한 "디지털 감사관"을 선택하는 것이 의료 모델 자체만큼이나 중요하다는 것을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →