← 최신 논문
🤖 machine learning

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

본 논문은 안전 분석에 사용되는 AI 도구를 분석하는 데 있어 발생하는 결정적인 공백을 해결하기 위해, 시스템 이론 기반 프로세스 분석(STPA)을 스스로에게 적용하여 거버넌스 헌법을 도출하고 강제함으로써, LLM 지원 분석기가 환각 현상 및 검증 불가능한 제약 조건에 대해 엄격하게 감사받도록 보장하는 자기 검증 프레임워크인 "Constitutional Meta-STPA"를 도입한다.

원저자: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

게시일 2026-07-10
📖 5 분 읽기🧠 심층 분석

원저자: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 다른 기계들의 안전 결함을 점검하는 임무를 맡은 초지능 로봇 조수를 만들었다고 상상해 보십시오. 이 로봇은 자동차의 부서진 기어를 찾아내거나 펌프의 누수되는 밸브를 찾아내는 데 매우 뛰어납니다. 하지만 문제는, 아무도 "로봇을 점검하는 사람은 누구인가?"라고 묻지 않았다는 점입니다.

이 논문은 바로 그 질문을 던집니다: 분석가를 분석하는 자는 누구인가?

저자들은 모든 사람이 이 AI 도구들이 작성하는 안전 보고서를 신뢰하고 있지만, 정작 도구 자체는 결함이 있을 수 있다는 사실을 깨달았습니다. 도구는 가짜 안전 규칙을 만들어내거나, 작업 기록을 남기는 것을 잊어버리거나, 실제로는 터무니없는 내용임에도 자신만만하게 답변할 수 있습니다. 이는 마치 단서를 전혀 기록하지 않고 때때로 증거를 조작하는 탐정을 고용한 것과 같습니다.

자기 점검 로봇

이를 해결하기 위해, 연구팀은 스스로에게 현미경을 들이대는 특별한 버전의 안전 도구를 구축했습니다. 그들은 STPA(안전 위험을 찾아내는 엄격한 방법)라는 방법을 사용하여 AI 도구 자체의 설계를 분석했습니다.

이것은 마치 자신의 뇌 지도를 그리고, 약점을 찾아낸 뒤, 그 발견을 바탕으로 자신만의 규칙집을 쓰는 로봇과 같습니다. 그들은 단순히 규칙을 추측한 것이 아니라, 도구 자체의 "자기 안전 분석"을 통해 규칙을 생성하도록 했습니다.

두 부분으로 구성된 규칙집

이 도구는 두 가지 뚜렷한 층위로 구성된 "헌법"(규칙집)을 갖게 되었습니다.

  1. "도구 원칙" (행동 계층): 이는 AI가 업무를 수행할 때 어떻게 행동해야 하는지에 대한 21가지 규칙입니다. 예를 들어, "안전 표준을 지어내지 말 것", "할 수 없는 부분에 대해 구체적으로 명시할 것", "항상 자신의 작업을 검토할 것" 등이 있습니다.
  2. "메타 안전 원칙" (거버넌스 계층): 이는 AI를 실행하는 기계가 어떻게 행동해야 하는지에 대한 8가지 규칙입니다. 여기에는 "모든 질문과 답변에 대한 영구적인 로그를 유지할 것", "작업 도중에 뇌(모델)의 버전이 바뀌지 않도록 특정 버전을 고정할 것", "엄격한 체크리스트를 통과하지 않으면 AI가 보고서를 내보내지 못하게 할 것" 등이 포함됩니다.

큰 놀라움: 마법이 아니라 근력이다

저자들은 서로 다른 AI 모델들에게 해당 도구 자체를 분석하도록 요청하여 이를 테스트했습니다. 결과는 다음과 같았습니다.

  • 강력한 모델들: 가장 진보된 AI 모델들(최상위 모델 두 개로 구성된 "프런티어 앙상블")을 사용했을 때, 도구는 자신의 설계를 살펴보는 것만으로 21개 중 18개의 행동 규칙과 8개 전체의 거버넌스 규칙을 성공적으로 찾아냈습니다.
  • 약한 모델들: 더 약하고 저렴한 모델들을 사용했을 때는 21개 중 12개의 행동 규칙과 8개 중 단 3개의 거버넌스 규칙만을 찾아냈습니다.

핵료 요점: 규칙 자체가 문제가 아니라, 분석을 수행하는 두뇌가 문제였습니다. "헌법"은 효과적이지만, 오직 AI가 스스로의 허점을 찾아낼 만큼 충분히 똑똑할 때만 유효합니다.

무엇이 실제로 AI를 더 안전하게 만드는가?

연구팀은 AI가 안전하지 않게 행동하거나 거짓말을 하도록 유도하는 까다로운 질문인 20개의 "적대적 프로브(adversarial probes)"로 까다로운 테스트를 진행했습니다. 그들은 다양한 버전의 규칙집을 가지고 AI를 테스트했습니다.

  • 규칙 없음: AI의 평균 안전 점수는 1.03이었습니다.
  • 일반적인 규칙: "도움이 되고 정직하라"는 일반적인 규칙 목록을 추가해도 전혀 도움이 되지 않았습니다 (점수: 1.05).
  • 21가지 도구 원칙: 구체적인 21가지 행동 규칙을 추가했을 때, 안전 점수는 1.85로 급증했습니다. 이는 79%의 개선이며, 통계적으로 매우 유의미한 승리였습니다.
  • 8가지 거버넌스 원칙: 8가지 거버넌스 규칙(로그 기록 및 버전 고정 등)을 추가했을 때는 이러한 특정 질문들에 대한 점수 변화가 없었습니다.

교훈: AI의 답변에서 실수를 막아주는 것은 바로 구체적인 행동 규칙(21가지 도구 원칙)이었습니다. 거버넌스 규칙(8가지 메타 안전 원칙)은 시스템(예: 감사 추적 유지)에는 필수적이지만, 그 자체로 AI의 텍스트 답변을 마법처럼 안전하게 만들지는 못했습니다.

"커버리지(Coverage)"에 대하여

저자들은 AI 안전 분야의 흔한 아이디어인 "단순히 AI가 더 많은 항목을 체크하게 하면 더 안전해질 것이다"라는 개념도 살펴보았습니다. 그들은 AI가 분석 과정에서 얼마나 많은 규칙을 "커버"했는지 측정했습니다.

그들은 흥미로운 사실을 발견했습니다: 프롬프트에 더 많은 규칙을 넣는다고 해서 항상 더 높은 안전 커버리지를 보장하는 것은 아니었습니다.

  • 표준 하드웨어 기계(예: 자동차 브레이크)에 대해 테스트했을 때, "메타 안전" 규칙(로그 및 버전에 관한 규칙)은 8개 중 0개를 기록했습니다. AI는 자동차에는 감사 로그가 없기 때문에 이를 언급하지 않았습니다.
  • 반면, AI가 자기 자신을 분석했을 때는 점수가 8개 중 6개로 뛰었습니다.

이는 "커버리지"가 마법처럼 돌릴 수 있는 다이얼이 아님을 입증했습니다. 그것은 탐지기입니다. 그것은 당신이 어떤 종류의 시스템을 보고 있는지 알려줍니다. 만약 AI가 감사 로그에 대해 이야기하고 있다면, 그것은 AI 도구를 분석하고 있는 것입니다. 만약 로그에 대해 침묵하고 있다면, 그것은 기계를 분석하고 있는 것입니다. 단순히 AI에게 "로그를 확인했다"라고 말하게 강요한다고 해서 더 안전해지는 것이 아닙니다. 로그는 실제로 존재해야 합니다.

"앗 하는 순간 (The 'Oops' Moment)"

저자들은 자신들이 저지른 실수에 대해서도 매우 솔직했습니다. 초기에 그들은 더 많은 규칙을 추가하면 AI가 더 많은 안전 문제를 선형적으로 더 많이 찾아낼 것이라고(마치 약의 용량처럼) 생각했습니다. 하지만 엄격하고 고정된 설정으로 다시 테스트를 실행했을 때, 그 "용량-반응(dose-response)" 개념은 사라졌습니다. 그들은 규칙을 추가할수록 발견되는 이슈의 수가 오히려 줄어들거나 평이하게 유지된다는 것을 발견했습니다. 그들은 이 "실패한" 결과까지 공개하며, 때로는 AI가 더 많은 문제를 찾는 것이 아니라 단지 더 집중하여 횡설수설을 멈추는 것뿐이라는 점을 보여주었습니다.

결론

이 논문은 AI 안전을 "해결했다"고 주장하는 것이 아닙니다. 대신 다음을 수행하는 도구를 구축했습니다:

  1. 자신의 설계를 분석함으로써 자신만의 규칙집을 작성합니다.
  2. 구체적인 행동 규칙(21가지 도구 원칙)이 AI의 답변을 훨씬 더 안전하게 만든다는 것을 증명합니다 (79% 향상).
  3. 일반적인 "착하게 행동하라"는 식의 규칙은 효과가 없음을 보여줍니다.
  4. 코드, 규칙집, 로그를 모두 공개하여 누구나 동일한 실험을 재현할 수 있게 합니다.

저자들은 결론적으로, 만약 당신이 AI 안전 도구를 만들고 있다면, AI의 환각 현상을 막기 위해 구체적인 행동 규칙이 필요하고, 기록을 남기기 위해 거버넌스 규칙이 필요하다고 말합니다. 하지만 그 이전에, 애초에 일을 수행할 수 있는 정말 똑똑한 AI 모델이 반드시 필요합니다. 유능한 두뇌가 없다면, 아무리 좋은 규칙집이라도 당신을 구원할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →