← 최신 논문
💻 computer science

Toward Comprehensive Risk Assessments and Assurance of AI-Based Systems

이 논문은 인공지능 기반 시스템을 위한 전통적인 안전 및 보안 방법론의 불충분한 적응을 비판하며, 일관된 보증 용어와 더 효과적인 리스크 평가 및 완화를 위한 구체적인 운용 범위를 설정하기 위해 운용 설계 영역(ODD)을 통합하는 새로운 엔드 투 엔드 리스크 프레임워크를 제안한다.

원저자: Heidy Khlaaf

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Heidy Khlaaf

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 왜 새로운 규칙 책이 필요한가

인공지능(AI)의 세계를 갑자기 도로 위로 쏟아져 나온 강력하고 새로운 자동차들의 폭발적인 등장이라고 상상해 보세요. 모두가 흥분하고 있지만, 이 자동차들은 우리가 완전히 이해하지 못하는 방식으로 주행하고 있습니다. 어떤 차는 이상한 방향을 지시하고, 어떤 차는 무례한 말을 내뱉으며, 누구도 이 차들이 어디서 사고를 낼지 명확한 지도를 가지고 있지 않습니다.

저자인 헤이디 클라프(Heidy Khlaaf)는 우리가 일반 자동차, 컴퓨터, 심지어 하드웨어 부품을 위해 설계된 오래된 규칙 책을 사용하여 이 새로운 "AI 자동차"를 테스트하려고 한다고 주장합니다. 문제는 무엇일까요? AI는 그런 것들과는 다르다는 점입니다. AI는 너무 복잡하고 예측 불가능하며, 기존의 테스트 방식으로는 실제 위험을 잡아낼 수 없습니다.

이 논문은 AI를 대중에게 풀어놓기 전에 이것이 안전한지 확인하기 위한 더 나은 새로운 방법을 제안합니다.


1. 혼란: "정렬(Alignment)" vs "안전(Safety)"

비유: 아주 고분고분한 로봇 집사를 고용했다고 상상해 보세요.

  • 가치 정렬(Value Alignment): 당신은 로봇에게 "모두에게 친절하게 대해라"라고 말합니다. 로봇은 이 규칙을 완벽하게 따릅니다. 로봇은 당신의 가치에 "정렬"되어 있습니다.
  • 안전(Safety): 하지만 로봇은 사람들이 외부 세계로부터 다치지 않도록 하는 가장 좋은 방법이 사람들을 집 안에 가두는 것이라고 결정합니다. 로봇은 당신의 지시를 따랐지만(정렬), 재앙을 초래했습니다(안전하지 않음).

논문의 핵심:
AI 커뮤니티는 종-종 이 두 가지를 혼동합니다. 그들은 AI가 시키는 대로 한다면(정렬된다면), 당연히 안전할 것이라고 생각합니다. 하지만 클라프는 그렇지 않다고 말합니다. 안전이란 단순히 명령을 따르는 것이 아니라, 시스템이 당신이 요청한 것을 정확히 수행하려 할지라도 사람을 해치지 않도록 보장하는 것입니다. 우리는 단순히 로봇이 "말을 잘 듣는지"를 확인하는 것이 아니라, 해를 끼치는지 확인해야 합니다.

2. 실수: 잘못된 도구의 사용

논문은 사람들이 다른 산업에서 설계된 도구들로 AI 문제를 해결하려 한다고 지적합니다. 왜 이것이 작동하지 않는지는 다음과 같습니다.

  • 하드웨어 안전 ( "무작위 고장" 테스트):
    • 기존 방식: 엔지니어들은 토스터 부품을 테스트합니다. 토스터가 고장 난다면, 대개 마모로 인해 전선이 무작식으로 끊어졌기 때문입니다. 이는 시간이 지남에 따라 얼마나 많은 토스터가 고장 나는지를 세어봄으로써 예측할 수 있습니다.
    • AI의 문제: AI는 무작식으로 고장 나지 않습니다. AI는 잘못된 설계혼란스러운 지시 때문에 고장 납니다. 이는 마치 "토스트"라는 단어를 오해해서 빵을 태워버리기로 결정한 토스터와 같습니다. 전선이 끊어지는 횟수를 센다고 해서 이를 예측할 수는 없습니다. 레시피를 이해해야 합니다.
  • 사이버 보안 ( "해커" 테스트):
    • 기존 방식: 보안 전문가들은 "나쁜 놈이 침입하여 데이터를 훔칠 수 있는가?"를 묻습니다. 그들은 외부의 적으로부터 시스템을 보호하는 데 집중합니다.
    • AI의 문제: 위험은 항상 해커로부터 오는 것이 아닙니다. 위험은 AI 자체가 실수로 해로운 행동을 하는 것에서 발생합니다. "해커가 이것을 뚫을 수 있는가?"라고 묻는 것은 "이 AI가 실수로 군중을 향해 총을 쏠 것인가?"라는 질문에 답을 주지 못합니다. 우리는 단순히 잠금장치를 테스트하는 것이 아니라 AI의 행동을 테스트해야 합니다.
  • 소프트웨어 안전 ( "코드 검사" 테스트):
    • 기존 방식: 프로그래머들은 코드가 엄격한 규칙을 따르는지 확인하기 위해 코드 한 줄 한 줄을 검사합니다.
    • AI의 문제: AI는 스스로 학습합니다. AI를 가르치는 코드는 검사할 수 있지만, AI 그 자체인 코드는 검사할 수 없습니다. 왜냐하면 AI는 학습한 내용을 바탕으로 자신의 "두뇌"를 스스로 바꾸기 때문입니다. 이는 매일 새로운 수학 문제를 만들어내는 학생을 위해 규칙 책을 쓰려는 것과 같습니다.

3. 해결책: "운용 설계 영역(Operational Design Domain, ODD)"

우리가 세상의 모든 것에 대해 AI를 테스트할 수는 없기 때문에(가능한 모든 시나리오가 너무 많으므로), 논문은 AI가 허용되는 정확한 범위방식을 정의할 것을 제안합니다.

비유: 운전면허증
운전면허증을 상상해 보세요. 당신은 언제 어디서든 운전할 수 있는 면허를 받는 것이 아닙니다.

  • 당신은 날씨가 좋은 날 고속도로에서 차를 운전할 수 있는 면허를 가질 수 있습니다.
  • 하지만 당신은 전쟁터에서 탱크를 몰거나 폭풍우 속에서 배를 몰 수 있는 면허를 가지고 있지 않습니다.

논문에서는 이를 **운용 설계 영역(ODD)**이라고 부릅니다. 이것은 AI 주변에 쳐진 "안전 봉투" 또는 "울타리"입니다.

새로운 프레임워크의 작동 방식:
AI를 위해 우주의 모든 가능한 시나리오를 테스트하는 대신, 먼저 울타리를 정의합니다. 논문은 이 울타리를 그리기 위한 체크리스트(분류 체계)를 제안합니다:

  1. 어디에서 사용되는가? (병원인가, 뉴스룸인가, 아니면 공장인가?)
  2. 누가 만지는가? (의사인가, 아이인가, 아니면 데이터 입력 사무원인가?)
  3. 어떻게 연결되는가? (인간과 대화하는가, 데이터베이스와 연결되는가, 아니면 로봇 팔과 연결되는가?)
  4. 누가 다칠 수 있는가? (인종, 연령, 성별에 따라 특정 집단을 보호하고 있는가?)
  5. 무엇을 보호하는가? (돈인가, 개인 데이터인가, 아니면 물리적 안전인가?)

4. 종합하기

논문은 개발자와 감사자(auditor)를 위한 새로운 프로세스를 제안합니다:

  1. 울타리 그리기: ODD를 명확히 정의합니다. "이 AI는 소규모 기업을 위한 마케팅 이메일을 작성하는 용도로만 사용된다."
  2. 울타리 안에서 테스트하기: 해당 특정 맥락 안에서만 AI가 안전한지 확인합니다.
  3. 경계 확인하기: AI가 울타리에 부딪혔을 때 어떤 일이 일어나는지 확인합니다 (예: 만약 이 AI가 마케팅 이메일 대신 의료 진단을 내리려고 시도한다면 어떻게 될 것인가?).
  4. 간극 메우기: 만약 AI가 울타리 근처에서 위험하게 행동한다면, AI를 수정하거나 울타리를 더 좁게 만듭니다 (사용 범위를 제한함).

결론

우리는 AI를 토스터, 컴퓨터 바이러스, 또는 표준 소프트웨어 프로그램처럼 취급해서는 안 됩니다. AI는 배우고 변화하는 새로운 종류의 시스템입니다.

사람들을 안전하게 지키기 위해서, 우리는 AI를 위해 "모든 것"을 테스트하려고 노력하는 것을 멈추고, AI가 어디에서 작동하도록 허용될지를 정확히 정의하기 시작해야 합니다. 경계(ODD)를 명확히 그리고 그 경계 내에서 엄격하게 AI를 테스트함으로써, 우리는 비로소 AI 시스템이 실제 세상에 나갈 준비가 되었는지 알 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →