← 최신 논문
🤖 AI

The AI Evaluability Gap: The Missing Layer for Managing Risk and Sustaining Value

이 논문은 현재의 AI 거버넌스에서 위험과 가치에 대한 고신뢰도 의사결정을 뒷받침할 충분한 증거의 부족을 의미하는 'AI 평가 가능성 격차(AI Evaluability Gap)'를 결정적인 결함으로 식별하고, 지속 가능한 AI 관리를 보장하기 위해 증거의 6가지 속성을 바탕으로 운영 및 투자 인증을 구분하는 '평가 가능성(Evaluability)' 중심의 새로운 프레임워크를 제안한다.

원저자: Vishal Srivastava, Tanmay Sah

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vishal Srivastava, Tanmay Sah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 문제: "눈먼 조종사"

한 회사가 비행기를 조종할 새로운 조종사(AI 시스템)를 고용했다고 상상해 보세요. 회사는 두 가지 큰 질문에 직면합니다.

  1. 이 비행기는 지금 당장 날아도 충분히 안전한가? (리스크 관리)
  2. 이 비행을 위해 연료와 승무원 비용을 들일 가치가 있는가? (가치 관리)

현재 대부분의 기업은 비행기의 대시보드를 보고 이 질문들에 답하려 합니다. 하지만 이 논문은 그 대시보드가 종종 고장 나 있거나 아예 없다고 주장합니다. 그들은 자신의 답변에 확신을 가질 수 있는 충분한 증거를 가지고 있지 않습니다.

저자들은 이 누락된 증거를 **"평가 가능성 격차(Evaluability Gap)"**라고 부릅니다. 이는 AI가 반드시 위험하거나 쓸모없다는 뜻이 아니라, 기업이 확신을 가질 수 있는 증거가 부족하다는 뜻입니다. 증거를 제시할 수 없기 때문에, 기업은 눈을 가린 채 비행하거나(거대한 리스크를 감수함) 혹은 불필요하게 비행기를 세워두게 됩니다(가치를 놓침).

핵심 개념: "평가 가능성(Evaluability)"

이 논문은 평가 가능성이라는 새로운 개념을 도입합니다. 이것을 AI 자체의 기능이 아니라, AI를 둘러싼 증거의 기능으로 생각하십시오.

  • 과거 방식: "AI가 정확한가?" (점수를 확인한다).
  • 새로운 방식 (평가 가능성): "우리는 AI가 정확하다는 것을 증명할 수 있는 신뢰할 수 있고, 최신이며, 검증 가능한 영수증 세트를 가지고 있는가?"

평가 가능성이란 높은 신뢰도의 의사결정을 내리는 데 필요한 증거를 생성하고, 유지하고, 갱신하는 능력입니다. 증거를 제시할 수 없다면, 통제할 수 없습니다.

두 가지 유형의 의사결정

논문은 "안전"과 "돈"을 동일하게 취급하는 것을 멈춰야 한다고 말합니다. 이 둘은 서로 다른 종류의 증거를 요구합니다.

  1. 운영 인증 (The "Safety Check"):

    • 질문: "이것을 켤 수 있는가?"
    • 필요한 증거: 구조적 증거. 브레이크가 작동하는지, 날개가 붙어 있는지, 조종사가 규칙을 따르는지 확인하는 것과 같습니다.
    • 비유: 자동차 검사. 당신은 차가 사람을 죽이지 않을 것이라는 점을 증명해야 합니다.
  2. 투자 인증 (The "Value Check"):

    • 질문: "이것에 계속 비용을 지불해야 하는가?"
    • 필요한 증거: 인과적 증거. 이 특정 자동차가 실제로 걷는 것보다 목적지에 더 빨리 도착하게 해주었는가? 비용을 절감해주었는가?
    • 비유: 기업의 지출 결의서. 당신은 차가 단순히 존재한다는 것을 넘어, 실제로 사업 성장에 도움이 되었다는 것을 증명해야 합니다.

함정: 어떤 시스템은 "운영 인증(안전)"은 통과했지만 "투자 인증(가치)"에는 실패할 수 있습니다. 현재 기업들은 이 두 가지를 구분하는 방법을 모르기 때문에 어려움을 겪고 있습니다.

좋은 증거를 위한 6가지 요소

"평가 가능성 격차"를 메우기 위해, 논문은 증거에 여섯 가지 구체적인 요소가 필요하다고 말합니다. 이것을 튼튼한 의자의 여섯 다리라고 생각하십시오. 하나라도 없으면 의자는 무너집니다.

  1. 관측 가능성 (Observability - 볼 수 있는가?):
    • 비유: 요리를 할 때, 재료가 들어가고 음식이 나오는 과정을 볼 수 있습니까? 만약 AI가 결정을 내렸지만 무엇을 보았고 무엇을 했는지 로그를 남기지 않는다면, 당신에게는 증거가 없습니다.
  2. 속성 부여 가능성 (Attributability - AI가 원인인가?):
    • 비유: 매출이 올랐다면, 그것이 AI 때문입니까, 아니면 크리스마스 시즌이기 때문입니까? 당신은 단순히 두 사건이 동시에 일어난 것이 아니라, AI가 결과의 원인임을 증명해야 합니다.
  3. 개입 가능성 (Intervenability - 멈추거나 바꿀 수 있는가?):
    • 비유: 만약 AI가 차를 벽으로 몰고 가기 시작한다면, 브레이크를 밟을 수 있습니까? 만약 당신이 그것을 끄거나 테스트하기 위해 수정할 수 없다면, 그것을 신뢰할 수 없습니다.
  4. 검증 가능성 (Verifiability - 다른 사람이 확인할 수 있는가?):
    • 비례: 만약 당신이 "나는 케이크를 구웠다"라고 말한다면, 친구가 당신의 영수증과 오븐 기록을 보고 그것을 증명할 수 있습니까? 단순히 "했다"라고 주장하는 자가 증명(Self-attested)은 충분하지 않습니다.
  5. 교정/캘리브레이션 (Calibration - 자신감에 대해 정직한가?):
    • 비유: 만약 당신이 "이 다리가 버틸 확률이 90%라고 확신한다"라고 말한다면, 실제로 90%의 확률로 버팁니까? 많은 시스템이 "90% 확신한다"라고 말하지만 실제로는 60%의 확률로만 맞습니다. 그것은 위험합니다.
  6. 시간적 유효성 (Temporal Validity - 증거가 여전히 신선한가?):
    • 비유: 지난주 기상 예보는 오늘 사용하기에 무용지물입니다. AI는 빠르게 변합니다. 당신이 가진 증거가 오래되었다면, 그것은 쓰레기입니다. 증거를 계속해서 갱신해야 합니다.

"증거 라이프사이클" (신뢰의 순환)

논문은 증거가 일회성 것이 아니라고 주장합니다. 그것은 마치 갓 구운 빵과 같습니다.

  • 빵을 구울 때 (증거를 수집할 때), 그것은 신선하고 신뢰할 수 있습니다.
  • 시간이 흐르면 빵은 굳어갑니다 (세상이 변하고, 사용자가 적응하며, AI가 새로운 것을 배웁니다).
  • 결국, 그것은 곰팡이가 핍니다 (증거가 더 이상 유효하지 않게 됩니다).

해결책: 빵을 한 번 구워서 일 년 내내 먹을 수는 없습니다. 계속해서 신선한 빵을 구워야 합니다. 즉, **지속적인 재인증(Continuous Re-certification)**이 필요합니다. 당신의 증거가 여전히 신선한지 끊임없이 확인해야 합니다.

왜 특히 AI에 중요한가?

AI는 다리나 공장 기계와 다른데, 그 이유는 AI는 빠르게 변하기 때문입니다.

  • 세상이 움직입니다: 사용자들이 AI를 속이는 법을 배웁니다. 경쟁자들이 변화합니다. 경제 상황이 바뀝니다.
  • AI가 진화합니다: AI는 학습하지 않았던 새로운 일을 수행하도록 배울 수 있습니다.
  • 결과: 오늘 완벽했던 증거가 다음 주에는 틀릴 수 있습니다.

이 때문에 논문은 "AI가 안전한가?"라고 묻는 대신, "우리는 AI가 안전하다는 신선하고 신뢰할 수 있는 증거를 가지고 있는가?"라고 물어야 한다고 말합니다.

요약

논문은 거버넌스는 기술의 문제가 아니라 증거의 문제라고 결론짓습니다.

  • 더 나은 AI 모델을 만드는 데 그치지 마십시오.
  • 그 주변에 더 나은 증거 시스템을 구축하십시오.
  • 당신의 증거가 관측 가능하고, 원인을 규명할 수 있으며, 검증 가능하고, 교정되었으며, 신선한지 확인하십시오.

증거가 있다면 확신을 가지고 결정할 수 있습니다. 증거가 없다면, 당신은 눈을 가린 채 비행하고 있는 것입니다. "우리가 알고 있다고 생각하는 것"과 "알기 위해 필요한 증거를 갖는 것" 사이의 간격이 바로 "평가 가능성 격차"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →