← 최신 논문
🤖 AI

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

본 논문은 구조화된 실패 분류 체계, 개편된 5 층 보증 피라미드, 그리고 통합된 평가 주도 엔지니어링 관행을 통해 전통적인 정확성 검증에서 지속적인 위험 감소로 초점을 전환하는 기업용 AI 시스템을 위한 포괄적이고 운영적으로 배포 가능한 보증 전략을 제안합니다.

원저자: Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

게시일 2026-05-25
📖 5 분 읽기🧠 심층 분석

원저자: Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사업을 운영하기 위해 천재적이지만 약간 예측 불가능한 컨설턴트 팀을 고용한다고 상상해 보세요. 이 컨설턴트들은 시를 쓰고, 수학 문제를 풀고, 법적 계약서를 초안할 정도로 매우 똑똑합니다. 하지만 여기 함정이 있습니다. 그들은 고정된 규칙집을 가지고 있지 않습니다. 거대한 도서관의 책들로부터 학습하며, 매번 질문에 답할 때 이전에 읽은 내용을 바탕으로 가장 그럴듯한 답을 추측합니다. 때로는 맞히기도 하지만, 때로는 자신 있게 완전히 틀린 답을 내놓기도 합니다.

Thoughtworks 의 전문가들이 작성한 이 논문은 기존의 전통적인 컴퓨터 소프트웨어를 테스트하는 방식과 똑같은 방법으로 이러한 'AI 컨설턴트'들을 테스트할 수 없다고 주장합니다.

다음은 비유와 예시를 들어 쉽게 설명한 그들의 전략 요약입니다.

1. 구식 방식 vs 신식 방식

구식 방식 (전통적 소프트웨어):
자판기를 상상해 보세요. 'A1'을 누르면 칩스 한 봉지가 나옵니다. 다시 'A1'을 누르면 완전히 똑같은 칩스 한 봉지가 나옵니다. 만약 그렇지 않다면 그 기계는 고장 난 것입니다. 이를 테스트하는 것은 쉽습니다. 매번 올바른 것이 나왔는지 확인하기만 하면 됩니다.

신식 방식 (AI 시스템):
이제 인간 여행 에이전트를 상상해 보세요. "파리 여행 계획을 세워줘"라고 요청합니다.

  • 실행 1: 에펠탑 근처 호텔을 제안합니다.
  • 실행 2: 루브르 박물관 근처 호텔을 제안합니다.
  • 실행 3: 산만해져서 실수로 런던 여행을 예약합니다.

실행 2 가 실행 1 과 다르다는 이유만으로 "실행 2 는 틀렸다"고 말할 수는 없습니다. 둘 다 유효한 결과입니다. 하지만 실행 3 은 재앙이라고 말할 수는 있습니다.
논문의 핵심: 우리는 자판기처럼 '통과/실패'를 확인하는 방식으로 AI 를 테스트할 수 없습니다. 대신 위험 감소를 위해 테스트해야 합니다. 우리는 AI 가 완벽함을 증명하려는 것이 아니라, 위험하거나 어리석은 일을 하지 않을 것임을 증명하려는 것입니다.

2. "AI 실패 분류학" (AI 가 망치는 5 가지 방법)

저자들은 AI 가 구식 소프트웨어처럼 단순히 '크래시'를 치는 것이 아니라, 다섯 가지의 구체적이고 교묘한 방식으로 실패한다고 말합니다. 여행 에이전트가 여행을 망치는 다섯 가지 방식으로 생각하세요:

  1. 자신감 넘치는 거짓말쟁이 (Grounding Failure): 에이전트가 완벽한 일정을 제시하지만, 그 호텔은 존재하지 않습니다. 자신감 있게 들렸기 때문에 지어낸 것입니다.
  2. 잘못된 경로 (Reasoning Failure): 에이전트가 올바른 호텔로 안내하지만, 그곳에 가는 길에 미친 듯이 비싼 경로를 택하거나 '계단 금지'라는 당신의 규칙을 잊어버립니다.
  3. 교활한 사기꾼 (Safety Failure): 누군가 에이전트를 속여 신용카드 번호를 누설하거나 규칙을 위반하게 만듭니다.
  4. 팀 내 갈등 (Coordination Failure): 세 명의 에이전트가 함께 일합니다 (한 명은 항공권, 한 명은 호텔, 한 명은 이메일 담당). 서로 대화하지만 메시지를 오해합니다. 항공권은 화요일로 예약되었는데 호텔은 수요일로 예약됩니다.
  5. 기분 변화 (Stochastic Failure): 에이전트는 10 번 중 9 번은 완벽하게 작동하지만, 10 번째에는 갑자기 이상해지기로 결정합니다. 이것이 언제 발생할지 예측할 수 없습니다.

3. "AI 보증 피라미드" (테스트 방법)

단순한 테스트 목록 대신, 이 논문은 피라미드를 제안합니다. 이는 5 층으로 된 건물과 같습니다. 실수는 아래층에서 잡아야 합니다. 저렴하고 쉽기 때문입니다. 만약 꼭대기 층까지 기다린다면, 그 실수는 이미 전체 여행을 망쳐놓았을 것입니다.

  • 0 층 (기초): 배관 공사를 점검합니다. 컴퓨터 코드가 실제로 데이터베이스에 연결되어 있는지요? 프롬프트 (AI 에게 주는 지시문) 가 올바른 형식으로 작성되었는지요? 이는 100% 확실합니다.
  • 1 층 (구성 요소): 개별 에이전트를 테스트합니다. '항공권 에이전트'가 항공권 검색 방법을 알고 있는지요? '안전 에이전트'가 나쁜 단어를 차단하는 방법을 알고 있는지요?
  • 2 층 (단일 에이전트): 다단계 작업을 수행하는 단일 에이전트를 테스트합니다. "내게 항공권 예약해 줘." 올바른 항공권을 선택했나요? 올바른 날짜를 선택했나요? 이름을 기억했나요?
  • 3 층 (팀): 에이전트들이 서로 어떻게 소통하는지 테스트합니다. '항공권 에이전트'가 '호텔 에이전트'에게 올바른 날짜를 전달했나요? 올바른 정보를 전달했나요?
  • 4 층 (비즈니스 결과): 최종 테스트입니다. 고객이 실제로 만족하는 휴가를 얻었나요? 회사가 법을 준수했나요? 이는 결과를 사람이 확인해야 하므로 테스트하는 데 가장 비싼 층입니다.

황금률: 0 층이나 1 층에서 오류를 잡으세요. 만약 4 층에서만 테스트한다면, 고객이 불만을 제기할 때까지 문제가 있다는 것을 모르게 되는 것입니다.

4. RAG: "도서관" 문제

많은 회사가 RAG(검색 증강 생성) 라는 시스템을 사용합니다.

  • 비유: AI 를 시험을 치는 학생이라고 상상해 보세요.
    • RAG 없이: 학생은 오직 기억에만 의존합니다. 잘못된 것을 기억할 수 있습니다 (환각).
    • RAG 로: 학생은 답변하기 전에 특정 교과서 (회사 데이터) 를 열 수 있습니다.
  • 테스트의 어려움: 두 가지를 따로 테스트해야 합니다.
    1. 학생이 교과서에서 올바른 페이지를 찾았나요? (검색)
    2. 학생이 그 페이지를 읽고 그 내용을 바탕으로 질문을 정확하게 답했나요? (생성)
    • 만약 답이 틀렸다면, 잘못된 페이지를 봤는지, 아니면 올바른 페이지를 보고 오해한 것인지 알아내야 합니다.

5. "침묵하는 드리프트" (모델 변경)

전통적인 소프트웨어에서는 라이브러리를 업데이트하면 정확히 무엇이 변경되었는지 알 수 있습니다.
AI 에서는 '선생님'(AI 모델 제공자) 이 학기 중간에 교과서를 조용히 바꿀 수 있습니다.

  • 위험: 어제는 AI 가 "항상 직항편 예약"이라는 규칙을 따랐습니다. 오늘, 조용한 업데이트 후 경유가 있는 항공편을 예약하기 시작합니다.
  • 해결책: 지속적 평가가 필요합니다. 출시 전 한 번만 테스트해서는 안 됩니다. AI 가 '드리프트'되어 나쁜 행동을 시작하지 않았는지 확인하기 위해 매일 테스트 세트를 실행해야 합니다. 일일 건강 검진과 같습니다.

6. 큰 전환: QA 에서 "평가 엔지니어링"으로

이 논문은 새로운 직무 역할이 필요하다고 결론 내립니다.

  • 구식 QA: "코드가 실행되나요? 버튼이 작동하나요?"
  • 신식 평가 엔지니어링: "AI 가 안전하게 행동하나요? 일관성이 있나요? 환각을 일으켰나요?"

이는 단순히 더 많은 테스트를 작성하는 것이 아닙니다. 플랫폼을 구축하는 것입니다.

  • 테스트 기준으로 사용할 '골든 데이터셋'(완벽한 질문과 답변의 예시) 이 있습니다.
  • 답변을 채점할 '심판'(다른 AI 또는 인간) 이 있습니다.
  • 프롬프트(지시문) 를 코드처럼 취급하여 AI 모델이 변경될 때마다 버전 관리되고 테스트됩니다.

요약

이 논문은 말합니다: AI 를 완벽하게 만들려고 하지 마세요. 안전하게 만들려고 하세요.
AI 를 자판기처럼 취급하지 마세요. 천재적이지만 예측 불가능한 인턴 팀처럼 취급하세요. 엄격한 점검 시스템 (피라미드), 그들이 거짓말하는 것을 잡아내는 방법 (분류학), 그리고 그들이 훈련을 잊지 않았는지 매일 확인하는 루틴 (지속적 모니터링) 이 필요합니다. 이를 수행하면 비즈니스를 그들에게 맡길 수 있습니다. 그렇지 않으면 맹비행하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →