← 최신 논문
🤖 AI

Towards a Science of AI Agent Reliability

이 논문은 일관성, 강건성, 예측 가능성, 안전성이라는 네 가지 차원에 걸친 12가지 지표의 프레임워크를 제안하며, 최근의 능력 향상이 실제 운영상의 신뢰성 측면에서는 미미한 이득만을 가져왔음을 밝힌다.

원저자: Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 삶을 운영할 수 있는 매우 똑똑하고 매우 빠른 개인 비서를 고용했다고 상상해 보십시오. 그들은 항공권을 예약하고, 은행 계좌를 관리하며, 코드를 작성할 수 있습니다. 서류상으로 그들은 완벽해 보입니다. 95%의 확률로 정답을 맞히니까요. 하지만 현실에서 당신은 불안합니다. 때때로 당신이 "금요일 오전"이라고 말하는 대신 "금요일 AM"이라고 말했다는 이유로 엉뚱한 항공권을 예약하기도 합니다. 때로는 명령어를 오해해서 당신의 데이터베이스 전체를 삭제해 버리기도 합니다. 또 어떤 때는 똑같은 작업을 다섯 번 수행하면서도 다섯 번 모두 다른 결과를 내놓기도 합니다.

이 논문은 우리가 현재 AI 에이전트를 단 한 번의 시험 점수로 판단하는 학생처럼 평가하고 있다고 주장합니다. 우리는 "정답을 맞혔는가?"라고 묻고, 만약 그렇다면 A 학점을 줍니다. 하지만 저자들은 이들이 우리를 대신해 자율적으로 일하게 될 것이라면 그것만으로는 충분하지 않다고 말합니다. 우리는 그들이 단순히 성공하느냐가 아니라, 어떻게 행동하느냐를 알아야 합니다.

이를 해결하기 위해 저자들은 항공 및 원자력 발전에서 아이디어를 빌려와 AI 에이전트를 테스트하는 새로운 방법을 제안합니다. 이 분야들에서는 단순히 "비행기가 날았는가?"라고 묻지 않습니다. "매번 같은 방식으로 날았는가? 폭풍우를 견뎌냈는가? 조종사가 추락하기 직전임을 알고 있었는가? 그리고 만약 추락했다면, 그 피해가 얼마나 심각했는가?"라고 묻습니다.

논문은 '신뢰성(Reliability)'을 12가지 구체적인 테스트를 사용한 네 가지 단순한 기둥으로 나눕니다.

1. 일관성 (Consistency): "그라운드 데이(Groundhog Day)" 테스트

비유: 당신이 비서에게 커피를 만들어 달라고 요청한다고 상상해 보십시오. 오늘은 라떼를 만듭니다. 내일 똑같이 요청했는데, 이번에는 티를 만듭니다. 모레는 샌드위치를 만듭니다.
논문의 주장: 에이전트가 80%의 확률로 일을 완수한다 하더라도, 나머지 20%의 시간 동안 완전히 다른 행동을 하거나 무작위로 실패한다면 그들은 신뢰할 수 없는 것입니다. 저자들은 가장 똑똑한 AI 모델조차도 동일한 작업을 여러 번 실행할 때 동일한 답을 내놓거나 동일한 해결책에 도달하는 경로가 달라지는 경우가 많다는 것을 발견했습니다. 그들은 마치 동전 던지기와 같습니다. 가끔은 앞면, 가끔은 뒷면이 나오는데, 설령 "앞면"이 정답이라 할지라도 말입니다.

2. 강건성 (Robustness): "뒤틀린 지시사항" 테스트

비유: 당신이 비서에게 "구독을 취소해 줘"라고 말하면, 그들은 실행합니다. 그런데 "내 플랜을 종료해 줘"라고 말하면, 그들은 얼어붙어 아무것도 하지 못합니다. 또는, 데이터베이스를 확인하라고 명령했는데 데이터베이스의 열 순서가 약간 바뀌자 에이전트가 작동을 멈춥니다.
논문의 주장: 현실은 복잡합니다. 지시사항은 항상 완벽하지 않으며, 도구는 변합니다. 저자들은 지시사항을 약간 바꾸거나 데이터 형식을 망가뜨렸을 때 어떤 일이 발생하는지 테스트했습니다. 그들은 AI 에이전트가 기술적 결함(예: 서버 타임아웃)을 처리하는 능력은 좋아지고 있지만, 인간의 말투가 바뀌거나 데이터 형식이 바뀌는 단순한 변화에는 여전히 매우 취약하다는 것을 발견했습니다. 그들은 직선의 매끄러운 고속도로에서는 완벽하게 주행하지만, 핸들을 아주 조금만 다르게 꺾어도 무너져 버리는 자동차와 같습니다.

3. 예측 가능성 (Predictability): "정직함" 테스트

비유: 당신의 비서가 "컴퓨터를 고칠 자신이 100% 있습니다"라고 말하지만, 실제로는 어떻게 해야 할지 전혀 모르는 상황입니다. 혹은, 정답을 완벽히 알고 있음에도 "잘 모르겠습니다"라고 말하는 상황입니다.
논문의 주장: 신뢰할 수 있는 에이전트는 자신이 실패할 가능성이 높을 때를 알아야 합니다. "이 부분은 확신이 없으니 확인해 주세요"라고 말할 수 있어야 합니다. 저자들은 AI 모델이 자신의 확신도를 추정하는 능력이 향상되고 있지만(과잉 확신을 하는 경우가 줄어들고 있지만), 여전히 어떤 특정 작업에서 실패할 것인지를 말하는 데 어려움을 겪고 있다는 것을 발견했습니다. 그들은 자신들이 "보통" 잘한다는 것은 알 수 있을지 몰라도, 특정 업무를 망치기 전에 미리 경고를 해주지는 못합니다.

4. 안전성 (Safety): "피해 통제" 테스트

비유: 당신의 비서가 실수를 저질렀습니다.

  • 시나리오 A: 파일을 알파벳 순으로 정렬하다가 몇 개를 잘못된 폴더에 넣었습니다. 당신은 그것들을 다시 옮겨야 합니다. (짜증 나지만, 수정 가능합니다).
  • 시나리오 B: 당신의 사진 아카이브 전체를 삭제해 버렸습니다. (재앙적입니다).
    논문의 주장: 에이전트가 1%의 확률로 실패한다는 사실보다 중요한 것은, 그 1%의 상황에서 무슨 일이 일어나는가입니다. 저자들은 에이전트가 규칙(예: "파일을 삭제하지 마시오")을 따르는 능력은 좋아지고 있지만, 규칙을 어길 때 그 결과가 매우 치명적일 수 있다는 것을 발견했습니다. 또한 "안전성"은 종종 평균 성공률 뒤에 숨겨져 있다는 것도 발견했습니다. 에이전트는 99% "안전"할 수 있지만, 그 1%의 경우에 재앙을 초래할 수 있습니다.

거대한 발견

저자들은 2년에 걸쳐 OpenAI, Google, Anthropic과 같은 기업의 15가지 서로 다른 AI 모델을 테스트했습니다. 그들은 모델들의 "정확도(Accuracy, 정답을 맞히는 빈도)"와 위 네 가지 테스트를 통한 "신뢰성(Reliability)"을 비교했습니다.

결과: AI 모델들은 시간이 지남에 따라 훨씬 더 똑똑해지고 정확해졌습니다. 하지만 그들의 신뢰성은 거의 개선되지 않았습니다.

이는 레이스카 드라이버가 2년 동안 20% 더 빨라졌지만, 트랙 위에 머물거나, 비를 견디거나, 길을 잃었을 때 인정하는 능력은 전혀 나아지지 않은 것과 같습니다. 논문은 단순히 AI를 "더 똑똑하게(더 정확하게)" 만드는 것만으로는 자동으로 "더 안전하거나" "더 신뢰할 수 있게" 만들 수 없다고 결론짓습니다. 우리가 AI 에이전트에게 중요한 업무를 맡기기를 원한다면, 우리는 이 네 가지 특정 특성을 측정하고 최적화하는 데 집중해야 합니다.

요약하자면: 우리는 현재 천재적이지만 예측 불가능한 AI 에이전트를 만들고 있습니다. 우리가 그들에게 운전대를 맡기기 전에, 라디오 채널이 바뀐다고 해서 핸들을 꺾지 않는지, 길을 잃었을 때 스스로를 인지하는지, 그리고 단지 혼란스러워졌다는 이유만으로 자동차를 충돌시키지는 않는지 반드시 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →