← 최신 논문
🤖 AI

Quantifying the Expectation-Realisation Gap for Agentic AI Systems

이 논문은 소프트웨어 엔지니어링 및 임상 진료 등 다양한 분야에서 에이전트 AI 시스템의 기대 효과와 실제 성과 사이에 존재하는 체계적인 격차를 실증적으로 규명하고, 이를 해소하기 위해 인간 감독 비용을 반영한 정량적 기대치 설정과 구조적 계획 프레임워크의 필요성을 강조합니다.

원저자: Sebastian Lobentanzer

게시일 2026-02-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sebastian Lobentanzer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 에이전트"**가 우리 일을 얼마나 더 잘해줄 것이라고 우리가 기대하는지와, 실제로 일어난 일 사이의 **큰 차이 (기대-현실 괴리)**를 분석한 연구입니다.

쉽게 비유하자면, **"새로 산 고성능 스포츠카가 시속 300km 로 달릴 거라고 기대했는데, 실제로는 시내 도로에서 교통체증 때문에 오히려 일반 차보다 느리게 갔다"**는 상황을 여러 분야에서 조사한 보고서라고 생각하시면 됩니다.

주요 내용을 일상적인 언어와 비유로 설명해 드릴게요.


1. 핵심 주제: "기대 vs 현실"의 큰 간격

우리는 AI 가 도입되면 일이 훨씬 빨라지고 정확해질 거라고 기대합니다. 하지만 실제 데이터를 보니, 기대했던 효과의 절반도 나오지 않거나, 오히려 일이 더 느려지거나 엉망이 되는 경우가 많았습니다.

2. 세 가지 분야의 실제 사례 (비유와 함께)

🛠️ 소프트웨어 개발 (코딩)

  • 기대: "AI 가 코드를 짜주면 내가 24% 더 빨리 끝낼 수 있겠지!"
  • 현실: "오히려 19% 더 느려졌어! 왜? AI 가 쓴 코드가 틀려서 고치느라 시간이 더 걸렸거든."
  • 비유: 유능한 요리사가 AI 로봇 조수에게 요리를 시켰는데, 로봇이 재료를 잘못 썰고 소스를 태워버려서 요리사가 다시 다듬고 고쳐야 해서 오히려 식사가 늦게 나온 경우입니다. 초보자는 로봇이 도와주면 빨리 끝내지만, 이미 요리 실력이 좋은 셰프는 로봇이 방해가 되어 더 느려집니다.

🏥 임상 문서 작성 (병원 기록)

  • 기대: "의사가 환자를 만나고 AI 가 자동으로 기록을 써주면, 한 명당 5 분씩 아껴서 퇴근이 빨라지겠지!"
  • 현실: "실제로는 1 분도 안 아껴졌어. 오히려 AI 가 쓴 기록을 다시 확인하고 수정하느라 밤늦게까지 일해야 해."
  • 비유: 비서에게 회의록을 AI 가 대신 써주게 했는데, AI 가 엉뚱한 내용을 적거나 문법을 틀려서 비서가 다시 다 고쳐야 하는 경우입니다. "5 분 아낀다"는 광고는 좋지만, 실제로는 "기록을 고치는 시간"이 추가되어 총 소요 시간은 줄지 않았습니다.

🩺 임상 의사결정 (질병 진단)

  • 기대: "AI 가 암이나 패혈증 진단을 도와주면 90% 이상 정확해서 실수를 안 하겠지!"
  • 현실: "실제 병원에서는 정확도가 60% 대에 그쳐서, 병든 환자를 놓치는 경우가 많았어."
  • 비유: 시험장에서 90 점 이상 맞았던 AI 가, 실제 현장 (실전) 에 나가서는 낯선 상황 때문에 60 점도 못 맞은 경우입니다. 실험실 환경과 실제 병원의 복잡한 상황은 완전히 다릅니다.

3. 왜 이렇게 차이가 날까? (3 가지 원인)

  1. 작업 흐름의 마찰 (Integration Friction):

    • AI 는 혼자 일하는 게 아니라 기존 업무에 끼워 넣어야 합니다. 그런데 AI 가 낯선 도구라 오히려 업무 흐름을 끊고 방해합니다.
    • 비유: 새로운 GPS 를 차에 달았는데, 지도가 자꾸 업데이트되지 않아서 오히려 길을 잃고 헤매는 상황입니다.
  2. 검증의 부담 (Verification Burden):

    • AI 가 만든 결과물은 사람이 반드시 다시 확인해야 합니다. 이 '확인하는 시간'을 계산에 안 넣어서 기대치가 과장된 것입니다.
    • 비유: AI 가 쓴 답안을 받아서 "이게 맞나?" 확인하고 수정하는 데 시간이 더 걸려서, 아예 처음부터 내가 쓴 게 더 빨랐던 경우입니다.
  3. 측정의 착각 (Measurement Mismatch):

    • 회사나 판매자는 "좋아 보이는 지표" (예: AI 가 쓴 글자 수) 로 홍보하지만, 실제 성과는 "진짜 문제 해결" (예: 환자가 낫는지, 코드가 안전한지) 로 측정해야 합니다.
    • 비유: 운전 시간이 5 분 줄었다고 자랑하지만, 실제로는 목적지에 늦게 도착한 경우입니다.

4. 중요한 교훈: "누가 혜택을 보는가?"

AI 는 모든 사람에게 똑같이 도움이 되지 않습니다.

  • 초보자나 단순한 작업: AI 가 큰 도움을 줍니다. (비유: 운전 초보자가 내비게이션을 쓰면 길을 잘 찾음)
  • 전문가나 복잡한 작업: AI 가 방해가 되거나 효과가 없습니다. (비유: 베테랑 레이서에게 내비게이션이 오히려 방해가 되어 더 느려짐)

5. 결론: 어떻게 해야 할까?

이 논문은 "AI 를 쓰지 말라"는 게 아닙니다. **"AI 를 쓸 때는 현실적인 계획을 세워라"**고 말합니다.

  • 구체적인 숫자로 계획하기: "빨라질 거야"가 아니라 "확인 시간을 뺀 후 10% 는 빨라질 거야"라고 계산하세요.
  • 사람이 확인하는 시간을 포함하기: AI 가 만든 걸 사람이 고치는 시간을 미리 예산에 넣으세요.
  • 누가 혜택을 받는지 파악하기: 모든 직원이 아닌, 특정 부서에 먼저 도입하는 등 전략적으로 접근하세요.

한 줄 요약:
AI 는 마법 지팡이가 아니라 새로운 도구입니다. 이 도구를 쓸 때 "기대"만 하지 말고, "실제 고치는 시간"과 "누가 쓸지"를 꼼꼼히 계산해서 도입해야 실패하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →