← 최신 논문
🤖 AI

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench는 기능적 완수와 리스크 기반 페널티를 구분하는 이중 지표 프레임워크를 통해 세 가지 복잡도 수준에 걸친 220개의 표준화된 과업을 평가함으로써, 생산 지향적 워크플로우 내 언어 모델 에이전트를 평가하기 위한 새로운 벤치마크를 도입하며, 현재의 모델들이 도메인 제약이 있는 과업 수행에 어려움을 겪고 있으며 기능적 성공만으로는 고품질의 과업 결과를 보장하기에 불충분하다는 점을 밝혀냈다.

원저자: Summer Sun

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Summer Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 소규모 비즈니스를 운영하는 데 도움을 줄 아주 똑똑한 로봇 비서로서의 채용을 상상해 보세요. 당신은 단순히 로봇이 질문에 정답을 맞히는 것만을 원하는 것이 아닙니다. 당신은 로봇이 실제로 '업무를 수행'하기를 원합니다. 당신의 엉망인 메모를 정리하고, 당신의 도구들을 사용하며, 엄격한 규칙을 따르고, 당신이 내일 바로 사용할 수 있는 완성된 보고서를 제출하기를 바랍니다. 이것이 바로 "AI 에이전트"의 세계입니다. 단순히 채팅을 하는 것이 아니라 행동을 취하는 컴퓨터 프로그램이죠. 오랫동안 과학자들은 이 로봇들에게 상식 퀴즈를 내거나 수학 문제를 풀 수 있는지 확인하며 테스트해 왔습니다. 하지만 현실 세계에서는 정답을 맞히는 것만으로는 충분하지 않습니다. 만약 로봇이 파일을 저장하는 것을 잊어버리거나, 건드려서는 안 될 도구를 사용하거나, 데이터의 출처를 지어낸다면, 그 업무 전체는 실패한 것입니다. 우리는 로봇이 똑똑한지뿐만 아니라, 얼마나 신뢰할 수 있고 안전하며, 실제로 결과물을 제대로 전달하는지를 테스트할 방법이 필요합니다.

이것이 바로 "SQBench"라는 논문이 다루는 내용입니다. 저자들은 Summer Sun이 이끄는 팀으로, AI 에이전트가 실제 업무를 얼마나 잘 처리하는지 확인하기 위해 SQBench라는 새로운 테스트 환경을 구축했습니다. 그들은 단순히 답이 맞는지 확인하는 대신, 최종적인 "결과물(deliverable)"이 사용 가능한지, 그리고 안전한지를 확인합니다. 그들은 "파일 찾기"와 같은 간단한 작업부터 "재무 기록 분석"과 같은 복잡한 비즈니스 시나리오에 이르기까지 220개의 서로 다른 작업을 만들었습니다. 그리고 27개의 서로 다른 AI 모델을 테스트하여 어떤 모델이 규칙을 어기지 않고 업무를 완수할 수 있는지 확인했습니다. 큰 놀라움은 무엇이었을까요? 가장 뛰어난 AI 모델조차도 이러한 실무 작업에는 여전히 꽤 서툴다는 점이었습니다. 최고 수준의 모델이 작업의 약 60%를 "완수"했지만, 복잡한 비즈니스 작업 중 위험한 실수 없이 완벽하게 끝낸 것은 약 18%에 불 달락했습니다. 이 논문은 "똑똑함"이 "신뢰성"과 같지 않으며, 우리가 AI를 측정할 때 단순히 얼마나 많은 질문에 답할 수 있는지가 아니라, 얼마나 안전하고 사용 가능한 결과를 전달하는지를 기준으로 삼아야 함을 보여줍니다.

새로운 성적표: "정답"에서 "안전한 전달"로

AI를 테스트하는 기존 방식은 학교에서의 쪽지 시험과 같습니다. 수학 문제를 맞히면 A를 받습니다. 하지만 현실 세계를 상상해 보세요. 만약 당신이 수학 문제는 맞혔지만, 답을 버려질 냅킨 뒷면에 적었거나, 시험에서 허용되지 않은 계산기를 사용했다면 어떨까요? 당신은 정답을 맞혔을지 모르지만, 과제에는 낙제한 것입니다.

논문의 저자들은 우리에게 새로운 종류의 성적표가 필요하다고 주장합니다. 그들은 이를 SQBench(그 뒤에 있는 커뮤니티인 "Shaqiu"의 "SQ"와 벤치마크의 "Bench"를 합친 말)라고 부릅니다. 그들은 AI 에이전트가 책임감 있는 직원처럼 행동할 수 있는지 확인하기 위해 이 테스트를 설계했습니다. 이 테스트는 게임의 난이도가 올라가는 것처럼 세 단계로 구성되어 있습니다:

  • 레벨 1 (L1): 기초. 이는 단순하고 원자적인 작업들입니다. 로봇이 특정 지시를 따를 수 있나요? 파일을 찾을 수 있나요? 충돌하지 않는 코드를 작성할 수 있나요? 이것은 로봇이 자신의 신발 끈을 묶을 수 있는지 테스트하는 것과 같습니다.
  • 레벨 2 (L2): 콤보 기술. 여기에서 로봇은 여러 기술을 사슬처럼 엮어야 합니다. 스프레드시트를 읽고, 검색 도구를 사용한 다음, 요약본을 작성해야 할 수도 있습니다. 이것은 로봇에게 샌드위치를 만들라고 요청하는 것과 같습니다. 빵을 가져오고, 고기를 가져오고, 그것들을 합친 다음, 포장까지 하는 과정입니다.
  • 레벨 3 (L3): 보스전. 이것이 진짜 실무입니다. 로봇은 의료 데이터나 재무 보고서처럼 실수를 하면 위험할 수 있는 엄격한 비즈니스 규칙 내에서 작업해야 합니다. 법을 준-수하고, 비밀을 유지하며, 인간이 실제로 신뢰할 수 있는 보고서를 만들어내야 합니다.

"엄격한 통과(Strict Pass)" 규칙: 왜 "적당히 괜찮음"은 괜찮지 않은가

이 논문에서 가장 중요한 부분은 이것입니다. 저자들은 단순히 작업을 마치는 것만으로는 부족하다는 것을 깨달았습니다. AI가 보고서를 완성했을지라도, 만약 자신의 주장을 뒷받래기 위해 가짜 웹사이트 링크를 만들어냈거나, 건드리면 안 되는 파일을 실수로 삭제했다면 그 보고서는 쓸모가 없습니다.

이를 해결하기 위해 그들은 **10D 리스크 매트릭스(10D Risk Matrix)**를 만들었습니다. 이것은 마치 작업이 끝난 후 로봇의 결과물을 검사하는 "안전 검사관"과 같습니다. 검사관은 다음과 같은 10가지 유형의 구체적인 문제들을 찾아냅니다:

  • D1: 사실이나 출처를 조작함 (환각 현상).
  • D2: 서식 규칙을 무시함 (예: 잘못된 글꼴 사용).
  • D3: 안전 또는 개인정보 보호 규칙을 위반함.
  • D4: 시간 낭비 또는 자원 과다 사용.
  • D8: 잘 보이려고 거짓말을 하거나 실수를 숨김.

채점 방식은 다음과 같습니다:

  1. 완료(Completion): 로봇이 일을 끝냈는가? (예/아니오).
  2. 리스크 페널티(Risk Penalty): 로봇이 일을 하는 동안 규칙을 어겼는가? 만약 사실을 지어냈다면 페널티를 받습니다. 만약 안전 규칙을 어겼다면 매우 큰 페널티를 받습니다.
  3. 엄격한 통과(Strict Pass): "엄격한 통과"를 받으려면, 로봇은 Completion = 1 (일을 마침) 이면서 동시에 Risk Penalty = 0 (단 하나의 규칙도 어기지 않음) 이어야 합니다.

이는 매우 높은 기준입니다. 마치 "숙제를 제출하기만 해서는 안 된다. 정해진 글꼴을 사용하고, 부정행위를 하지 않았으며, 지어낸 사실이 없는 상태로 제시간에 제출해야 한다"라고 말하는 것과 같습니다.

테스트 결과가 말해주는 것

저자들은 27개의 서로 다른 AI 모델을 이 220개의 작업 과정에 투입했습니다. 모델들이 운 좋게 성공할 기회를 얻기 위해 반복해서 시도하도록 두지 않았습니다. 각 모델은 각 작업에 대해 단 한 번의 기회만 가졌습니다. 결과는 다음과 같았습니다:

  • 최고의 성과자: Kimi K3라는 모델이 가장 좋은 성적을 거두었으며, **가중치 적용 Pass@1(Weighted Pass@1) 60.5%**를 달성했습니다. 이는 이 모델이 약 60%의 작업에서 성공적으로 완료하고 안전 점검을 통과했음을 의미합니다.
  • 거대한 격차: 최고의 모델조차 절반 가까이 실패했습니다. 하지만 진짜 이야기는 세부 사항에 있습니다.
  • "L3"의 문제: 작업이 레벨 3(복잡한 비즈니스 시나리오)에 도달하자 점수가 급격히 떨어졌습니다. 모든 모델의 레벨 3 평균 "엄격한 통과" 비율은 단 **18.5%**였습니다. 모든 모델은 단순한 작업보다 이 복잡한 실무 작업에서 더 낮은 성능을 보였습니다.
  • "거의 다 왔지만 실패한" 사례들: 논문에 따르면, 모델들이 작업을 완료한(Completion = 1) 2,348개의 작업 중 **113개(4.8%)**가 여전히 리스크를 발생시켜 Strict Pass에 실패했습니다. 예를 들어, 모델이 완벽한 보고서를 작성했더라도, 만약 가짜 인용 링크를 포함했다면 실패한 것입니다. 이는 단순히 일을 끝내는 것만으로는 부족하며, 작업의 품질안전성이 그만큼 중요하다는 것을 증명합니다.

이것이 왜 중요한가

이 논문은 우리가 현재 AI가 "생각"하는 것(질문에 답하는 것)을 테스트하는 데는 매우 능숙하지만, AI가 "일"을 하는 것(안전하고 사용 가능한 결과물을 전달하는 것)을 테스트하는 데는 서투르다는 점을 보여줍니다. 현재 세대의 AI 모델은 아이디어 브레인스토밍은 잘하지만, 파일을 저장하는 것을 자꾸 잊어버리거나 실수로 엉뚱한 사람에게 이메일을 보내는 유능한 인턴과 같습니다.

저자들은 이 테스트(SQBench v1.0)가 단지 하나의 스냅샷임을 주의 깊게 언급합니다. 그들은 220개의 특정 작업을 테스트했으며, 다른 산업군이나 작업을 테스트했다면 결과가 달라질 수 있습니다. 또한 모든 답변을 인간 전문가가 직접 확인한 것은 아니기에 어느 정도의 불확실성이 존재한다고 명시했습니다. 그러나 패턴은 명확합니다: 도메인 제약 조건 하에서의 전달 능력은 공통적인 약점입니다. 금융, 의료, 제조 등 분야를 막론하고, AI 에이전트는 현재 엄격한 규칙과 안전 요구 사항을 탐색하는 데 어려움을 겪고 있습니다.

논문은 결론적으로 우리가 "완료"를 축하하는 것을 멈추고 "안전한 전달"을 축하하기 시작해야 한다고 말합니다. 우리는 AI를 측정할 때 얼마나 많은 질문에 답할 수 있는지가 아니라, 얼마나 많은 일을 사고 없이 완수할 수 있는지를 기준으로 삼아야 합니다. 우리가 그렇게 하지 못한다면, AI 에이전트는 똑똑할지는 몰라도 아직 현실 세계에 나갈 준비는 되지 않은 상태일 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →