← 최신 논문
💬 NLP

ORCA-bench: How Ready Are Language Model Agents for Oncall?

이 논문은 온콜(oncall) 근본 원인 분석 작업에서 언어 모델 에이전트를 평가하기 위한 프로덕션 수준의 벤치마크인 ORCA-bench를 소개하며, 가장 진보된 프런티어 모델들조차 현재 낮은 정확도(중간 난이도에서 25.3%)를 기록하고 환각 현상으로 어려움을 겪고 있음을 밝혀, 이들이 실제 운영 환경의 신뢰성을 안전하게 책임지기까지 상당한 격차가 존재함을 시사한다.

원저자: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 첨단 기술이 집약된 우주선을 타고 은하계를 항해하는 함장이라고 상상해 보십시오. 갑자기 우주선의 컴퓨터가 이상하게 작동하기 시작합니다. 조명이 깜빡거리고, 중력이 불안정해지며, 커피 머신에서는 불꽃이 튀어 나옵니다. 정확히 무엇이 잘못되었는지는 알 수 없지만, 배가 위험에 처했다는 것만은 알고 있습니다. 현실 세계에서 이 우주선들은 우리가 매일 사용하는 웹사이트나 앱이며, 그들의 '함장'은 사이트 신뢰성 엔지니어(SRE)라고 불리는 특별한 엔지니어들입니다. 그들의 업무는 "결제 버튼이 작동하지 않는다"라거나 "사이트가 느리다"와 같은 모호한 불만 사항으로부터 시작하여, 왜 문제가 발생했는지 파고드는 것입니다. 그들은 전체 시스템이 붕괴하기 전에 단 하나의 고장 난 부품을 찾아내기 위해 트래픽 로그, 에러 메시지, 코드와 같은 산더미 같은 디지털 단서들을 뒤져야 합니다.

오랫동안 사람들은 인공지능(AI), 특히 대규모 언어 모델(LLM)을 사용하여 컴퓨터에게 이러한 탐정 업무를 가르치려고 노력해 왔습니다. 이들은 이야기를 쓰거나, 질문에 답하거나, 심지어 코드를 작성하는 데 도움을 줄 수 있는 똑똑한 컴퓨터들입니다. 핵심적인 질문은 모두가 던지고 있는 질문입니다. "이 AI 탐정들이 실전에 투입되어, 무언가 잘못되었을 때 우리의 실제 시스템을 고칠 준비가 되었는가?" 이것은 매우 중요한 문제입니다. 왜냐하면 AI가 잘못 추측할 경우, 작은 결함이 거대한 재앙으로 번질 수 있기 때문입니다.

ORCA-BENCH라는 제목의 이 논문은 바로 그 점을 테스트하기 위해 거대하고 현실적인 훈련장을 구축했습니다. 연구진은 실제 바쁜 웹사이트처럼 엄청난 양의 디지털 노이즈를 생성하며 6일 동안 운영되는, 매우 상세하게 설계된 가상의 온라인 상점("Astronomy Shop")을 만들었습니다. 그런 다음 그들은 시스템의 무언가를 몰래 고장 낸 1,079개의 서로 다른 "미스터리 사건"을 만들고, 현존하는 가장 똑똑한 다섯 가지의 AI 에이전트에게 이 사건을 해결하도록 요청했습니다. 그들은 AI에게 인간 엔지니어가 사용하는 것과 동일한 도구들, 즉 라이브 데이터 스트림, 소스 코드, 그리고 모호한 사용자 불만 사항에 대한 접근 권한을 부여했습니다.

결과는 어떠했을까요? AI 탐정들은 아직 한창 훈련 중인 상태였습니다. 가장 뛰어난 AI 모델조차 "중간 난이도" 사례의 약 **25%**만을 정확히 해결할 수 있었으며, 가장 어려운 사례에서는 겨우 **10%**를 해결하는 데 그쳤습니다. 이를 이해하기 쉽게 설명하자면, 만약 인간 엔지니어가 시험에서 10%의 점수를 받았다면 해고되었겠지만, 이 AI들에게는 이것이 현재의 최첨단 수준(state of the art)입니다. 논문은 AI가 소스 코드를 볼 수 없을 때 성능이 더욱 저하된다는 것을 발견했습니다. 아마도 가장 우려스러운 점은, AI가 자주 "환각(hallucination)" 현상을 보였다는 것입니다. 즉, 존재하지도 않는 문제에 대해 확신을 가지고 가짜 이유를 지어냈다는 것입니다. 한 사례에서, 한 AI는 사용자의 장바구니가 작동하지 않는 원인을 분석하면서 실제 범인을 완전히 놓친 채, 테스트 도구의 브라우저 충돌 때문이라고 탓하기도 했습니다.

저자들은 이러한 AI 에이전트들이 코드를 작성하는 데는 인상적이지만, 실제 라이브 시스템의 안전을 맡길 만큼 신뢰할 수 있는 단계는 아직 아니라고 결론지었습니다. AI가 할 수 있는 것과 인터넷을 안전하게 유지하기 위해 필요한 것 사이의 간극은 여전히 매우 큽니다. 이 논문은 AI가 "온콜(on-call, 비상 대기)" 교대 근무를 맡기 전에, 그들을 신뢰할 수 있게 만들기 위한 훨씬 더 많은 엔지니어링 작업이 필요하다고 제안합니다. 왜냐로 현재의 AI는 미스터리를 해결하기보다는 잘못 추측할 가능성이 더 높기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →