OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
이 논문은 LLM 에이전트를 평가하기 위해 경제적 근거(인간의 노동 시간 및 작업 가격)를 갖춘 100개의 장기 오피스 스위트 작업을 포함하는 새로운 벤치마크인 OmegaUse-OfficeVal을 소개하며, 현재의 모델들이 인간보다 현저히 저렴하고 빠르기는 하지만 작업 완수에 있어 여전히 인간 수준의 품질을 달성하는 데에는 미치지 못한다는 점을 밝히고 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 당신이 버튼을 클릭하기를 기다리는 것이 아니라, 실제로 당신을 대신해 업무를 수행하는 세상을 상상해 보십시오. 이것이 바로 "AI 에이전트"의 꿈입니다. AI 에이전트는 당신의 지시를 읽고, 파일을 열고, 마치 디지털 인턴처럼 업무를 완수할 수 있는 스마트한 프로그램입니다. 한동안 이 에이전트들은 단일 이메일을 작성하거나 짧은 기사를 요약하는 것과 같은 짧고 단순한 기술에는 뛰어난 모습을 보여왔습니다. 하지만 이들의 진정한 힘을 시험하는 관건은, 엉망인 보고서를 가져와 형식을 재조정하고, 차트를 추가하며, 파일을 망가뜨리거나 혼란에 빠지지 않고 완벽하게 저장하는 등 하루치 사무 업무 전체를 처리할 수 있는지 여부입니다. 연구자들이 던지는 핵심 질문은 이것입니다: 이 디지털 노동자들이 실제로 직무를 수행할 수 있는가, 그리고 실제 인간을 고용하는 것과 비교했을 때 그만한 비용을 지불할 가치가 있는가?
여기에 바이두(Baidú)의 연구진이 정확히 이 점을 테스트하기 위해 설계한 새로운 "성적표"인 OmegaUse-OfficeVal이 등장했습니다. 그들은 단순히 가짜의 쉬운 과제를 만든 것이 아니라, 깨진 스프레드시트를 수정하거나 초안을 다듬어진 발표 자료로 만드는 것과 같은 100가지의 실제 세계 사무 과제를 바탕으로 벤치마크를 구축했습니다. 이 테스트가 특별한 이유는 모든 과제에 "가격표"를 붙였다는 점입니다. 그들은 인간이 해당 과제를 수행하는 데 걸린 정확한 시간과 누군가를 고용하는 데 드는 비용을 측정했습니다. 그런 다음 세계에서 가장 똑똑한 여러 AI 모델들이 동일한 퍼즐을 해결하도록 했습니다. 결과는 어떠했을까요? AI 에이전트는 믿기지 않을 정도로 빠르고 저렴했습니다. 종종 몇 분 만에 단 몇 센트의 비용으로 업무를 끝냈지만, 최종 결과물을 신뢰하기에는 여전히 실수가 너무 많았습니다. 그들은 나아지고는 있지만, 아직 신뢰할 수 있는 수준의 숙련된 주니어 직원 단계에는 도달하지 못했습니다.
설정: 디지털 장애물 경주
연구자들이 무엇을 했는지 이해하려면, 사무실을 거대하고 어지러운 작업장이라고 생각하십시오. 과거에 AI를 테스트하는 것은 블록 몇 개를 쌓으라고 요청하는 것과 같았습니다. 블록 하나만 떨어뜨려도 실패였습니다. 하지만 실제 사무 업무는 처음부터 복잡한 케이크를 굽는 것과 더 비슷합니다. 재료(파일)를 모아야 하고, 레시피(지시 사항)를 따라야 하며, 만약 프로스팅을 태워버리면 케이크 전체를 망치게 됩니다.
연구진은 이러한 "케이크 굽기" 과제들을 포함하는 OmegaUse-OfficeVal이라는 데이터셋을 만들었습니다. 이것들은 단순히 "시 한 편 써줘"와 같은 요청이 아니었습니다. 워드 문서, 파워포인트 슬라이드, 엑셀 스프레드시트를 포함하는 길고 다단계적인 작업들이었습니다. 어떤 과제들은 인간이 완료하는 데 평균 2.32시간이 걸렸습니다. 컴퓨터가 집중력을 유지하기에는 꽤 긴 시간입니다!
이 벤치마크가 독특한 점은 "경제적 근거"를 갖추었다는 것입니다. 연구진은 단순히 "AI가 과제를 마쳤는가?"라고 묻지 않았습니다. 대신 "얼마나 많은 가치를 창출했는가?"를 물었습니다. 이를 위해 그들은 모든 과제에 대해 두 가지를 추적했습니다:
- 인간 노동 시간: 실제 사람이 수행하는 데 걸린 시간.
- 과제 가격 대리 지표: 프리랜서를 고용했을 때 해당 과제에 드는 비용의 대략적인 추정치 (과제당 약 29.22 사이).
이를 통해 그들은 AI를 단순히 속도 측면에서뿐만 아니라, 실제로 돈을 아껴주는지 아니면 그저 값싼 실수를 반복하는지를 비교할 수 있었습니다.
테스트: AI 대 인간 인턴
연구진은 최고 수준의 여러 AI 모델을 "인간 베이스라인"과 맞붙였습니다. 이 베이스라인은 CEO나 천재가 아니라, 숙련된 주니어 직원이나 인턴이었습니다. 인간들에게는 AI와 동일한 지시 사항과 파일이 주어졌고, 업무를 수행하도록 요청되었습니다.
결과를 채점하기 위해, 연구진은 단순히 사람이 최종 파일을 보고 "좋아 보인다!"라고 말하게 하지 않았습니다. 그것은 너무 느리고 주관적입니다. 대신 그들은 **코드 기반 검증기(code-based verifiers)**를 작성했습니다. 로봇 검사관이 최종 파일을 자동으로 점검한다고 상상해 보십시오. 로봇은 문서를 열고, 표지 페이지가 있는지 확인하고, 차트 크기가 적절한지 세어보고, 텍스트가 실수로 삭제되지 않았는지 확인합니다. 만약 파일이 손상되었거나 핵심 부분이 누락되었다면, 로봇은 0점을 부여합니다. 이 방식은 테스트를 공정하고, 빠르며, 반복 가능하게 만들었습니다.
결과: 빠르고 저렴하지만, 완벽하지는 않다
결과가 나왔을 때, 결과는 명확한 이야기를 들려주었습니다.
인간 베이스라인:
인간 작업자들은 가능한 만점 중 평균 27.79점을 받았습니다. 그들은 신뢰할 수 있었습니다. 파일을 거의 망가뜨리지 않았으며, 대부분의 세부 사항을 정확하게 수행했습니다. 하지만 시간과 비용이 들었습니다. 평균적으로 인간의 과제 비용은 약 $6.86이었고, 시간은 2.32시간이 소요되었습니다.
AI 에이전트:
AI 모델들은 다른 이야기였습니다. 그들은 번개처럼 빨랐고 믿을 수 없을 정도로 저렴했습니다.
- 속도: 가장 빠른 AI(DeepSeek-V4-Pro)는 단 0.184시간(약 11분) 만에 과제를 마쳤습니다.
- 비용: 가장 저렴한 AI(Qwen3.7-Plus)는 과제당 단 $0.2152가 들었습니다. 커피 한 잔 값보다 저렴합니다!
하지만 여기에는 함정이 있습니다: 그들은 업무 수행 능력이 그리 좋지 않았습니다.
가장 뛰어난 AI 모델(GLM-5.2)의 점수는 17.91에 불과했습니다. 이는 인간의 점수인 27.79보다 현저히 낮습니다. AI는 더 빠르고 저렴했지만, 실수가 더 많았습니다. 목차 추가를 잊거나, 서식을 망가뜨리거나, 열 수 없는 파일을 만드는 경우가 빈번했습니다.
연구진은 AI가 가장 어렵고 긴 과제에서 가장 고전한다는 것을 발견했습니다. 인간이 작업하는 데 오랜 시간(2시간 이상)이 걸리는 과제의 경우, AI의 성능은 더욱 떨어졌습니다. AI는 빠른 간단한 작업에는 뛰어나지만, "장기적 관점(long-horizon)"의 계획이 복잡해지면 길을 잃는 것으로 보입니다.
결론: 아직은 주연급이 될 준비가 되지 않았다 (아직은)
이 연구는 우리가 AI 사무 업무의 "계곡"에 있음을 시사합니다. 이 기술은 매우 저렴하고 빠르기 때문에 분명히 유용합니다. 초안이나 빠른 요약이 필요하다면 AI는 환상적인 도구입니다. 하지만 고객에게 보낼 준비가 된 세련되고 전문적인 문서를 원한다면, AI는 아직 그 수준에 도령하지 못했습니다.
저자들은 AI가 이미 사무 업무를 해결했다는 생각을 명시적으로 부정했습니다. 그들은 AI가 "실질적으로 더 저렴하고 빠르지만", "아직 인간 수준의 결과물 품질에 도달하지 못했다"는 점을 보여주었습니다. 최종 품질 측면에서 인간 작업자와 AI 에이전트 사이의 격차는 여전히 넓습니다.
하지만 논문은 미래에 대해 낙관적입니다. 실제 경제 데이터를 활용한 엄격한 테스트를 구축함으로써, 연구진은 로드맵을 만들었습니다. 그들은 AI가 어디에서 실패하는지(긴 작업, 복잡한 서식 등)를 정확히 알고 있으며, 이제 그 특정 문제들을 해결하기 위해 노력할 수 있습니다. 현재로서는 파트너십이 최선의 전략으로 보입니다. AI가 힘든 작업과 빠른 초안 작성을 맡게 하되, 인간이 과정에 참여하여 최종 결과물을 점검하고 실수를 바로잡는 것입니다. AI가 업무 전체를 알아서 처리하는 "바이브 워킹(vibe working)"의 꿈은 여전히 진행 중이지만, 그 여정은 공식적으로 시작되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.