← 최신 논문
💻 computer science

Economic Evaluations of Language Models

이 논문은 언어 모델이 미국 내 직업 전반에 걸쳐 시간을 절약할 수 있는 잠재력을 평가하는 비용 효율적인 오픈 소스 평가 스위트이자 시뮬레이션 프레임워크인 EconEvals를 소개하며, 현재의 모델들이 거의 절반에 가까운 모든 직업에 상당한 영향을 미칠 수 있음에도 불구하고, 이들의 실제 도입은 기술적 능력보다는 개인정보 보호 우려와 독점적 시스템 장벽에 의해 현재 제한되어 있다는 점을 밝히고 있습니다.

원저자: Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

게시일 2026-07-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 매일 더 똑똑해지는 책들이 가득한 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 사서들(과학자들)은 이 새로운 초지능형 책들에게 수학 퍼즐을 풀게 하거나 코드를 작성하게 하며 테스트를 해왔습니다. 이는 마치 새로운 자동차가 트랙에서 경주에서 이길 수 있는지 확인하는 것과 같습니다. 하지만 문제는 여기에서 발생합니다. 현실 세계는 경주용 트랙이 아닙니다. 현실 세계는 배관을 고치는 일부터 병원을 운영하는 일까지 사람들이 수천 가지의 다양한 일을 하는, 무질서하고 복잡한 도시입니다. 모두가 던지는 큰 질문은 이것입니다: "이 AI 책들이 정말 똑똑하다면, 실제로 우리의 일상적인 업무에 얼마나 도움이 될 것인가? 시간을 아껴줄 것인가, 아니면 그저 선반 위에 놓여 있기만 할 것인가?"

이를 이해하기 위해서는 몇 가지를 알아야 합니다. 첫째, "벤치마크"가 있는데, 이는 AI를 위한 표준화된 시험과 같습니다. 만약 AI가 높은 점수를 받는다면, 그것은 특정 시험에 능숙하다는 것을 의미합니다. 둘도 "노출(exposure)"이 있습니다. 이는 "한 노동자의 하루 중 이 AI가 실제로 대신할 수 있는 부분이 얼마나 되는가?"라고 묻는 세련된 표현입니다. 마지막으로, AI가 테스트에서 할 수 있는 능력과 실제 세상에서 수행하는 능력 사이의 간극이 있습니다. 우리가 이 답을 알아야 하는 이유는, 이를 모르면 미래를 계획할 수 없기 때문입니다. 우리는 AI가 내일 당장 모든 것을 바꿀 것이라고 생각하거나, 혹은 아무것도 바꾸지 못할 것이라고 생각할 수 있는데, 두 가지 추측 모두 틀릴 수 있습니다.

이때, 추측하는 대신 측정을 시작하기로 한 스탠퍼드 대학교와 상파울루 대학교의 연구팀이 등장했습니다. 그들은 ECONEVALS라는 새로운 오픈 소스 툴킷을 구축했습니다. 이 툴킷을 미국 전체 직업 시장의 거대한 디지털 지도라고 생각해 보세요. 단순히 소프트웨어 엔지니어와 같은 몇몇 인기 있는 직업만 보는 대신, 그들은 1,000개 이상의 다양한 직업을 매핑하고 이를 거의 19,000개의 아주 작은 과업으로 세분화했습니다. 이는 "전화 받기"부터 "교량 설계하기"까지 노동자가 하는 모든 일을 확대해서 볼 수 있는 현미경을 가진 것과 같습니다.

연구팀은 까다로운 문제에 직면했습니다. 사람들이 업무 중에 AI에게 실제로 무엇을 묻는지 알아내야 했지만, 그러한 데이터의 대부분은 비공개이기 때문입니다. 그래서 그들은 두 가지 방법을 사용했습니다. 첫 첫째, 수백만 건의 공개된 대화를 뒤져 실제 업무 관련 질문들을 찾아냈습니다. 둘째, 특정 직업에 대한 실제 데이터를 찾을 수 없을 때는 "합성(synthetic)" 데이터를 생성했습니다. 로봇 배우가 간호사, 교사 또는 건설 노동자 역할을 맡아 자신의 일상적인 업무에 대해 AI에게 도움을 요청하는 상황을 상상해 보세요. 그들은 이 실제 데이터와 역할극 데이터의 혼합을 사용하여 10가지 AI 모델을 테스트했습니다.

결과는 어떠했을까요? 결과는 마치 "잠재력 대 현실" 이야기와 같습니다. 연구진은 현재의 AI 모델들이 업무를 돕는 데 상당히 유능하다는 것을 발견했습니다. 실제로 그들의 시뮬레이션에 따르면, **전체 미국 직업의 47%**에 대해 AI는 노동자들이 일상 과업의 적어도 절반 정도에서 상당한 시간을 절약할 수 있게 해줄 수 있습니다. 이는 노동 인구의 엄청난 부분입니다!

하지만 반전이 있습니다. AI가 그 일을 할 수 있다고 해서 사람들이 그 일을 위해 AI를 사용하고 있다는 뜻은 아닙니다. 연구팀은 AI가 이론적으로 많은 시간을 아껴줄 수 있는 과업의 **79%**에서, 사람들이 클로드(Claude)와 같은 도구를 실제로 많이 사용하지 않고 있다는 것을 발견했습니다. 이는 마치 차고에 시속 200마일로 달릴 수 있는 페라리를 가지고 있으면서도, 속도가 두렵거나 기어 변속법을 몰라서 우편함까지 가는 데만 운전하고 있는 것과 같습니다.

그렇다면 무엇이 우리로 하여금 AI를 더 많이 사용하지 못하게 막고 있는 걸까요? 연구진은 왜 특정 과업에서 AI가 시간을 아껴주지 못하는지를 정확히 파헤치는 특별한 시뮬레이션을 실행했습니다. 그들은 가장 큰 병목 현상이 AI가 너무 멍청해서가 아니라, 현실 세계가 너무 복잡하기 때문이라는 것을 발견했습니다. AI가 아직 도움을 줄 수 없는 주요 이유는 다음과 같습니다:

  • 물리적 행동: AI는 망치를 들거나 새는 파이프를 고칠 수 없습니다.
  • 개인정보 보호: AI에게 개인 의료 기록이나 법률 파일을 읽게 할 수는 없습니다.
  • 독점 시스템: 많은 기업이 AI가 연결될 수 없는 오래되고 비밀스러운 소프트웨어를 사용합니다.
  • 실시간 상호작용: AI는 상황이 즉각적으로 변하는 실시간 대면 대화에 어려움을 겪습니다.

또한, 이 논문은 그들의 새로운 상세한 방법론을 기존의 AI 측정 방식과 비교했습니다. 기존 방식은 초능력 목록을 보고 "이 AI는 모든 것을 할 수 있다!"라고 말하는 것과 같았습니다. 새로운 방식은 실제로 AI가 그 일을 하려고 시도하는 모습을 지켜보며 어디에서 발을 헛디디는지 보는 것과 같습니다. 그들은 기존 방식이 너무 낙관적이어서 AI가 직업의 **68%**를 도울 수 있다고 예측한 반면, 자신들의 더 현실적인 시뮬레이션은 그 수치가 **47%**에 더 가깝다고 제안한다는 것을 발견했습니다.

요약하자면, 이 논문은 AI가 우리의 업무를 도울 준비가 된 강력한 도구이지만, 개인정보 보호 규칙이나 물리적인 손의 필요성과 같은 현실 세계의 장애물 때문에 우리가 아직 사용하지 못하고 있다는 것을 알려줍니다. 연구진은 지도를 만들고 측정 기준을 구축하여, AI가 더 똑똑해짐에 따라 업데이트할 수 있도록 했으며, 이를 통해 단순히 추측하는 것이 아니라 기술이 다음에 어디에 착륙할지를 정확히 이해할 수 있게 해주었습니다. 그들은 AI가 경제 문제를 해결했다고 말하는 것이 아니라, 어디에 도로 차단기가 있고 어디에 개방된 차선이 있는지에 대한 훨씬 더 명확한 그림을 제시한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →