← 최신 논문
🤖 AI

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

이 논문은 LLM 에이전트에 절차적 기술을 추가하는 것이 설명 삼투(description osmosis), 접지 변위(grounding displacement), 그리고 검증 변위(verification displacement)로 인해 종종 상당한 성능 저하를 일으킨다는 것을 밝히며, 신뢰성은 절차적 가이드를 최적화하는 것보다 접지와 검증을 개선하는 것에 더 달려 있다고 주장한다.

원저자: Darshan Tank, Baran Nama

게시일 2026-07-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Darshan Tank, Baran Nama

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 숙제를 대신 해줄 아주 똑똑한 로봇 비서에게 가르침을 주고 있다고 상상해 보세요. 당신은 로봇에게 "스프레드시트에서 숫자 찾는 법"이나 "재무 보고서를 읽는 법"과 같이 특정 문제를 해결하는 방법이 담긴 '기술(skills)'—즉, 작은 치트 시트나 규칙 책—을 줍니다. 인공지능의 세계에서 이것들은 **LLM 에이전트(LLM Agents)**라고 불리며, 목표는 이들을 실제 업무에 더 능숙하게 만드는 것입니다. 오랫동안 과학자들은 이 로봇에게 기술을 주었을 때 얼마나 더 많은 과제를 성공했는지를 단순히 숫자로 세어 성공 여부를 측정했습니다. 그것은 "다다익선"의 게임이었습니다. 하지만 마치 사람에게 새롭고 복잡한 설명서를 주면 때때로 그 사람이 혼란에 빠져 예전에 잘하던 것까지 망치게 되는 것처럼, AI에게 너무 많은 기술을 주는 것도 역효과를 낼 수 있습니다. 연구자들이 던지는 핵심적인 질문은 이것입니다: 우리가 기술을 추가할 때, 실제로 도움을 주고 있는 걸까요, 아니면 이미 잘 작동하던 것들을 실수로 망가뜨리고 있는 걸까요?

"The Regression Tax(회귀세)"라는 제목의 이 논문은 바로 그 문제에 대해 깊이 파고듭니다. 저자인 다샨 탱크(Darshan Tank)와 바란 나마(Baran Nama)는 사무 업무(재무 문서 읽기나 스프레드시트 수정 등)를 해결하기 위한 거의 6,000가지의 서로 다른 시도를 수행하며 대규모 실험을 진행했습니다. 그들은 세 가지 서로 다른 AI 모델을 사용하여, 새로운 기술을 가진 로봇의 성과와 기술이 전혀 없는 상태에서의 성과를 비교했습니다.

여기서 반전이 있습니다. 기술을 추가하는 것은 단순히 승리를 더하는 것이 아니라, 승리를 훔치기도 한다는 것입니다.

이것을 비디오 게임처럼 생각해 보세요. 당신은 고전하던 보스를 물리치기 위해 새로운 "파워업(기술)"을 발견합니다. 좋습니다! 하지만 그 똑같은 파워업 때문에 예전에 쉽게 뛰어넘던 돌부리에 걸려 넘어질 수도 있습니다. 저자들은 이를 **"회귀세(Regression Tax)"**라고 부릅습니다. 그들은 로보가 기술 덕분에 해결하게 된 새로운 과제 100개당, 원래 스스로 충분히 해결했을 과제 약 59개를 실제로 망가뜨린다는 사실을 발견했습니다. 즉, 새로운 승리만을 센다면 실제 개선 효과는 보이는 것보다 훨씬 작습니다.

논문은 이 기술들이 로봇을 실수하게 만드는 세 가지 교묘한 방식을 밝혀냈습니다:

  1. 기술-설명 삼투 현상 (The "Ghost" Effect - "유령" 효과): 당신의 책상 위에 규칙 책이 놓여 있다고 상상해 보세요. 설령 당신이 그 규칙 책을 한 번도 펼쳐보거나 지침을 읽지 않더라도, 단지 "세금 계산하는 법"이라는 제목을 보는 것만으로도 당신을 긴장하게 만들어 수학 문제를 푸는 방식을 바꿀 수 있습니다. 저자들은 기술의 설명이 로봇의 기억 속에 존재하는 것만으로도(로봇이 실제로 그 기술을 사용하지 않더라도) 로봇의 행동을 변화시키고 실패를 유발할 수 있다는 것을 발견했습니다. 마치 로봇이 기술의 '분위기'를 삼투 현상처럼 흡수하여 그 존재만으로 혼란을 겪는 것과 같습니다.

  2. 접지 변위 (Grounding Displacement - "잘못된 지도" 문제): 이것은 기술이 로봇에게 무언가를 어떻게 할지 알려주지만, 그 과정에서 로봇이 문제의 엉뚱한 부분을 보게 만들 때 발생합니다. 이는 운전자에게 완벽한 운전 지침을 주었지만, 그 지침 때문에 운전자가 엉뚱한 출구 표지판을 보게 만드는 것과 같습니다. 로봇은 절차를 완벽하게 따르지만, 기술이 올바른 시작점을 찾는 능력을 "변위(displacement)"시켰기 때문에 결국 엉뚱한 곳에 도달하게 됩니다.

  3. 검증 변위 (Verification Displacement - "확인 부재" 구역): 이것은 기술이 로봇에게 안전 점검을 건너뛰라고 지시할 때 발생합니다. 로봇이 일을 마친 후 결과물을 제출하기 전에 보통 검토를 한다고 가정해 봅시다. 새로운 기술이 "그냥 빠르게 해!"라고 말하면 로봇은 자신의 답을 확인하는 것을 잊어버릴 수 있습니다. 수학적 계산은 맞을지 몰라도, 결과를 검증하지 않았기 때문에 실패하게 됩니다.

저자들은 또한 현재 우리가 기술을 만드는 방식이 다소 어긋나 있다는 점도 발견했습니다. 대부분의 기술 제작자들은 "중간" 부분, 즉 단계별 절차를 쓰는 데 집중합니다. 하지만 데이터는 진짜 문제가 발생하는 지점이 시작(정보를 찾는 것, 즉 "접지/grounding")과 (답을 확인하는 것, 즉 "검증/verification")이라는 것을 보여줍니다. 기술은 로봇에게 무엇을 해야 하는지는 잘 알려주지만, 로봇이 어디를 봐야 하는지 또는 자신의 답이 맞는지를 아는 능력은 오히려 떨어뜨리는 경우가 많습니다.

요약하자면, 이 논문은 우리가 단순히 AI가 얼마나 더 많은 과제를 잘하게 되었는지만 세어서는 안 된다고 제안합니다. 우리는 기술을 추가함으로써 로봇이 기존에 알고 있던 것들을 망가뜨리며 지불하게 되는 "세금"을 반드시 살펴봐야 합니다. AI를 진정으로 신뢰할 수 있게 만들기 위해서는, 단순히 더 많은 절차를 쓰는 것을 멈추고 로봇이 지도를 읽고 자신의 작업을 확인하는 능력을 키울 수 있도록 도와줘야 합니다. 저자들은 만약 우리가 이러한 특정 "접지" 및 "검증" 문제를 해결한다면, 현재 실패하고 있는 수많은 과제를 다시 되살릴 수 있을 것이라고 제 제안합니다. 중요한 것은 더 많은 기술을 갖는 것이 아니라, 로봇을 넘어뜨리지 않는 올바른 종류의 도움을 주는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →