← 최신 논문
🤖 machine learning

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

본 논문은 불필요할 때도 도구 호출을 선호하는 LLM 에이전트의 내재적 과도 호출 편향을 식별하고 그 기작을 설명하며, 이러한 편향이 Sparse Autoencoders 를 사용하여 인과적으로 교정되어 호출 성능을 희생하지 않으면서도 전반적인 의사결정 정확도를 향상시킬 수 있음을 입증한다.

원저자: Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 열정적인 도구를 사랑하는 조수를 상상해 보세요. 당신이 무언가를 요청하면 그들은 즉시 도구 상자에 손을 뻗칩니다. 문제는 그들이 도구가 필요하지 않을 때조차 도구를 집어 들거나, 올바르게 사용하기 위해 필수적인 정보가 부족할 때도 도구를 집어 든다는 점입니다.

이 논문은 왜 이런 일이 발생하는지, 그리고 이를 어떻게 해결할 수 있는지 조사합니다. 이를 간단한 용어로 설명하면 다음과 같습니다:

문제: "과도하게 열성적인" 조수

연구자들은 Qwen, Gemma, Ministral 등 여러 고급 AI 모델을 분석하여 일관된 결함을 발견했습니다: 과도한 호출 (Over-calling).

  • 좋은 소식: AI 가 도구를 사용해야 할 때 (예: 날씨 확인) 는 매우 잘 수행합니다. '호출 정확도 (Call Accuracy)'는 거의 100% 의 정확도를 보입니다.
  • 나쁜 소식: AI 가 도구를 사용해서는 안 될 때 (예: 사용자의 요청이 모호하여 먼저 명확화가 필요한 경우) 도구를 호출하는 경우가 많습니다. '비호출 정확도 (No-Call Accuracy)'는 매우 낮습니다.

비유: 이는 당신이 주문했을 때 음식을 가져오는 속도가 매우 빠른 웨이터와 같습니다. 하지만 메뉴만 요청했을 때 스테이크를 가져오거나, 목이 마르다고 말하기도 전에 음료를 가져오는 경우입니다. 그들은 '무언가를 하는 것'에 너무 열성적이어서 그 일이 실제로 필요한지 확인하는 것을 잊어버립니다.

진단: 보이지 않는 '편향 가중치'

연구자들은 AI 가 왜 이렇게 열성적인지 알고 싶어 했습니다. 그들은 단순히 AI 의 답변을 본 것이 아니라, **희소 오토인코더 (Sparse Autoencoder, SAE)**라는 도구를 사용하여 AI 의 '뇌' (내부 수학) 를 들여다보았습니다. SAE 는 AI 가 결정을 내리는 데 사용하는 특정 '스위치'나 '특성'을 볼 수 있게 해주는 고출력 현미경과 같다고 생각할 수 있습니다.

그들은 놀라운 사실을 발견했습니다:

  1. '활성화' 이론: 일반적으로 AI 는 '호출' 신호가 '호출하지 않음' 신호보다 더 클 때 도구를 호출한다고 생각할 것입니다.
  2. 현실 (내재적 편향 가설): 연구자들은 '호출' 신호와 '호출하지 않음' 신호가 정확히 동일한 경우 (동점) 에도 AI 가 여전히 호출을 선택한다는 사실을 발견했습니다.

비유: 한쪽에는 '호출' 무게가, 다른 쪽에는 '호출하지 않음' 무게가 있는 저울을 상상해 보세요.

  • 무게가 같다면 일반적인 저울은 균형을 유지합니다.
  • 하지만 이 AI 의 저울은 '호출' 쪽에 숨겨진 보이지 않는 무게가 붙어 있습니다. 보이는 무게가 같더라도 저울은 '호출' 쪽으로 기울어집니다.
  • 저울이 균형을 맞추거나 '호출하지 않음' 쪽으로 기울게 하려면, 그 숨겨진 편향을 극복하기 위해 실제로 '호출하지 않음' 쪽에 더 많은 무게를 올려야 합니다.

해결책: '편향 상쇄' 조정

그들이 이 보이지 않는 무게를 발견한 후, **AMCS (적응형 마진 보정 조향, Adaptive Margin-Calibrated Steering)**라는 해결책을 만들었습니다.

비유: 그들은 보이지 않는 '호출' 편향이 얼마나 무거운지 정확히 알았기 때문에, 이를 상쇄할 '반대 무게'를 만들었습니다.

  • 그들은 AI 를 다시 훈련시키지 않았습니다 (이는 시간이 매우 오래 걸리고 다른 것들을 망칠 수 있습니다).
  • 대신, AI 가 결정을 내리기 직전일 때마다 내부 신호에 미세하고 정밀한 수학적 자극을 가했습니다.
  • 이 자극은 숨겨진 무게를 제거하여 저울이 올바르게 균형을 잡을 수 있게 했습니다.

결과

이 해결책을 테스트했을 때:

  • 오류 감소: AI 는 필요하지 않을 때 도구를 호출하는 것을 멈췄습니다 ('과도하게 열성적인' 문제를 해결).
  • 업무 능력 유지: 도구를 사용해야 할 때는 여전히 잘 수행했습니다. '호출 정확도'는 높게 유지되었습니다.
  • 전체적 개선: AI 의 전체 성능 점수가 크게 향상되었습니다.

요약

이 논문은 AI 에이전트가 도구를 언제 사용해야 하는지 단순히 '혼란스러운' 것이 아니라, 추가 정보를 요청하는 것보다 도구 호출을 선호하게 만드는 내재된 기계적 편향이 있다고 주장합니다. '현미경'을 사용하여 이 편향을 찾고 '반대 무게'로 상쇄함으로써, 처음부터 다시 가르치지 않고도 AI 를 더 신뢰할 수 있게 만들었습니다.

이 논문이 주장하지 않는 것:

  • 이는 모든 AI 환각이나 추론 오류를 해결한다고 주장하지 않으며, 오직 도구를 언제 호출할지에 대한 특정 문제만 다룹니다.
  • 이는 영구적인 훈련 수정이라고 주장하지 않으며, AI 가 실행되는 동안 적용되는 실시간 조정입니다.
  • 의료나 임상적 용도에 대해서는 논의하지 않으며, 초점은 엄격하게 도구 사용 벤치마크에 맞춰져 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →