← 최신 논문
💬 NLP

Not All Skills Help: Measuring and Repairing Agent Knowledge

이 논문은 특정 작업에 부정적인 인과적 효과를 미치는 개별 기술들을 경험적으로 측정하고 선택적으로 억제함으로써, 가중치 업데이트 없이도 최첨단 성능을 달성하여 LLM 에이전트의 성능을 향상시키는 프레임워크인 ASSAY를 소개한다.

원저자: Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "나쁜 조언" 문제

당신이 매우 똑똑하지만 경험이 부족한 조수(AI 에이전트)에게 집안일을 가르치고 있다고 상상해 보세요. 당신은 이렇게 말합니다. "여기 내가 예전에 이 일들을 하면서 배웠던 100가지 팁이 있어."

현재 AI가 작동하는 방식은 이 목록을 완전히 신뢰한다는 것입니다. 만약 어떤 팁이 한 가지 작업에 좋았다면, 그것은 모든 작업에도 좋을 것이라고 가정합니다. AI는 새로운 일을 시작하기 전에 목록 전체를 읽습니다.

이 논문은 이것이 실수라고 주장합니다. 케이크를 굽는 데 도움이 되는 팁이 배관을 고치는 데도 도움이 된다는 보장은 없습니다. 사실, 파이프를 고치려고 하는데 "베이킹 팁"을 읽고 있으면 주의가 분산되어 일을 그르칠 수도 있습니다.

저자들은 이를 **"인과적 이질성(Causal Heterogeneity)"**이라고 부릅니다. 쉬운 말로 하면: 한 가지 작업에는 도움이 되는 기술이 다른 작업에서는 오히려 방해가 될 수 있다는 뜻입니다.

해결책: ASSAY (기술 필터)

연구진은 ASSAY라는 새로운 시스템을 구축했습니다. 이것은 AI의 지침서를 위한 스마트한 편집기라고 생각하면 됩니다. AI가 무엇을 남길지 스스로 판단하도록 무작정 믿는 대신, ASSAY는 과학적인 실험을 통해 모든 팁을 테스트합니다.

ASSAY의 작동 방식은 세 가지 간단한 단계로 나뉩니다.

1. "무작위 마스킹(Randomized Masking)" 실험 (맛 테스트)

50가지 재료가 들어간 수프가 있다고 상상해 보세요. 당신은 "카옌 페퍼(cayenne pepper)"가 실제로 풍미를 높이는지 알고 싶습니다.

  • 기존 방식: 요리사에게 "카옌 페퍼가 좋나요?"라고 묻습니다. 요리사는 "네, 매콤해요!"라고 답합니다. (하지만 요리사가 그냥 매운 음식에 익숙한 것일 수도 있습니다.)
  • ASSAY 방식: 블라인드 테스트를 진행합니다.
    • 12그릇의 수프를 만듭니다.
    • 어떤 그릇에는 카옌 페퍼를 넣고, 다른 그릇에는 넣지 않습니다.
    • 모두 맛을 봅니다.
    • 결과: 카옌 페퍼가 평균적으로 수프의 맛을 얼마나 돕거나 해쳤는지 정확히 계산합니다.

논문에서 이들은 AI 작업에 이 방식을 적용합니다. 다양한 "기술(팁)"을 무작위로 숨겨보고, AI가 성공하는지 실패하는지를 봅니다. 이를 통해 각 기술에 대한 점수를 매깁니다.

  • 초록색 점수: 이 기술은 도움이 됩니다.
  • 빨간색 점수: 이 기술은 방해가 됩니다.
  • 함정: 어떤 기술들은 점수가 0에 가깝습니다. 이는 50%의 작업에서는 도움이 되고 나머지 50%에서는 방해가 되기 때문입니다. 단순한 관찰자에게는 쓸모없어 보일 수 있지만, ASSAY에게 이들은 예측 불가능하기 때문에 위험한 기술로 보입니다.

2. "오프라인 재구조화(Offline Restructuring)" (지침서 편집)

점수를 얻은 후, 기술 라이브러리를 정리합니다.

  • 분리(Split): 만약 어떤 기술이 "때로는 좋고 때로는 나쁘다면", 이를 다시 작성합니다. 예를 들어 "항상 연락처를 확인하라"를 "계산서를 나눌 때만 연락처를 확인하라"로 바꿉니다.
  • 퇴출(Retire): 전혀 도움이 되지 않는 지루한 기술(점수가 0에 가까운 경우)은 버립니다.
  • 병합(Merge): 같은 내용을 말하는 두 개의 팁이 있다면 하나로 합칩니다.

3. "태스크별 마스킹(Per-Task Masking)" (입구의 스마트 필터)

이것이 가장 중요한 부분입니다. 지침서를 깨끗하게 정리한 후에도, AI는 매번 모든 것을 읽지 않습니다.

  • 시나리오: 당신은 커피 그라인더를 사려고 합니다.
  • 문제: 당신의 지침서에는 "Spotify 재생 목록 확인하기"라는 팁이 있습니다. AI가 그라인더를 사는 동안 이 내용을 읽으면, 주의가 분산되어 실패할 수 있습니다.
  • ASSAY의 해결책: AI가 작업을 시작하기 전, ASSAY는 작업 설명을 살펴봅니다. 그리고 묻습니다. "과거 실험 결과에 따르면, 이 특정 작업에 방해가 될 기술은 무엇인가?"
  • 조치: 그것은 Spotify 팁을 조용히 차단(마스킹)합니다. 오직 "아마존 사이즈 확인" 팁만 통과시킵니다.

왜 이것이 중요한가 (결과)

연구진은 두 가지 큰 도전 과제인 AppWorld(앱 사용 시뮬레이션)와 τ-bench(고객 서비스 시뮬레이션)에서 이를 테스트했습니다.

  • "전(Before)" 상태: 거대한 기술 라이브러리를 추가하면 관련 없는 팁들 때문에 혼란을 겪어 어려운 작업에서 오히려 성능이 떨어지는 경우가 많았습니다.
  • "후(After)" 상태: ASSAY를 사용하여 각 작업에 맞춰 나쁜 팁들을 걸러냄으로써:
    • DeepSeek-V3(강력한 AI 모델)는 AppWorld에서 실패를 딛고, 훨씬 더 많은 작업이 필요한 대규모 재학습(retraining)을 거친 모델들을 제치고 세계 최고의 성능을 기록했습니다.
    • GPT-4.1은 코드 한 줄 바꾸지 않고도 o1이나 o4-mini 같은 최상위 모델들을 제치고 리테일 테스트 순위표 상단으로 뛰어올랐습니다.

핵심 요점

이 논문은 기술이 많다고 해서 항상 더 좋은 것은 아니다라는 점을 증명합니다.

이것은 공구함과 같습니다. 목수에게 망치, 톱, 렌치를 주면 집을 지을 수 있습니다. 하지만 테니스 라켓, 프라이팬, 스키를 함께 준다면, 목수는 혼란을 느껴 망치를 떨어뜨릴 수도 있습니다.

ASSAY는 작업(집 짓기)을 보고 이렇게 말하는 시스템입니다. "좋아요, 망치와 톱을 주세요. 스키와 프라이팬은 숨겨두세요." 이 시스템은 목수를 새로 만드는 것이 아니라, 그가 들고 있는 도구를 선별해 주는 것입니다.

핵심 발견: 가장 큰 병목 현상은 AI가 기술이 부족해서가 아니라, 어떤 기술을 어떤 작업에 써야 하는지 모르기 때문입니다. ASSAY는 바로 그 불일치를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →