← 최신 논문
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

이 사전 등록된 통제 연구는 스캐폴드 선택이 GAIA 벤치마크에서의 에이전트 성능에 유의미한 영향을 미친다는 점을 입증하며, 측정된 능력 점수가 스캐폴드에 매우 조건적이라는 것과 모델이 개선됨에 따라 스캐폴드 민감도가 감소할 것이라는 예상은 유효하지 않음을 밝히고, 구조화된 멀티 에이전트 설계가 표준 ReAct 방식보다 종종 상당한 정확도 향상을 가져온다는 것을 보여준다.

원저자: Jason Starace

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jason Starace

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 요리를 하는 셰프가 얼마나 뛰어난지 판단하려고 한다고 상상해 보세요. 당신은 그들을 테스트하기 위해 세 가지 서로 다른 주방(스캐폴드/scaffold)을 가지고 있습니다:

  1. 솔로 셰프 (ReAct): 셰프가 생각하고, 재료를 집어 들고, 요리하고, 다시 생각하고, 다음 재료를 집어 드는 과정을 하나의 연속적인 흐름 속에서 진행합니다.
  2. 주방 팀 (Planner-Actor-Rater): 매니저가 레시피를 작성하면, 요리사가 단계를 실행하고, 비평가가 다음 단계로 넘어가기 전에 제대로 되었는지 확인하기 위해 매 단계마다 맛을 봅니다.
  3. 설계도와 시공자 (Planner-then-Executor): 먼저 기획자가 도구 없이 아주 상세한 단계별 설계도를 작성합니다. 그런 다음 시공자가 그 설계도를 받아 요리를 완성합니다.

이 연구는 단순한 질문을 던졌습니다: 당신이 셰프를 어떤 주방에 두느냐가 그들의 실력을 '겉보기에' 다르게 만드는가?

그 대답은 명확한 **'예'**입니다. 사실, 셰프의 실제 재능만큼이나 중요한 것은 바로 그들이 일하는 '주방'입니다.

거대한 발견: "주방"은 생각보다 더 중요합니다

연구진은 다섯 가지 서로 다른 "셰프"(Anthropic, Google, OpenAI의 AI 모델들)를 어려운 퍼즐(GAIA라고 불리는)로 테스트했습니다. 그들은 단순히 주방 설정을 바꾸는 것만으로도 모델의 점수를 28퍼센트 포인트나 변화시킬 수 있다는 것을 발견했습니다.

이것을 체감해 보자면 이렇습니다: 만약 어떤 모델을 "솔로 셰프" 주방에서 테스트했을 때 56%의 점수를 받았는데, 똑같은 모델을 "주방 팀" 설정에 넣었더니 갑자기 84%의 점수를 받게 될 수도 있습니다. 셰프가 변한 것이 아닙니다. 그들이 일하는 방식이 변한 것입니다.

이는 우리가 "모델 X의 성능이 80%다"라는 헤드라인을 볼 때, 그 숫자가 단순히 모델에 대한 것만이 아니라는 것을 의미합니다. 그것은 모델의 두뇌와 그 모델에게 주어진 특정 지침 및 도구의 결합입니다. 서로 다른 주방에서 테스트된 두 모델을 비교한다면, 당신은 그들의 두뇌를 비교하는 것이 아니라 그들의 주방을 비교하고 있는 것입니다.

신화 파괴: "더 똑똑한" 모델은 도움을 덜 필요로 하지 않습니다

연구진은 한 가지 가설을 세웠습니다. 가장 강력한 "프런티어" 모델들은 매우 똑똑하기 때문에 주방 설정에 크게 신경 쓰지 않을 것이라는 점이었습니다. 그들은 초지능적인 뇌라면 지저분한 주방에서도 충분히 잘 해낼 수 있을 것이라 생각했습니다.

그들은 틀렸습니다.

사실, 테스트된 모델 중 가장 강력한 모델(Anthropic의 Opus)은 어려운 과제를 수행할 때 구조화되고 조직적인 주방("주방 팀" 설정)으로부터 가장 많은 도움을 받았습니다. 가장 "똑똑한" 모델은 가장 독립적인 모델이 아니라, 매니저와 비평가가 있을 때 가장 큰 혜택을 받는 모델이었습니다. 모델이 똑똑해진다고 해서 최고와 최악의 성능 차이가 줄어들지는 않았습니다. 오히려 그 격차는 유지되거나 더 커졌습니다.

"가문" vs "순위"의 반전

또 다른 놀라운 점은, 화려한 주방의 이점이 모델의 순위가 아니라 어떤 가문 출신인지에 따라 달라진다는 것이었습니다.

  • Anthropic 가문의 모델들(Haiku, Sonnet, Opus)은 모두 "주방 팀" 설정으로부터 엄청난 상승 효과를 얻었습니다.
  • Google과 OpenAI의 모델들은 그와 같은 상승 효과를 얻지 못했습니다.

이것은 마치 특정 브랜드의 엔진이 특정 브랜드의 연료와 훨씬 더 잘 맞지만, 다른 브랜드의 엔진은 연료에 크게 개의치 않는 것과 같습니다. 단순히 "높은 등급"의 모델이라고 해서 항상 더 좋은 도구로부터 더 많은 혜택을 받을 것이라고 가정해서는 안 됩니다. 그것은 누가 엔진을 만들었느냐에 달려 있습니다.

비용과 효율성

연구는 또한 "영수증"(비용)도 살펴보았습니다.

  • "솔로 셰프"(ReAct)는 가장 비용이 많이 들고 느렸습니다. 실수를 많이 했고 자주 다시 시도해야 했습니다.
  • "주방 팀"과 "설계도" 설정은 더 빠르고 실수가 적었으며, 작업 중간에 문제가 생겼을 때 더 잘 회복했습니다.
  • 승자: 가장 어려운 과제에서 가장 저렴하고 정확한 옵션은 Google의 Gemini 모델과 "설계도" 설정을 조합한 것이었습니다.

핵심 결론

이 논문은 역량 수치는 조건부적이다라는 사실을 알려줍니다. 모델이 진공 상태에서 "X%의 역량을 가졌다"라고 말할 수는 없습니다. 반드시 "특정 지침과 도구를 사용할 때 X%의 역량을 가진다"라고 말해야 합니다.

AI가 정말로 얼마나 뛰어난지 알고 싶다면, 단 하나의 점수만 봐서는 안 됩니다. 그 점수는 모델과 그 모델을 받쳐주는 스캐폴딩(scaffolding)의 스냅샷이라는 점을 깨달아야 합니다. 스캐폴딩을 바꾸면 점수도 바뀝니다, 때로는 극적으로 말이죠. 모델이 할 수 있는 것과 테스트에서 실제로 보여주는 것 사이의 "격차"는 매우 크며, 모델이 똑똑해진다고 해서 그 격차가 반드시 줄어드는 것도 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →