← 최신 논문
💻 computer science

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

본 논문은 레드스톤 회로 과제를 통해 발견부터 적용에 이르는 순환 과정을 평가하는 마인크래프트 기반 벤치마크인 SciCrafter 를 소개하며, 현재의 최첨단 모델이 지식 적용의 한계로 인해 주로 26% 의 성공률에서 정체되고 있음을 밝히지만, 고급 시스템의 새로운 병목 현상은 지식 격차를 식별하고 올바른 문제를 설정하는 능력으로 이동하고 있음을 보여줍니다.

원저자: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 정교한 시계 태엽 로봇처럼 복잡한 기계를 만드는 방법을 가르치려 하지만 경험이 부족한 천재 견습공을 두고 있다고요. 당신은 부품 상자와 "로봇이 걷게 만들어라"라는 목표를 건네줍니다.

견습공은 단순히 기어를 어떻게 조립하는지 (적용) 만 알아서는 안 됩니다. 먼저 어떤 기어가 작동하는지, 왜 그런 방향으로 회전하는지, 그리고 기어를 이상하게 연결하면 어떤 일이 벌어지는지 (발견) 스스로 파악해야 합니다.

"현재의 에이전트들이 발견에서 적용까지의 간극을 메울 수 있는가? 마인크래프트 사례 연구"라는 제목의 이 논문은 오늘날 가장 진보된 AI '견습공'들이 이 전체 과정을 얼마나 잘 수행하는지에 대한 성적표와 같습니다.

다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:

1. 테스트: "레드스톤" 퍼즐

연구진은 너무 복잡하고 비용이 많이 드는 현실 세계가 아닌, 마인크래프트라는 비디오 게임에서 AI 를 테스트했습니다. 이 게임에서는 '레드스톤'(게임 내 전기 배선) 을 이용해 복잡한 기계를 만들 수 있습니다.

  • 과제: AI 는 특정 개수 (4 개에서 64 개 사이) 의 램프를 특정 패턴 (한 번에 모두 켜거나 순차적으로 켜기) 으로 밝히기 위한 회로를 구축해야 했습니다.
  • 문제점: AI 는 단순히 추측할 수 없었습니다. 램프 수가 늘어날수록 게임의 규칙이 변했습니다. 예를 들어, 마인크래프트에서 신호는 이동 거리가 멀어질수록 약해집니다. 64 개의 램프를 밝히려면 AI 는 특수한 '리피터'(신호 증폭기) 가 필요하다는 사실을 발견하고, 이를 특정 '허브' 형태로 배치해야 했습니다. 만약 4 개 램프에 대한 해결책을 단순히 기억해 확대 적용하려 했다면 실패했을 것입니다.

2. 결과: AI 가 벽에 부딪혔다

연구진은 이용 가능한 가장 똑똑한 AI 모델들 (GPT-5.2, Gemini-3-Pro, Claude-Opus-4.5 등) 을 테스트했습니다.

  • 점수: 최고의 AI 조차도 약 **26%**의 성공률만을 기록했습니다.
  • 비유: 천재 학생에게 수학 시험을 준다고 상상해 보세요. 그들은 간단한 덧셈은 완벽하게 풀지만, 더 어려운 문제를 해결하기 위해 숫자를 곱하는 새로운 방법을 발명하라고 하면 막힙니다. 그들은 지시를 따르는 데는 뛰어나지만, 스스로 어떤 지시가 필요한지 발견하는 데는 서툴러요.

3. 진단: 그들은 어디서 실패했는가?

연구진은 AI 의 실패를 릴레이 경주처럼 네 단계로 나누어 분석했습니다. 누가 어떤 순간에 배턴을 떨어뜨렸는지 확인하기 위함입니다.

  • 1 단계: 무엇을 모르는지 알기 (식별)

    • 문제점: AI 는 무엇을 물어봐야 할지 몰랐습니다. "이봐, 신호가 거리가 멀어질수록 약해지는 걸 모르는데?"라는 사실을 깨닫지 못했습니다.
    • 해결책: 연구진이 "신호가 얼마나 멀리 이동하는지 확인해 봐"라는 힌트를 주자, 성공률이 두 배로 증가했습니다.
    • 통찰: 가장 똑똑한 AI 들에게 가장 큰 문제는 퍼즐을 푸는 것이 아니라, 퍼즐이 실제로 무엇인지 파악하는 것입니다. 그들은 올바른 질문을 하는 데 서툴러요.
  • 2 단계: 실험 수행 (발견)

    • 문제점: AI 는 자신의 아이디어를 체계적으로 테스트하는 방법을 몰랐습니다.
    • 해결책: 연구진은 '과학자'라는 하위 에이전트를 추가했습니다. 이는 작은 실험 (예: "여기에 블록을 놓으면 무슨 일이 일어날까?") 을 수행하고 보고서를 작성하는 것이 유일한 임무인 두 번째 AI 였습니다.
    • 통찰: AI 에게 실험을 수행할 '과학자'가 주어지자 성능이 향상되었습니다. 이는 AI 가 실험하는 방법에 대한 지식은 가지고 있지만, 구조화된 과정 없이 스스로 수행하는 데는 어려움을 겪음을 보여줍니다.
  • 3 단계: 규칙 기록 (정리)

    • 문제점: AI 는 답을 찾았지만, 노트를 엉망으로 작성해 나중에 어떻게 사용해야 할지 잊어버렸습니다.
    • 해결책: 연구진이 AI 에게 발견 사항을 엄격한 형식 (주장, 증명, 제약 조건, 예시) 으로 작성하도록 강제하자 성능이 크게 향상되었습니다.
    • 통찰: 무언가를 '알고' 있는 것만으로는 부족합니다. AI 는 나중에 사용할 수 있도록 그 지식을 저장하고 조직화하는 방법을 알아야 합니다.
  • 4 단계: 기계 구축 (적용)

    • 문제점: 규칙을 파악하고 기록한 후에도 AI 는 게임 내에서 블록을 정확하게 배치하는 데 여전히 어려움을 겪었습니다.
    • 통찰: 이는 '잔여' 간극입니다. AI 는 새로운 지식을 완벽한 물리적 구축으로 전환하는 데 여전히 어려움을 겪습니다. 그러나 가장 똑똑한 모델들의 경우 이 간극은 줄어들고 있는 반면, "올바른 질문을 던지는" 간극은 커지고 있습니다.

4. 주요 결론

이 논문은 AI 에게 전환점이 왔다고 결론 내립니다.

  • 과거: AI 는 질문하기, 실험하기, 구축하기 모든 면에서 서툴렀습니다.
  • 현재: 규칙을 제공하면 AI 는 구축(적용) 을 매우 잘하게 되었습니다.
  • 미래의 병목 현상: 가장 어려운 부분은 더 이상 "문제를 해결하는 것"이 아닙니다. 가장 어려운 부분은 **"문제를 정의하는 것"**입니다.

최종 비유:
목적지와 경로를 알려주기만 하면 완벽하게 자율 주행하는 차를 상상해 보세요. 문제는 현재 그 차가 창밖을 내다보며 "아, 길이 막혔구나"라고 깨닫고 새로운 경로를 찾아 결정하는 데는 매우 서툴다는 점입니다. "야, 길이 막혔으니 우회해"라고 인간이 알려줘야 합니다.

연구진은 말합니다: 우리는 차가 더 빨리 달리게 만드는 것을 멈추고, 차가 길을 바라보며 어디로 가야 할지 파악하는 법을 가르쳐야 합니다.

기여 사항 요약

  1. SCICRAFTER: AI 가 '발견'에서 '적용'으로 나아갈 수 있는지 확인하기 위한 새로운 테스트 (마인크래프트 내).
  2. 세부 분석: 똑똑한 AI 들의 가장 큰 장애물은 이제 아는 것을 적용하는 것이 아니라, 배워야 할 것을 식별하는 것임을 증명했습니다.
  3. 도구: AI 가 새로운 것을 배우는 데 크게 도움이 되는 '과학자' 보조 도구와 더 나은 메모 작성 방식을 개발했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →