← 최신 논문
💬 NLP

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

이 논문은 LLM 에이전트가 재귀적 자기 개선을 위한 학습 알고리즘을 설계하고 재작성하는 능력을 평가하기 위해 10개의 고정된 연구 저장소로 구성된 새로운 벤치마크인 AI4AI-Bench를 소개하며, 가장 진보된 시스템조차 현재 기존 알고리즘과 이론적 최적값 사이의 잠재적 성능 이득 중 4분의 1 미만을 달성하고 있음을 밝히고 있다.

원저자: Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

게시일 2026-08-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 꿈에는 단순히 더 많은 사실을 암기하는 것이 아니라, 학습에 사용하는 규칙 자체를 다시 쓰는 방식으로 스스로 더 똑똑해질 수 있는 기계에 대한 비전이 포함되어 있습니다. '재귀적 자기 개선(recursive self-improvement)'이라고 알려진 이 개념은 AI 시스템이 더 나은 버전의 자신을 설계하고, 그 버전이 다시 더 나은 버전을 설계하는 순환 과정을 제안하며, 이를 통해 급격한 발전의 사슬을 만들어냅니다. 이 순환이 작동하려면, 기계는 컴퓨터가 경험을 바탕으로 내부 연결을 어떻게 조정할지 알려주는 지침인 '학습 알고리즘'을 개선할 수 있어야 합니다. 기계는 지침을 따르거나 그 지침 내의 작은 설정들을 미세하게 조정하는 데는 매우 능숙해졌지만, 지침 자체를 재설계할 수 있는지 여부는 여전히 미지의 영역으로 남아 있습니다. 이는 라디오 볼륨을 조절할 줄 아는 운전자와 엔진을 재조립할 줄 아는 정비사의 차이와 같습니다.

한 연구팀은 현재의 인공지능 시스템이 그러한 종류의 깊은 기계적 작업을 수행할 수 있는지 확인하기 위해 새로운 테스트를 구축했습니다. 그들은 'AI4AI-Bench'라는 도전 과제를 만들었는데, 이는 고도로 발달한 AI 에이전트 그룹에게 열 가지의 서로 다른 실제 연구 프로젝트를 제시합니다. 각 프로젝트는 컴퓨터에게 수학 문제를 풀게 하거나, 이미지를 생성하게 하거나, 인간의 선호도를 이해하게 하는 것과 같은 특정 유형의 학습 과제를 포함합니다. 연구진은 각 AI 에이전트에게 한 프로젝트의 코드를 읽고 그 내부에서 사용되는 학습 방법을 개선하는 데 4시간의 컴퓨팅 시간을 주었습니다. 에이전트는 코드를 원하는 대로 변경할 수 있었지만, 4시간 동안 자신의 변경 사항에 대한 최종 결과는 볼 수 없었습니다. 대신, 자신의 아이디어가 좋은 것인지 추측하기 위해 빠르고 대략적인 추정치에 의존해야 했습니다. 시간이 다 되면 에이전트가 수정한 코드는 회수되었고, 프로젝트는 최종 결과를 판단하기 위한 고정된 숨겨진 규칙을 사용하여 최대 12시간 동안 처음부터 다시 실행되었습니다. 이 설정은 작은 아이디어를 빠르게 테스트할 수는 있지만, 새로운 학습 방법이 대규모로 실제로 작동하는지 확인하려면 며칠을 기다려야 하는 인간 과학자의 실제 경험을 모사합니다.

실험 결과는 시사하는 바가 컸습니다. 29가지의 서로 다른 AI 시스템과 노력 수준의 조합에 걸쳐 평균 성능은 상당히 낮았습니다. 원래 수정되지 않은 코드가 0.1점을 기록하고 이론적인 최댓값이 1.0점인 척도에서, 평균 결과는 불과 0.166점이었습니다. 가장 강력한 시스템조차 겨우 0.250점에 도달했습니다. 이는 가장 유능한 에이전트들도 기존 방식과 최상의 결과 사이의 거리 중 5분의 1도 채 메우지 못했음을 의미합니다. 연구진은 이러한 격차의 원인이 노력이나 컴퓨팅 파워의 부족이 아니라 방향성의 부재 때문이라는 것을 발견했습니다. 연구팀이 에이전트들이 수행한 코드 변경 사항을 분석했을 때, 제출된 코드의 대다수가 핵심 학습 규칙에는 전혀 손을 대지 않았다는 사실을 발견했습니다. 대신, 대부분의 에이전트는 학습이 진행되는 시간, 진행 상황을 저장하는 빈도, 또는 프로세스를 조정하는 데 사용되는 특정 숫자들을 단순히 조정했습니다. 이는 학습 방식을 바꾸는 것이 아니라 실행 과정을 조정하는 변화입니다.

변경 사항을 만든 에이전트 중 약 46%에 불편히 소수의 에이전트만이 실제로 학습 알고리즘에 접근하여 목적 함수, 감독 신호, 또는 업데이트 규칙을 변경했습니다. 이 에이전트들은 다른 에이전트들이 기록한 0.126점에 비해 평균 0.226점을 기록하며 유의미하게 높은 성과를 보였습니다. 이는 진정한 개선으로 가는 길이 기계가 학습하는 근본적인 방식을 바꾸는 데 있으며, 현재의 시스템 대부분은 이 단계를 주저한다는 것을 시사합니다. 또한 연구는 에이전트에게 허용된 추론 노력을 늘리는 것이 에이전트를 일반적인 의미에서 더 똑똑하게 만드는 것은 아니지만, 더 대담하게 만든다는 것을 보여주었습니다. 에이 agent에게 생각하고 계획할 수 있는 시간을 더 많이 주었을 때, 학습 규칙을 변경하려는 시도를 하는 에이전트의 비율은 8%에서 64%로 급증했습니다. 핵심 알고리즘에 위험을 감수하려는 이러한 의지의 증가가 생성된 아이디어의 질적 도약보다는 개선을 이끌어낸 동력이었습니다.

결론적으로, 이 논문은 오늘날의 AI 에이전트들이 기존의 역량을 뛰어넘는 설계를 하기보다는 여전히 적절한 기본 역량을 회복하는 단계에 있다고 결론짓습니다. 그들은 학습 주변의 프로세스를 최적화하는 데는 뛰어나지만, 학습 과정 자체를 재설계하는 데는 어려움을 겪습니다. 연구진은 다른 이들이 AI 시스템이 진화함에 따라 이 테스트를 반복할 수 있도록 코드 변경 사항과 점수를 포함한 모든 데이터를 공개했습니다. 이 벤치마크는 특정한 종류의 발전을 측정하는 척도로 기능합니다. 즉, 기계가 자신의 학습 방법을 살펴보고, 결함을 진단하며, 자신의 개선을 구동하는 메커니즘을 다시 쓸 수 있는지에 대한 척도입니다. 현재로서는, 그들이 시도는 할 수 있지만, 자신의 지능을 진정으로 복리로 쌓아 올리는 데 필요한 깊은 변화를 만들어내는 데는 거의 성공하지 못한다는 것이 답입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →