← 최신 논문
💬 NLP

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

이 논문은 대규모 언어 모델이 조합 최적화 문제를 해결하기 위해 휴리스틱 알고리즘을 반복적으로 생성하고 개선하는 능력을 평가하는 오픈 소스 에이전트 벤치마크인 HeuriGym을 소개하며, 새로운 품질-수율 지표(Quality-Yield Index)를 통해 현재 모델들의 도구 사용 및 적응형 추론 능력에 나타나는 중대한 한계를 밝혀낸다.

원저자: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

게시일 2026-01-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 에세이를 쓰고, 상식 문제를 풀고, 기본적인 컴퓨터 코드를 작성하는 데 능숙한 매우 똑똑하고 박학다식한 로봇(대규모 언어 모델, LLM) 팀을 보유하고 있다고 상상해 보십시오. 당신은 이들이 단순히 교과서에서 외운 답을 읊는 것이 아니라, 실제로 스스로 어렵고 현실적인 퍼즐을 해결할 수 있는지 알고 싶습니다.

이 논문은 이를 테스트하기 위해 HeuriGym이라는 새로운 "체육관(gym)"을 소개합니다. 다음은 비유를 통해 설명한 작동 방식입니다.

1. 문제점: "퀴즈 쇼" 대 "실제 직업"

현재의 AI 테스트는 객관식 퀴즈와 같습니다.

  • 문제점: 만약 당신이 AI에게 학습 데이터에 포함된 수학 문제를 묻는다면, AI는 A+를 받을 것입니다. 하지만 만약 당신이 새로운 유형의 문제를 묻는다면, AI는 종종 얼어붙어 버립니다. 이는 마치 수학 원리는 이해하지 못한 채 정답지만 통째로 외운 학생과 같습니다.
  • 기존 방식: 어떤 테스트들은 AI에게 특정 체크를 통과하는 코드를 작성하라고 요구합니다. 하지만 이러한 방식은 너무 단순하거나 정답이 하나뿐인 경우가 많습니다.
  • 새로운 방식 (HeuriGym): Heuri Gym은 AI에게 단순한 퀴즈를 내는 것이 아니라, 설명서가 없는 복잡한 건설 프로젝트를 주는 것과 같습니다. 목표는 단순히 "테스트를 통과하는 것"이 아니라, 효율적으로 작동하는 기계를 만드는 것입니다.

2. 도전 과제: "조합 최적화(Combinatorial Optimization)" 퍼즐

이 논문은 조합 최적화라고 불리는 특정 유형의 어려운 문제에 집중합니다.

  • 비유: 당신이 1,000대의 배송 트럭 일정을 짜야 하는 물류 관리자라고 상상해 보십시오. 당신은 모든 트럭의 경로를 완벽하게 설정하여 연료를 최소로 사용하고 제시간에 도착하도록 해야 합니다.
  • 함정: 가능한 경로의 수는 우주의 원자 수보다 더 많습니다. 모든 경로를 다 확인할 수는 없습니다. 따라서 당신은 "휴리스틱(heuristic)" 천재가 되어야 합니다. 즉, 수학적으로 완벽하지 않더라도 빠르게 좋은 해답을 찾아내기 위한 영리한 지름길이나 "경험 법칙"을 발명해야 합니다.

3. 설정: "에이전트 루프(Agentic Loop)"

HeuriGym은 단순히 AI에게 코드를 한 번 쓰고 채점하는 것이 아닙니다. 대신 "리스폰(respawn)" 기능이 있는 비디오 게임처럼 피드백 루프를 설정합니다.

  1. 프롬프트: AI는 문제 설명(예: "이 전자 회로들을 최대한 빠르게 실행되도록 스케줄링하십시오")을 받습니다.
  2. 시도: AI는 문제를 해결하기 위한 프로그램(휴리스틱)을 작성합니다.
  3. 현실 점검: 시스템이 코드를 실행합니다.
    • 프로그램이 멈췄는가? (구문 오류)
    • 규칙을 어겼는가? (제약 조건 위반)
    • 너무 느리게 실행되는가? (시간 초과)
  4. 피드백: 시스템은 AI에게 "존재하지 않는 라이브러리를 사용하려고 시도했습니다" 또는 "귀하의 솔루션이 시간 제한을 위반했습니다"라고 알려줍니다.
  5. 재시도: AI는 오류를 읽고, 그로부터 배우며, 실수를 고치기 위해 코드를 다시 작성합니다.

이 순환 과정은 AI가 인간 엔지니어처럼 시행착오를 통해 문제를 해결하는 방법을 "학습"할 수 있게 해줍니다.

4. 성적표: "품질-수율 지수 (Quality-Yield Index, QYI)"

새로운 방식으로 퍼즐을 풀기 위해 도구를 발명하려는 로봇을 어떻게 채점할까요? 저자들은 QYI라는 새로운 점수를 만들었습니다.

  • 수율 (Yield): 로봇이 충돌 없이 실제로 작업을 완료했습니까? (작동하는 솔루션을 얻었습니까?)
  • 품질 (Quality): 인간 전문가와 비교했을 때 솔루션이 얼마나 좋습니까?
  • 점수: 점수가 1.0이라면 로봇이 인간 전문가만큼 수행했음을 의미합니다. 0점은 완전히 실패했음을 의미합니다.

5. 결과: "현실 점검"

저자들은 GPT-o4-mini 및 Gemini-2.5-Pro와 같은 현존하는 가장 똑똑한 9개의 AI 모델을 테스트했습니다.

  • 판결: 가장 "똑똑한" 모델들조차 약 0.6점만을 기록했습니다.
  • 의미: 최고의 AI 모델들도 이러한 작업에서 인간 전문가만큼의 효과를 내는 데 약 60% 정도의 성능밖에 보여주지 못한다는 뜻입니다. AI는 코드를 실행할 수는 있지만, 인간이 설계한 솔루션을 이길 만큼 효율적이거나 창의적인 코드를 쓰는 데는 어려움을 겪습니다.
  • 어려움: 모델들은 종로 반복문에 빠지거나, 존재하지 않는 가짜 라이브러리를 만들어내는 환각(hallucination) 현상을 보이거나, 복잡한 제약 조건을 이해하지 못하는 경우가 많았습니다. 그들은 지시를 따르는 데는 능숙했지만, 새로운 전략을 발명하기 위해 "틀 밖에서 생각하는 것"에는 서툴렀습니다.

6. 이것이 왜 중요한가

저자들은 AI 테스트를 단순한 퀴즈에서 벗어나 실제 엔지니어링 과제로 전환해야 한다고 주장합니다.

  • 목표: AI 개발이 단순히 패턴을 암기하는 것을 넘어, 과학과 공학을 위해 진정으로 추론하고, 적응하며, 새로운 솔루션을 발명할 수 있는 모델로 나아가도록 밀어붙이는 것입니다.
  • 핵-요약: 우리는 이 진척도를 측정할 수 있는 강력한 도구(HeuriGym)를 구축했습니다. 현재 AI는 유망한 견습생이지만, 복잡한 현실 세계의 최적화 문제를 해결하는 데 있어서는 아직 숙련된 장인의 수준에 도달하지 못했습니다.

요약하자면: HeuriGym은 AI 로봇들이 불가능한 퍼즐을 풀기 위해 자신만의 도구를 직접 만들어보는 체육관입니다. 그들은 점점 나아지고 있지만, 여전히 많은 실수를 저지르고 있으며 인간 전문가의 수준에는 아직 미치지 못하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →