← 최신 논문
💻 computer science

Relation Reasoning with LLMs in Expensive Optimization

본 논문은 고비용 최적화 문제에 대해 효율적인 제로샷 관계 기반 추론을 수행하기 위해 강화 학습된 대규모 언어 모델을 활용하는 새로운 대리 모델 지원 진화 알고리즘인 R2SAEA를 소개하며, 이를 통해 전통적인 대리 모델의 재학습 오버헤드를 극복하고 최첨단 성능을 달성합니다.

원저자: Ye Lu, Bingdong Li, Aimin Zhou, Hao Hao

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ye Lu, Bingdong Li, Aimin Zhou, Hao Hao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 안개 낀 산맥을 통과하는 최선의 경로를 찾으려 한다고 상상해 보세요. 문제는 어떤 단일 지점의 고도를 확인하는 데 하루 종일 하이킹이 필요하다는 점입니다 (이 논문에서는 이를 **"비싼 평가"**라고 부릅니다). 당신은 제한된 일수 (엄격한 예산) 만 가지고 있으므로, 모든 곳을 하이킹할 수는 없습니다.

전통적으로 과학자들은 저지점이 어디인지 추측하기 위해 "지도" (수학적 모델) 를 사용해 왔습니다. 하지만 이러한 지도는 까다롭습니다. 새로운 지역을 탐험할수록 오래된 지도는 쓸모없게 되고, 처음부터 다시 그리는 데 귀중한 시간을 써야 합니다. 이것이 이 논문이 해결하려는 병목 현상입니다.

다음은 논문의 해결책을 간단한 개념으로 분해한 것입니다:

1. 새로운 "지도": 계산기가 아닌 스마트한 심판

정확한 지점의 높이를 예측하려는 시도 (이는 어렵고 지속적인 재작성이 필요함) 대신, 저자들은 AI 를 권투 경기의 심판처럼 훈련시켰습니다.

  • 옛 방식: AI 는 모든 선수의 정확한 점수를 추측하려 합니다.
  • 새 방식 (R2SAEA): AI 는 두 명의 선수만 한 번에 보고 *"선수 A 가 선수 B 보다 나은가?"*라는 간단한 질문에 답합니다.

이를 **관계 추론 (Relation Reasoning)**이라고 합니다. 진화 알고리즘 (탐색 방법) 은 대개 정확한 숫자보다는 어떤 옵션이 다른 것보다 더 나은지에 더 관심을 가지므로, 이 "심판" 접근 방식이 훨씬 효율적입니다.

2. "앵커" 트릭: 도서관 과부하 피하기

100 명의 하이커가 있고 각자 서로를 비교하고 싶다면, 심판에게 약 10,000 쌍에 대해 물어봐야 합니다. 이는 AI 가 한 번에 처리하기에 너무 많은 질문입니다 (AI 의 "메모리"나 문맥이 부족해질 수 있습니다).

저자들은 "앵커" 전략을 고안했습니다:

  • 한 번에 모두에 대해 묻는 대신, 한 명의 하이커를 "앵커" (기준점) 로 선택합니다.
  • AI 에게 질문합니다: "하이커 A 는 앵커와 비교해 어떤가? 하이커 B 는 앵커와 비교해 어떤가? 하이커 C 는 앵커와 비교해 어떤가?"
  • 이를 모든 하이커에게 하나씩 반복합니다.
  • 결과: 이는 거대하고 혼란스러운 질문 더미를 작고 관리 가능한 일련의 목록으로 바꿉니다. 마치 모든 학생을 서로 동시에 비교하는 대신, 교사가 "학급 평균"과 비교하여 한 명씩 학생들을 채점하는 것과 같습니다.

3. "투표" 시스템: 의견을 점수로 변환하기

AI 가 모든 쌍을 심판한 후, "더 낫다/더 나쁘다"는 의견들을 얻게 됩니다. 최고의 하이커를 어떻게 선택할까요?

  • 시스템은 투표 메커니즘을 사용합니다.
  • AI 가 "하이커 X 는 앵커의 90% 보다 낫다"고 말하면, 하이커 X 는 높은 점수를 받습니다.
  • 하이커 X 가 대부분보다 나쁘다면 낮은 점수를 받습니다.
  • 이는 AI 의 "의견"을 명확한 순위로 변환하여, 탐색 알고리즘이 비싸고 현실적인 검사를 위해 어떤 하이커를 보내야 할지 정확히 알 수 있게 합니다.

4. 심판 훈련: 강화 학습 (코치)

저자들은 범용 AI 를 단순히 사용한 것이 아니라, 마스터 심판이 될 수 있도록 특정 AI (Qwen2.5 라는 모델 기반) 를 훈련시켰습니다.

  • AI 가 추측하는 모습을 지켜보는 "코치" (강화 학습) 를 만들었습니다.
  • AI 가 관계를 올바르게 추측하면 코치는 보상을 주고, 잘못 추측하면 패널티를 줍니다.
  • 시간이 지남에 따라 AI 는 범용 AI 보다 훨씬 더 정교하게 솔루션 간의 미묘한 차이를 포착하는 법을 배웠습니다.
  • 마법: 일단 훈련되면, 이 AI 는 매일 다시 훈련될 필요가 없습니다. 그 자리에서 "생각" (추론) 할 수 있을 뿐입니다. 이는 엄청난 시간과 비용을 절약해 줍니다.

5. "포켓 사이즈" 심판: 소형 장치에서 실행

일반적으로 강력한 AI 는 거대하고 비싼 슈퍼컴퓨터가 필요합니다. 하지만 저자들은 모델을 축소하고 "뇌"를 압축하는 과정 (양자화라고 함) 을 통해 이 스마트한 심판이 고급 노트북이나 드론 또는 로봇에 사용되는 특수 칩 (에지 장치) 과 같은 작고 휴대 가능한 장치에서 실행될 수 있음을 보여주었습니다.

결론

이 논문은 문제를 일련의 간단한 "A 대 B" 비교로 전환하고, 질문을 관리 가능하게 유지하기 위한 교묘한 "앵커" 방법을 사용하며, 전문화된 AI 심판을 훈련시킴으로써, 이전 방법들보다 훨씬 적은 수의 비싼 테스트로 어려운 문제들의 최선의 솔루션을 찾을 수 있다고 주장합니다.

  • 더 빠릅니다: 지도를 매번 다시 그릴 필요가 없습니다.
  • 더 저렴합니다: AI 는 작고 덜 비싼 하드웨어에서 실행될 수 있습니다.
  • 더 잘 작동합니다: 테스트에서 이 방법은 단일 목표 및 다중 목표 문제 모두에서 다른 최상위 방법들보다 더 나은 솔루션을 찾았습니다.

저자들은 다른 사람들이 사용할 수 있도록 이 "스마트 심판"과 코드를 공개했습니다. 이는 올바른 질문을 던진다면 비싼 최적화 문제를 해결하기 위해 슈퍼컴퓨터가 필요하지 않음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →