← 최신 논문
🤖 machine learning

Towards Code-Oriented LM Embeddings for Surrogate-Assisted Neural Architecture Search

본 논문은 오프더셸 언어 모델을 활용하여 신경 아키텍처를 PyTorch 코드로 표현하는 저비용 전략인 코드 지향 언어 모델 임베딩 (COLE) 을 제안하며, 이를 통해 전문적인 미세 조정 없이도 경쟁력 있는 대리 모델 지원 신경 아키텍처 탐색을 가능하게 하고 최적 모델을 찾는 데 필요한 평가 예산을 크게 절감합니다.

원저자: Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

게시일 2026-05-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 일상적인 비유를 사용하여 설명합니다.

큰 문제: 최고의 레시피를 찾는 것은 비쌉니다

천만 개의 가능한 재료 조합 (밀가루, 설탕, 계란, 향신료) 과 방법 (굽는 시간, 온도) 이 들어 있는 거대한 요리책을 가지고 있어 케이크의 절대적인 최고의 레시피를 찾으려 노력하는 셰프라고 상상해 보세요.

인공지능 세계에서는 이를 **신경 구조 탐색 (Neural Architecture Search, NAS)**이라고 부릅니다. 여기서 '레시피'는 신경망 설계이고, '맛보기'는 AI 를 훈련시켜 얼마나 잘 작동하는지 확인하는 과정입니다. 문제는 모든 레시피를 하나하나 '맛보는' 데는 시간이 무한히 걸리고 컴퓨터 성능이라는 엄청난 비용이 든다는 점입니다. 책에 있는 모든 케이크를 구울 수는 없습니다.

이를 해결하기 위해 과학자들은 대리 모델 (Surrogate)(또는 '맛 예측기')을 사용합니다. 이는 실제 케이크를 구울 필요 없이 종이 위의 레시피를 보고 케이크가 얼마나 맛있을지 추측하는 미식가와 같습니다. 목표는 빠르고, 저렴하며, 매우 정확한 미식가를 찾는 것입니다.

구식 방법: 레시피를 외국어로 번역하기

과거에는 미식가가 레시피를 이해하도록 하기 위해 과학자들은 신경망의 복잡한 코드를 낯설고 단순화된 텍스트 형식 (레시피를 화학식 목록이나 기이한 다이어그램으로 변환하는 것) 으로 번역해야 했습니다.

이것을 다음과 같이 생각해보세요: 수백만 권의 실제 요리책과 레시피를 읽어서 요리하는 법을 아는 마스터 셰프 (대형 언어 모델, LM) 가 있습니다. 하지만 실제 레시피를 보여주는 대신, 그들이 한 번도 본 적 없는 언어로 쓰인 번역본 (예: 'ONNX-to-text'나 '파생 트리') 을 건네줍니다.

셰프가 이 새로운 언어를 이해하게 하려면, 근본적으로 처음부터 다시 교육하는 **파인튜닝 (fine-tuning)**에 몇 주를 보내야 합니다. 이는 느리고 비싸며, 빠른 '맛 예측기'를 갖는다는 목적 자체를 무색하게 만듭니다.

새로운 아이디어: 그냥 실제 레시피를 보여주기

이 논문의 저자 프라반 소무 (Pranav Somu) 와 그의 팀은 간단한 통찰력을 가졌습니다: 신경망은 이미 코드로 작성되어 있습니다. 그들은 파이썬 프로그래밍 스크립트처럼 보입니다.

'마스터 셰프들'(CodeLlama 같은 대형 언어 모델) 이 이미 수조 줄의 실제 컴퓨터 코드로 훈련받았기 때문에, 이 레시피들을 완벽하게 읽는 법을 이미 알고 있습니다. 다시 교육할 필요가 없습니다.

해결책 (COLE):
레시피를 기이한 형식으로 번역하는 대신, 원시 파이썬 코드를 직접 사전 훈련된 AI 에게 입력합니다.

  1. 파인튜닝 없음: AI 를 '있는 그대로'(동결된 상태로) 사용합니다. 마치 특정 요리책을 읽는 법을 이미 알고 있어 훈련 세미나가 필요 없는 셰프를 고용하는 것과 같습니다.
  2. 임베딩: AI 가 코드를 읽고 레시피의 본질을 포착하는 수학적 '지문'(임베딩) 으로 변환합니다.
  3. 예측기: 작고 간단한 계산기 (회귀 헤드) 가 그 지문을 보고 구조가 얼마나 잘 수행될지 예측합니다.

그들이 발견한 것

이 팀은 두 가지 다른 '요리책'(검색 공간) 을 사용하여 이 아이디어를 테스트했고 놀라운 결과를 발견했습니다.

  • 원시 코드가 승리합니다: AI 에게 실제 파이썬 코드를 입력했을 때, 기이한 번역 텍스트 형식을 입력했을 때보다 성능을 훨씬 더 잘 예측했습니다. 마치 셰프가 "나는 실제 레시피를 이해합니다. 화학식으로 번역해 줄 필요가 없습니다"라고 말하는 것과 같습니다.
  • 훈련이 필요 없습니다: AI 를 파인튜닝하는 데 몇 주를 보낼 필요가 없다는 것을 증명했습니다. '그냥 꺼내서 쓰는(off-the-shelf)' 모델들이 즉시 훌륭하게 작동했습니다.
  • 더 빠른 탐색: 이 방법을 사용하여 (BANANAS 라는 알고리즘을 사용하여) 최고의 AI 구조를 탐색했을 때, 훨씬 더 빠르게 최고의 설계를 찾았습니다.
    • 하나의 작업 (CIFAR-100) 의 경우, 34% 적은 컴퓨터 평가로 기존 방법보다 최상위 1% 에 드는 최고의 설계를 찾았습니다. 마치 100 개의 케이크를 맛보는 대신 66 개의 케이크만 맛보아 최고의 케이크 레시피를 찾는 것과 같습니다.

왜 이것이 중요한가

이 접근 방식은 검색 엔진에 보편적인 번역기를 제공하는 것과 같습니다. 모든 신경망을 코드로 작성할 수 있고, 코드는 이러한 AI 모델들이 이미 유창하게 구사하는 보편적인 언어이기 때문에, 이 방법은 맞춤형 엔지니어링이 필요 없이 거의 모든 유형의 구조에 적용 가능합니다.

간단히 말해: 똑똑한 AI 에게 신경망을 이해시키기 위해 새롭고 기이한 언어를 배우게 하는 대신, 저자들은 이미 알고 있는 언어인 코드로 그들과 대화했습니다. 이는 시간과 비용을 절약하고 더 나은 결과를 얻습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →