← 최신 논문
🤖 machine learning

ONNX-Net: Towards Universal Representations and Instant Performance Prediction for Neural Architectures

이 논문은 60만 개 이상의 샘플로 구성된 ONNX-Bench 벤치마크를 기반으로 구축된 통합 텍스트 기반 신경망 구조 표현 방식인 ONNX-Net을 소개하며, 이는 단일 성능 예측기가 특정 셀 기반 설계에 국한되지 않고 다양한 탐색 공간에 걸쳐 임의의 신경망 구조를 즉각적이고 정확하게 평가할 수 있게 해준다.

원저자: Shiwen Qin, Alexander Auras, Shay B. Cohen, Elliot J. Crowley, Michael Moeller, Linus Ericsson, Jovita Lukasik

게시일 2026-08-27
📖 5 분 읽기🧠 심층 분석

원저자: Shiwen Qin, Alexander Auras, Shay B. Cohen, Elliot J. Crowley, Michael Moeller, Linus Ericsson, Jovita Lukasik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 가장 강력한 도구는 종종 신경망인데, 이는 인간의 뇌를 느슨하게 모델링하여 패턴을 인식하거나, 언어를 번역하거나, 자동차를 운전하는 법을 배우는 시스템입니다. 수십 년 동안 과학자들은 이 네트워크의 구조를 엔진을 조정하는 정비사처럼 미세하게 조정하며 직접 손으로 구축하려고 노력해 왔습니다. 하지만 이러한 시스템이 점점 더 복잡해짐에 따라 인간의 직관은 병목 현상이 되었습니다. 이는 컴퓨터가 스스로 자신의 네트워크를 설계하도록 과제를 부여하는 '신경 구조 탐색(neural architecture search)'이라는 분야를 탄생시켰습니다. 목표는 기계가 특정 작업을 위한 최적의 구조를 찾도록 하는 것입니다. 그러나 이 과정은 벽에 부딪혔습니다. 설계가 좋은지 알기 위해서는 컴퓨터가 이를 처음부터 구축하고 훈련시켜야 하는데, 이 과정은 거대한 슈퍼컴퓨터를 사용하여 며칠, 심지어 몇 주가 걸릴 수 있습니다. 이로 인해 탐색 속도가 믿을 수 없을 정도로 느려지고 비용이 많이 들게 되어, 얼마나 많은 실험을 할 수 있는지가 제한됩니다.

한 연구팀은 더 빠른 컴퓨터를 만드는 것이 아니라, 설계에 대해 대화하는 방식을 바꿈으로써 이 병목 현상을 돌파할 방법을 제안했습니다. 그들은 'ONNX-Net'이라 불리는 새로운 시스템을 도입했는데, 이는 신경망을 위한 범용 번역기 역할을 합니다. 모든 새로운 설계를 경직되고 미리 정의된 틀에 강제로 끼워 맞추는 대신, 이 시스템은 신경망의 청사진을 마치 단순한 문장처럼 읽어 들입니다. 연구진은 복잡한 기술적 도표를 평이한 텍스트 설명으로 변환함으로써, 텍s를 읽는 것만으로 신경망이 얼마나 잘 작동할지를 예측하는 언어 모델을 훈련시켰습니다. 그 결과, 신경망 설계를 실제로 구축하거나 훈련하지 않고도 그 성공 여부를 즉각적으로 추측할 수 있는 도구가 탄생했습니다. 이는 막대한 시간과 에너지를 절약해 줍니다.

연구진이 해결한 핵심 문제는 이전의 속도 향상 시도들이 너무 협소했다는 점입니다. 초기 방식들은 동일한 레고 블록을 쌓는 것처럼 작고 반복되는 블록으로 구축된 네트워크에만 잘 작동했습니다. 하지만 과학자들이 더 유연하고 복적인 네트워크를 설계하기 시작하면서, 기존의 방법들은 새로운 불규칙한 형태를 이해하지 못해 실패했습니다. 더욱이, 이러한 예측 도구를 훈련하는 데 사용되는 데이터가 서로 다른 형식으로 흩어져 있어, 어떤 유형의 네트워크도 처리할 수 있는 단일하고 스마트한 예측기를 만드는 것이 불가능했습니다. 이를 해결하기 위해 팀은 먼저 'ONNX-Bench'라는 거대하고 통합된 라이브러리를 구축했습니다. 그들은 다양한 출처에서 약 65만 개의 서로 다른 신경망 설계를 모아 'ONNX'라고 알려진 단일 표준 파일 형식으로 모두 변환했습니다. 이 형식은 신경-망을 위한 범용 언어와 같아서, 아무리 복잡하거나 특이한 구조라도 설명할 수 있습니다.

이 거대한 표준화된 설계 모음집을 확보한 후, 연구진은 이 정보를 컴퓨터 프로그램에 어떻게 입력할 것인가라는 과제에 직면했습니다. 그들은 네트워크를 설명하는 가장 유연한 방법은 복잡한 그래프나 행렬이 아니라 자연어라는 것을 깨달았습니다. 그들은 각 네트워크의 기술적 세부 사항—수행하는 연산, 구성 요소 간의 연결 방식, 각 구성 요소의 구체적인 설정 등—을 읽을 수 있는 텍스트 설명으로 변환하는 방법을 개발했습니다. 네트워크를 하나의 지침 세트로 상상해 보십시오: "입력을 받아 필터를 통과시킨 다음, 보정을 적용하고, 마지막으로 결과를 출력한다." 연구진은 이 65만 개의 네트워크 각각에 대해 이러한 지침을 생성하는 소프트웨어를 작성했습니다.

그 후, 그들은 이 텍스트를 사용하여 인간의 언어에 익숙한 유형의 인공지능인 대규모 언어 모델을 성능 예측기로 훈련시켰습니다. 이 모델은 시를 쓰거나 질문에 답하는 대신, 신경망을 설명하는 기술적인 '문장'을 읽고 그 정확도를 예측하는 법을 배웠습니다. 훈련은 놀라울 정도로 효율적이었습니다. 모델은 이전 방식들에 필요한 데이터의 아주 적은 부분만을 보고도 정확한 예측을 수행하는 법을 배웠습니다. 실제로, 이 모델은 이전 시스템들이 사용했던 데이터의 1% 미만을 사용하여 동일한 수준의 성능을 달ach했습니다. 이는 네트워크를 명확한 텍스트 기반 형식으로 설명함으로써, 컴퓨터가 이전보다 훨씬 빠르게 설계의 핵심 특징을 파악할 수 있음을 시사합니다.

이 새로운 접근 방식의 진정한 시험은 본 적 없는 설계에 대해서도 일반화될 수 있는지 여부였습니다. 연구진은 특정 계열의 네트워크로 모델을 훈련시킨 뒤, 완전히 다른 계열의 네트워크 성능을 예측하도록 요청함으로써 모델을 테스트했습니다. 결과는 놀라웠습니다. 모델은 '제로샷 전이(zero-shot transfer)'라고 알려진 능력을 통해, 보지 못한 설계들의 성능을 높은 정확도로 성공적으로 예측했습니다. 이는 시스템이 새로운 유형의 네트워크를 위해 재훈련되거나 조정될 필요 없이, 텍스트 설명을 통해 배운 내용을 새로운 구조에 그대로 적용했음을 의미합니다. 이는 중요한 진전입니다. 이전의 도구들은 종로 훈련된 특정 유형의 네트워크에 갇혀 있어 더 복잡한 새로운 설계에 적응할 수 없었기 때문입니다.

연구진은 또한 모델이 예측을 수행하는 데 정확히 어떤 정보가 필요한지도 탐구했습니다. 그들은 텍s 설명을 연산의 이름, 데이터가 흐르는 형태, 설계자가 설정한 구체적인 매개변수와 같은 서로 다른 부분들로 나누었습니다. 그들은 네트워크의 구성 요소들이 어떻게 연결되어 있는지와 데이터의 형태에 대한 세부 정보를 포함하는 것이 성공의 가장 결정적인 요인임을 발견했습니다. 모델이 기본 구조만 가지고도 잘 작동하긴 했지만, 이러한 구체적인 세부 사항을 추가했을 때 훨씬 더 정교한 예측이 가능했습니다. 이는 텍스트 기반 접근 방식이 무관한 코드 변형의 소음 속에서 길을 잃지 않고 네트워크 설계의 필수적인 세부 사항을 포착한다는 것을 확인시켜 줍니다.

이러한 성공에도 불구하고, 연구진은 자신들의 작업에 대한 한계를 명확히 밝히고 있습니다. 이 시스템은 주로 'CIFAR-10'이라는 특정 데이터셋을 사용한 이미지 인식 작업용 네트워크를 대상으로 훈련 및 테스트되었습니다. 이 방법은 이론적으로 자신들의 표준 형식으로 변환할 수 있는 모든 네트워크를 다룰 수 있지만, 현재의 결과는 이 특정 영역에 국한되어 있습니다. 연구진은 자신들의 훈련 데이터가 방대하긴 하지만 여전히 기존의 벤치마크에서 가져온 것이며, 아직 모든 유형의 신경망이나 작업을 포괄하지는 못한다고 인정합니다. 또한, 그들의 텍스트 기반 방식이 기존의 그래프 기반 방식보다 더 유연하지만, 매우 특정하고 제한적인 시나리오에서는 기존 방식들이 여전히 더 나은 성능을 보일 수 있다고 지적합니다.

이 새로운 벤치마크와 그에 따른 예측 도구의 출시는 인공지능 분야의 더 효율적인 탐색을 위한 문을 열어줍니다. 설계를 훈련하는 데 드는 막대한 비용 없이 즉각적으로 설계를 평가할 수 있는 방법을 제공함으로써, 연구자들은 이제 몇 개를 테스트하는 데 걸리던 시간 동안 수천 개의 아이디어를 테스트할 수 있게 되었습니다. 이 연구는 신경망을 설계하는 미래가 더 빠른 하드웨어를 만드는 데 있는 것이 아니라, 설계 자체를 더 잘 설명하고 이해하는 방법을 찾는 데 있다는 것을 시사합니다. 연구진은 자신들의 도구와 데이터를 공개함으로써, 특정 유형의 네트워크에 국한되지 않고 끊임없이 진화하는 인공지능의 지형에 적응할 수 있는 검색 방법을 다른 이들이 구축할 수 있도록 장려하기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →