← 최신 논문
🤖 machine learning

KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

KForge는 두 개의 협력하는 LLM 에이전트를 활용하여 AI 가속기를 위한 고성능 커널을 반복적으로 생성하고 정제함으로써, 기존의 수동 튜닝 및 컴파일러 최적화 베이스라인 대비 NVIDIA B200 및 Intel Arc B580 하드웨어 모두에서 상당한 처리량 향상을 달성하는 크로스 플랫폼 프레임워크입니다.

원저자: Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 빠른 배송 서비스를 운영하고 있다고 상상해 보십시오. 당신의 함대는 단순히 한 종류의 트럭이 아닙니다. 도시의 거리용 작은 스쿠터, 고속도로용 대형 세미 트럭, 그리고 친환경 구역을 위한 전기 밴이 뒤섞여 있습니다. 각 차량은 특정 작업에 완벽하게 최적화되어 있지만, 그들은 모두 서로 다른 언어를 사용하며 서로 다른 엔진 규칙을 가지고 있습니다.

인공지능(AI)의 세계에서도 오늘날 정확히 이런 일이 일어나고 있습니다. AI 시스템은 점점 더 "에이전트적(agentic)"이 되어가고 있습니다. 즉, 단순히 질문에 답하는 것을 것에 그치지 않고, 작업을 단계별로 나누고, 도구를 사용하며, 다른 AI 에이전트들과 협력합니다. 어떤 단계는 헤비 매스 수학(세미 트럭과 같은)이 필요하고, 어떤 단계는 빠르고 가벼운 사고(스쿠터와 같은)가 필요합니다. 전체 시스템을 빠르게 만들기 위해서는 각 단계를 그에 가장 적합한 컴퓨터 칩(가속기)에서 실행해야 합니다.

문제점: 번역의 악몽
문제는 이러한 다양한 칩들을 위한 "엔진 코드"(커널이라고 불림)를 작성하는 것이 매우 어렵다는 점입니다. 이는 페라리, 트랙터, 오토바이의 매뉴얼을 동시에 작성해야 하는데, 그 매뉴얼들이 서로 다른 언어(CUDA, Metal, SYCL 등)로 쓰여 있는 것과 같습니다.

  • 과거 방식: 인간 전문가들이 수년에 걸쳐 코드를 직접 작성하고 미세 조정합니다. 이는 느리고, 비용이 많이 들며, 확장하기 어렵습니다.
  • 새로운 문제: 우리가 AI를 사용하여 이 코드를 작성하려고 시도할 때조차, 종종 실패하곤 합니다. AI는 코드가 올바르게 보이는 것처럼 작성하지만 실제로는 엔진을 충돌시키거나, NVIDIA 칩에서는 작동하지만 Intel 칩에서는 완전히 작동하지 않는 코드를 작성할 수도 있습니다.

해결책: KForge (AI 정비사 팀)
이 논문은 두 명의 특화된 AI 정비사가 함께 협력하여 이러한 엔진을 자동으로 고치고 최적화하는 시스템인 KForge를 소개합니다.

KForge는 하나의 AI가 모든 것을 하려고 하는 대신, 업무를 분담합니다:

  1. 제너레이터 (설계자 - The Builder): 이 AI는 코드를 작성합니다. 만약 코드가 충돌하거나 컴파일되지 않으면, "빨간불"을 받고 다시 시도하며 오류를 수정합니다.
  2. 애널리스트 (튜너 - The Analyst): 코드가 정상적으로 작동하면, 이 AI는 "대시보드"(프로파일링 데이터)를 살펴봅니다. 이 AI는 "이 엔진은 연료를 낭비하고 있다"라거나 "바퀴가 너무 빨리 돌고 있다"와 같은 정보를 포착합니다. 그리고 설계자에게 코드를 더 빠르게 만들기 위해 어떻게 미세 조정해야 하는지에 대한 구체적인 지침을 전달합니다.

그들은 루프(loop) 방식으로 작동합니다: 빌드 → 테스트 → 분석 → 미세 조정 → 반복. 이 과정은 코드가 정확할 뿐만 아니라 눈부시게 빨라질 때까지 계속됩니다.

결과: 두 가지 다른 레이스
저자들은 KForge가 얼마나 잘 작동하는지 확인하기 위해 두 가지 매우 다른 시나리오에서 테스트를 진행했습니다:

  • 레이스 1: 헤비급 챔피언 (NVIDIA B200)
    여기서 KForge는 NVIDIA 엔지니어들이 수년간 완성해 온 코드베이스(Tensor Arrest-LLM)와 경쟁해야 했습니다. 이는 마치 신참 정비사가 포뮬러 1 팀의 피트 크루를 이기려고 노력하는 것과 같습니다.

    • 결과: KForge는 2.12%의 속도 향상을 끌어냈습니다. 고성능 컴퓨팅의 세계에서 챔피언을 1% 차이로 이기는 것은 엄청난 일입니다. 이는 세계 기록을 경신한 랩 타임에서 단 0.1초를 줄이는 것과 같습니다.
  • 레이스 2: 새로운 트랙 (Intel Arc B580)
    여기에는 이길 "챔피언"이 없었습니다. 하드웨어는 새것이었고, 복사할 수 있는 기존의 고성능 코드도 없었습니다. KForge는 처음부터 엔진을 구축해야 했습니다.

    • 결결과: KForge는 이 칩을 위해 현재 사용 가능한 표준적이고 최적화되지 않은 코드보다 5.13배 더 빠른 코드를 생성했습니다. KForge는 이전에는 느리고 기본적인 엔진만 존재했던 곳에 강력하고 새로운 엔진을 탄생시킨 것입니다.

이것이 중요한 이유
이 논문은 AI가 점점 더 복잡해짐에 따라, 모든 새로운 칩에 대해 수동으로 코드를 작성하는 데 인간에게 의존할 수 없다고 주장합니다. KForge는 AI 팀이 다음과 같은 일을 할 수 있음을 보여줍니다:

  • 다양한 하드웨어 브랜드(NVIDIA, Intel, Apple, AMD) 간에 코드를 번역할 수 있습니다.
  • 스스로 실수를 수정할 수 있습니다.
  • 성능 데이터를 통해 학습하여 시간이 지남에 따라 더 빨라집니다.

요약하자면, KForge는 숙련된 베테랑 엔진이든 완전히 새로운 모델이든 상관없이, 어떤 컴퓨터 칩에서도 AI 시스템이 효율적으로 실행되도록 돕는 도구로서, 저수준 엔진 코드를 작성하는 어려운 작업을 자동화합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →