← 최신 논문
💻 computer science

Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU

Xe-Forge 는 하드웨어 제약 조건에 대한 선별된 지식 베이스와 검증 및 정제 체인을 결합하여 Triton 커널을 인텔 GPU 로 포팅하고 최적화하는 과정을 자동화하는 다단계 LLM 기반 파이프라인으로, 수동 시행착오 없이 PyTorch eager 대비 상당한 속도 향상을 달성하기 위해 코드를 반복적으로 생성, 검증 및 정제합니다.

원저자: Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky, Gabriela Ben-Melech Stan, Shira Guskin, Weilin Xu, Adam Siemieniuk, Alexander Heinecke

게시일 2026-05-27
📖 5 분 읽기🧠 심층 분석

원저자: Marcin Spoczynski, Daniel Fleischer, Moshe Berchansky, Gabriela Ben-Melech Stan, Shira Guskin, Weilin Xu, Adam Siemieniuk, Alexander Heinecke

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 거의 모든 요리를 완벽하게 조리할 줄 아는 매우 재능 있고 세계적 수준의 셰프 (AI) 가 있다고 가정해 봅시다. 하지만 함정이 하나 있습니다. 이 셰프는 당신의 특정 주방에서 한 번도 요리를 해본 적이 없다는 점입니다. 당신의 주방에는 독특한 오븐, 기이한 조리대 높이, 그리고 셰프가 알지 못하는 매우 특정한 향신료 정리 방식이 있습니다.

만약 셰프에게 당신의 주방을 위해 요리를 해달라고 요청한다면, 그들은 맛있는 요리를 만들어낼 수 있지만, 그것은 가능한 한 가장 빠르거나 가장 효율적인 버전은 아닐 것입니다. 왜냐하면 그들은 당신의 주방의 특정 단축키 대신 그들의 "표준" 기술을 사용하기 때문입니다.

Xe-Forge는 바로 이 문제를 해결하기 위해 설계된 새로운 시스템으로, 특히 인텔 GPU( "주방") 와 Triton 커널(AI 에서 사용되는 "레시피") 을 위해 고안되었습니다.

다음은 이를 단순한 개념으로 분해하여 설명한 작동 방식입니다:

1. 문제: "복사 - 붙여넣기" 병목 현상

AI 세계에서는 개발자들이 컴퓨터를 더 빠르게 실행시키기 위해 끊임없이 코드 (커널) 를 작성합니다. 이 코드를 새로운 유형의 컴퓨터 칩 (인텔의 새로운 GPU 와 같은) 으로 이동시킬 때, 그들은 코드를 반복적으로 수동으로 조정해야 합니다. 메모리 접근 방식을 조정하고, 데이터 그룹화 방식을 변경하며, 사소한 하드웨어의 특이점을 수정해야 합니다.

이는 같은 양파임에도 불구하고 새로운 식당으로 이동할 때마다 양파를 썰는 방법을 다시 배워야 하는 셰프와 같습니다. 이러한 수동 작업은 느리고 지루하며, 새로운 AI 기능이 활용되는 것을 막는 병목 현상을 만듭니다.

2. 해결책: Xe-Forge ( "스마트 주방 리모델링 팀")

Xe-Forge 는 이미 작동하는 레시피 (정확하지만 느린 커널) 를 받아 인텔 칩에서 번개처럼 빠르게 작동하도록 자동으로 다시 작성하는 자동화된 파이프라인입니다. 이는 처음부터 레시피를 작성하는 것이 아니라, 기존 레시피를 가져와 다듬는 것입니다.

Xe-Forge 를 9 가지 특정 업그레이드를 스마트한 순서로 수행하는 주방을 방문하는 다단계 리모델링 팀으로 생각하세요:

  1. 알고리즘 최적화: "왜 음식 처리기로 한 번에 할 수 있는 양파를 작은 조각으로 썰고 있을까요?" (수학적 단축키를 찾습니다.)
  2. 발견: "잠깐, 이 단계는 전혀 요리할 필요가 없어요. 완전히 건너뛸 수 있습니다." (작업을 제거하는 개방적인 방법을 찾습니다.)
  3. Dtype 수정: "작은 양의 수프에 거대하고 무거운 냄비를 사용하고 있어요. 작고 가벼운 팬으로 바꿔봅시다." (에너지 절약을 위해 데이터 정밀도를 변경합니다.)
  4. 퓨전: "그릇을 씻고, 말리고, 그 다음에 치우는 대신, 한 번의 동작으로 씻고 말립시다." (별도의 단계를 하나로 결합합니다.)
  5. 메모리 접근: "식료품 저장실로 왔다 갔다 하는 것을 멈추세요. 향신료를 정리해서 한 번에 모두 집어올 수 있게 합시다." (데이터 가져오기 방식을 최적화합니다.)
  6. 블록 포인터: "자자로 거리를 재는 것을 멈추세요. 미리 표시된 줄자를 사용하세요." (현대적이고 효율적인 코드 도구를 사용합니다.)
  7. 지속적 커널: "각 타일마다 새로운 직원을 보내는 대신, 한 팀이 남아 전체 작업을 수행하게 합시다." (설정 시간을 줄입니다.)
  8. GPU 특정 튜닝: "이 오븐은 팬을 강하게 켜고 350 도에서 가장 잘 작동합니다. 그렇게 설정합시다." (인텔 특정 규칙을 적용합니다.)
  9. 자동 튜닝: "완벽한 온도를 찾기 위해 몇 가지 테스트 배치를 실행해 봅시다." (설정을 미세 조정합니다.)

3. "두뇌"와 "규칙서"

이 시스템은 Large Language Model (LLM) 을 두뇌로 사용하지만, LLM 은 종종 다른 회사 (예: NVIDIA) 의 데이터로 훈련되어 인텔의 특정 규칙을 알지 못합니다.

이를 해결하기 위해 Xe-Forge 는 선별된 지식 베이스를 사용합니다. 이는 셰프가 따라야 하는 규칙서로 생각할 수 있습니다. 여기에는 다음과 같은 구체적인 인텔 규칙이 포함되어 있습니다:

  • "24 명이 아닌 32 명의 작업자 그룹을 사용해야 합니다."
  • "메모리 블록은 2 의 거듭제곱이어야 합니다."
  • "이 특정 레지스터 모드를 잊지 마세요."

이 규칙서가 없으면 AI 는 추측하여 실패할 가능성이 높습니다. 이를 통해 AI 는 하드웨어가 실제로 수행할 수 있는 "안전 영역" 내에서 유지됩니다.

4. "안전 검사관" (CoVeR 에이전트)

이 시스템은 단순히 추측하고 기대하지 않습니다. 검증 및 정제 체인 (CoVeR) 에이전트를 사용합니다. 이는 각 단계에서 작업을 점검하는 안전 검사관과 같습니다:

  1. 코드가 컴파일됩니까? (오븐이 켜질 수 있습니까?)
  2. 구조가 올바른가요? (재료들이 올바른 순서로 있습니까?)
  3. 결과가 정확한가요? (수프가 원래와 같은 맛을 내지만 더 빠릅니까?)
  4. 실제로 더 빠릅니까? (시간을 절약했습니까?)

AI 가 실수를 하면 검사관이 그것을 잡아내어 AI 에게 정확히 무엇이 잘못되었는지 알려주고, AI 는 다시 시도합니다. 정확하고 더 빠른 버전을 찾을 때까지 이 과정을 반복합니다.

5. 결과: 변혁된 주방

연구진들은 97 가지 다른 레시피(커널) 와 복잡한 AI 작업인 Flash Attention(대규모 언어 모델에서 사용됨) 을 인텔 Arc Pro B70 GPU 에서 테스트했습니다.

  • 평균 승리: 최적화된 코드는 표준 최적화되지 않은 코드보다 평균 1.17 배 더 빠릅니다.
  • 대승리: 97 가지 레시피 중 67% 에서 속도가 빨라졌습니다. 9 가지 특정 레시피의 경우 5 배에서 82 배까지 더 빨라졌습니다.
    • 유사점: 요리하는 데 82 분이 걸리던 레시피가 있다고 상상해 보세요. Xe-Forge 는 그것을 단 1 분 만에 요리할 방법을 찾았습니다.
  • Flash Attention: 복잡한 "Flash Attention" 작업의 경우, 시스템은 모든 테스트에서 무언가를 깨뜨리지 않고 2 배에서 13 배까지 더 빠르게 만들었습니다.
  • 후퇴 없음: 중요한 점은 이 시스템이 결과를 깨뜨리는 방식으로 코드를 느리게 만든 적이 없다는 것입니다. 변경 사항이 도움이 되지 않으면 원래 코드를 유지했습니다.

결론

Xe-Forge 는 모든 문제를 해결하기 위해 초지능 AI 가 필요하지 않음을 증명합니다. 대신 다음과 같은 스마트하고 구조화된 프로세스가 필요합니다:

  1. 유능한 AI.
  2. 특정 하드웨어를 위한 엄격한 규칙서.
  3. 모든 변경 사항을 검증하는 엄격한 안전 검사관.

이 접근 방식은 새로운 하드웨어로 AI 코드를 포팅하는 지루하고 수동적인 작업을 제거하여, 개발자들이 이전보다 훨씬 빠르게 인텔 칩에서 강력한 AI 를 배포할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →