← 최신 논문
🤖 machine learning

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

이 논문은 느슨한 단일 형상 테스트를 12개의 적대적 게이트로 대체함으로써 현재 LLM이 생성한 GPU 커널의 높은 실패율을 드러내는 엄격하고 허용 오차가 없는 계약 등급(contract-grade) 검증기를 소개하는 동시에, 게이트 선형 재귀 계열을 위한 새로운 네이티브 Blackwell 역전파 구현을 검증한다.

원저자: Rishi Shah, Rishav Shrestha

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rishi Shah, Rishav Shrestha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초당 수백만 개의 식사를 요리하는 로봇 셰프를 만들고 있다고 상상해 보십시오. 속도를 높이기 위해, 당신은 아주 똑똑한 AI에게 로봇의 고속 두뇌(GPU)를 위한 구체적인 지침(이를 '커널'이라 부릅니다)을 작성하도록 요청합니다. 목표는 로봇이 인간이 결코 할 수 없는 속도로 요리하게 만드는 것입니다. 하지만 여기에는 함정이 있습니다. 만약 로봇이 토스트를 태우거나 수프 대신 돌덩이를 담아 서빙한다면, 아무리 빨라도 소용이 없다는 점입니다. 인공지능의 세계에서 이 '레시피'는 챗봇부터 의료 진단에 이르기까지 모든 것을 움직이는 엔진입니다. 수년 동안 과학자들은 이 AI가 작성한 레시피가 제대로 작동하는지 확인하기 위해 무작위로 몇 입을 맛보는 방식으로 검증해 왔습니다. 만약 그 맛이 원래의 것과 "충분히 비슷하다면", 그들은 그 레시피가 성공적이라고 선언했습니다. 하지만 만약 로봇이 당신에게 수프와 비슷한 맛이 나는 독을 몰래 서빙하고 있다면 어떨까요? 만약 작은 그릇 하나는 완벽하게 만들어내지만, 연회 전체를 차려내려고 하면 폭발해 버린다면 어떨까요? 이 논문은 무서운 질문을 던집니다. 우리는 단지 우리의 맛 테스트가 너무 단순해서 알아차리지 못했을 뿐인, 사실은 고장 난 "빠른" 레시피들을 축하하고 있는 것은 아닐까요?

이 논문의 저자들은 이 AI 작성 레시피를 검사하기 위해 훨씬 더 엄격한 "계약 등급(contract-grade)"의 검사관을 구축하기로 했습니다. 단순히 몇 입 맛을 보는 대신, 그들은 음식을 태우는지, 크기를 잘못 제공하는지, 혹은 건강한 재료를 독성 성분으로 몰래 바꾸는지와 같은 12가지의 서로 다른 테스트 세트를 만들었습니다. 그들은 이미 기존 시스템에 의해 "완벽하다"고 선언된 2,638개의 레시피에 이 엄격한 검사관을 실행했습니다. 결과는 충격적이었습니다. 그 "완벽한" 레시피 중 **62.1%**가 적어도 하나의 주요한 결함을 가지고 있었으며, **39.5%**는 어떤 "충분히 가까운" 수학적 계산으로도 변명할 수 없을 만큼 망가져 있었습니다. 이것들은 단순한 양념의 오차가 아니었습니다. 경고 신호(예: "NaN" 또는 무한대)를 정상적인 숫자로 바꾸어, 너무 늦기 전까지는 충돌을 숨겨버리는 것과 같은 조용한 재앙이었습니다.

저자들은 자신들이 단순히 까다롭게 굴거나 고장 난 자를 사용하고 있는 것이 아님을 증명하기 위해 영리한 방법을 썼습니다. 그들은 특정 유형의 AI 모델(Gated-Linear-Recurrence 계열)을 위한 자신들만의 초고성위 레시피를 처음부터 직접 작성했습니다. 이것은 최신 세대의 컴퓨터 칩(Blackwell)을 위한 완전히 새로운, 수기로 작성된 지침 세트였습니다. 그들은 자신들의 레시피를 골드 스탠다드인 배정밀도(double-precision) 계산기와 대조하여 정확함을 증명했습니다. 그런 다음, 자신들의 레시피를 엄격한 검사관에게 통과시켰습니다. 이 레시피는 모든 테스트를 통과했습니다. 이것이 그들의 "양성 대조군(positive control)"이었습니다. 만약 검사관이 다른 모든 것을 실패하게끔 설계된 도구였다면, 그들의 완벽한 레시피 역시 실패했을 것입니다. 하지만 통과했기에, 이 검사관은 신뢰할 수 있는 것입니다. 개발 과정에서 발생한 작은 실수(예: 안전 점검 누락)를 검사관이 잡아냈다는 사실은, 이 검사관이 편향된 것이 아니라 공정한 판관임을 증명했습니다.

또한 이 논문은 새로운 Blackwell 칩의 구체적이고 까다로운 문제를 다루었습니다. 이 칩들은 매우 제한적인 아주 빠르고 작은 메모리 공간(Tensor Memory)을 가지고 있습니다. 이 칩들을 위한 공식 "레시피"는 이 공간을 너무 많이 사용하려고 시도하여 컴퓨터를 멈추거나 충돌을 일으켰습니다. 저자들의 새로운 레시피는 이 공간을 어떻게 완벽하게 관리할지를 찾아내어 충돌을 피했습니다. 그러나 그들은 그 트레이드오프(trade-off)에 대해 솔직했습니다. 그들의 새로운 레시피는 안전하고 정확했지만, 기존의 "빠른" 라이브러리들보다는 느렸습니다. 그들은 자신들의 레시피가 세상에서 가장 빠른 것이라고 흉내 내지 않았습니다. 다만 그것이 새로운 칩에 네이티브(native)하면서도 실제로 정확한 첫 번째 레시피임을 증명했을 뿐입니다.

결론적으로, 이 논문은 "엄격함의 격차(rigor gap)"를 드러냅니다. 현재 AI가 생성한 코드를 테스트하는 방식은 다리가 튼리한지 확인하기 위해 자동차 한 대를 한 번 지나가게 하는 것과 같습니다. 이 새로운 검사관은 트럭과 탱크, 그리고 폭풍우를 보내 그 다리가 정말 견딜 수 있는지 확인하는 것과 같습니다. 연구 결과는 이 분야의 보고된 발전이 겉으로 보이는 숫자보다 훨씬 취약함을 시사합니다. "수용된" 커널 중 약 1,487개가 실제로 고장 나 있었던 반면, 표준 테스트는 새로운 검사관이 거부한 "좋은" 커널 중 단 14개만을 잡아냈습니다. 저자들은 우리가 "충분히 가까운 것"을 받아들이는 것을 멈추고, "이것이 무한대를 제대로 처리하는가?"나 "매번 동일한 답을 주는가?"와 같은 "계약 등급"의 정확성을 요구해야 한다고 주장합니다. 이는 미래의 AI 시스템이 속도의 환상이 아닌, 견고한 토대 위에 구축되도록 하기 위함입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →