← 최신 논문
💻 computer science

Transformer Accelerator (TFA): A Macro-Op INT8 Hardware Chip for Transformer Inference and Machine Translation

본 논문은 100% 기능 검증과 함께 CPU 베이스라인 대비 상당한 수준의 예상 에너지 및 속도 향상을 달성하며, 비트 단위로 정확한 엔드 투 엔드 트랜스포머 추론을 수행하는 합성 가능한 INT8 하드웨어 엔진인 Transformer Accelerator (TFA)를 제시한다.

원저자: Shashank

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shashank

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 트랜스포머라고 불리는 특정 유형의 신경망을 사용하여 말하고, 번역하고, 추론하는 법을 배웠습니다. 이러한 시스템은 매우 강력하지만, 동시에 무언가에 굶주려 있습니다. 문장에서 단 하나의 새로운 단어를 생성하기 위해, 트랜스포머는 학습된 사실들에 대한 전체 기억을 훑어보아야 하며, 이 과정은 방대한 양의 데이터를 이동시키는 것을 필요로 합니다. 스마트폰이나 센서와 같이 배터리로 구동되는 장치들에게 있어, 이러한 끊임없는 정보의 이동은 병목 현상을 일으킵니다. 숫자를 가져오는 데 필요한 에너지는 실제로 그 숫자로 계산하는 데 필요한 에너지를 종종 압도합니다. 이는 근본적인 문제를 만듭니다: 어떻게 하면 미묘한 차이를 이해하는 능력을 잃지 않으면서, 작고 저전력인 하드웨어에서 이러한 복잡한 언어 모델을 효율적으로 실행할 수 있는 기계를 만들 수 있을까요?

샤샹크(Shashank)라는 한 연구자는 바로 이 문제를 해결하기 위해 특별히 설계된 새로운 유형의 하드웨어 칩을 설계했습니다. 모든 것을 다 하려고 노력하는 범용 컴퓨터를 만드는 대신, 이 칩은 언어 번역에 필요한 특정 수학 연산을 처리하도록 만들어진 특화된 도구입니다. '트랜스포머 가속기(Transformer Accelerator)'라고 불리는 이 설계는 모델을 해석해야 할 프로그램이 아니라, 데이터를 메모리에서 계산 엔진으로 직접 이동시키고 다시 내보내는 일련의 명령 스트림으로 취급합니다. 목표는 사전 학습된 언어 모델을 가져와 완전히 실리콘 위에서 실행하고, 원래의 고정밀 컴퓨터 버전과 수학적으로 동일한 결과를 내면서도 훨씬 적은 에너지를 사용하는 장치를 만드는 것이었습니다.

이 작업의 핵심은 과학적 계산에 일반적으로 사용되는 복잡한 소수점이 아닌 정수(whole numbers)를 사용하여 작동하는 칩입니다. 이러한 더 단순한 정수로 전환함으로써, 이동해야 하는 데이터의 양을 획기적으로 줄였습니다. 그러나 이러한 전환은 보통 정확도의 손실을 초래하는데, 숫자의 미세한 차이가 반올림되어 사라지기 때문입니다. 연구자는 이러한 일반적인 반올림 방식이 이 특정 유형의 언어 모델에서는 실패하여 번역이 엉망이 된다는 것을 발견했습니다. 해결책은 칩을 바꾸는 것이 아니라, 하드웨어에 로드되기 전 모델을 준비하는 방식을 바꾸는 것이었습니다. 준비 단계에서 모델의 내부 가중치(weights)에 정밀한 수학적 회전(rotation)을 적용함으로써, 연구자는 까다로운 숫자들을 매끄럽게 다듬었습니다. 이를 통해 단순하고 저전력인 칩이 복잡한 원본과 비트 단위로 동일한 결과를 낼 수 있게 되었으며, 결과적으로 수학적 난제를 하드웨어가 아닌 소프트웨어 내부에 숨길 수 있었습니다.

이것이 효과가 있음을 증명하기 위해, 연구자는 영어에서 프랑스어, 독일어, 루마니아어로 바꿀 수 있는 완전한 사전 학습된 번역 모델을 가져와 칩을 위한 일련의 명령어로 컴파일했습니다. 그 후 칩을 엄격한 시뮬레이션에 통과시켜 프로세스의 모든 단계를 점검했습니다. 결과는 칩이 모델이 적절한 단어에 집중할 수 있게 해주는 복잡한 어텐션 메커니즘(attention mechanisms)을 포함하여 전체 번역 파이프라인을 오류 없이 실행할 수 있음을 보여주었습니다. 칩이 열 가지 까다로운 영어 속담을 생성했을 때, 밑바당 데이터 측면에서 원래의 컴퓨터 출력과 완벽하게 일치했습니다. 절반의 경우 최종 번역된 단어는 부동 소수점 참조값과 동일했으며, 나머지 절반의 경우 개념은 같지만 다른 단어를 사용하거나 다른 문장 부호를 사용하는 등 동일하게 유효한 번역을 생성했습니다. 이는 하드웨어가 빠를 뿐만 아니라 신뢰할 수 있음을 입증했습니다.

성능 향상은 상당했습니다. 표준 22-스레드 컴퓨터 프로세서와 비교했을 때, 이 칩 설계는 의도적으로 느리고 까다롭게 설정된 메모리 시스템에서도 가장 작은 구성에서 토큰을 20배 더 빠르게 생성할 수 있었습니다. 연구자들은 이 칩의 더 큰 버전들이 컴퓨터 베이스라인보다 거의 200배 더 빠를 수 있다고 전망했습니다. 더 중요한 것은 에너지 효율성이 경이로웠다는 점입니다. 이 칩은 컴퓨터 프로세서보다 단어 하나를 생성하는 데 약 3,000배 적은 에너지를 사용하는 것으로 추정되었습니다. 이러한 효율성은 칩이 다음 데이터를 가져오기 위해 계산이 끝나기를 기다리는 대신, 메모리가 허용하는 최대 속도로 가중치를 계산 유닛 옆으로 스트리밍할 수 있는 능력에서 비롯됩니다.

연구는 시뮬레이션에 그치지 않았습니다. 설계가 단순히 이론적인 연습이 아님을 보장하기 위해, 연구자는 칩의 디지털 설명을 실제 실리콘을 만드는 데 사용되는 완전한 제조 흐름을 통해 처리했습니다. 이 과정은 설계를 칩 위에 인쇄될 수 있는 물리적 레이아웃으로 변환했습니다. 결과물인 레이아웃은 제조에 필요한 모든 엄격한 규칙을 통과했으며, 이는 설계가 물리적으로 구현 가능하다는 것을 확인해 주었습니다. 테스트에 사용된 특정 버전은 더 오래되고 큰 제조 기술을 사용했지만, 성공적인 레이아웃은 이 아키텍처가 견고하며 현대의 고속 공정으로 축소될 수 있음을 입증했습니다. 고급 메모리 부품과 함께 구축될 물리적 칩은 더욱 작고 빨라질 것으로 기대됩니다.

이 프로젝트는 우리가 인공지능의 미래를 어떻게 구축할 것인가에 대한 변화를 강조합니다. 범용 컴퓨터를 더 빠르게 만드는 대신, 이 접근 방식은 한 가지 일을 완벽하게 수행하는 작고 특화된 엔진을 만드는 데 집중합니다. 부정확한 숫자를 다루는 어려운 수학을 소프트웨어 준비 단계로 분리함으로써, 하드웨어 자체는 단순하고 빠르며 매우 효율적으로 유지될 수 있습니다. 이 설계의 성공은 우리가 모델을 유용하게 만드는 정확성을 희생하지 않으면서도, 현재는 이를 감당하기에 너무 작은 장치들, 즉 '엣지(edge)'에서 정교한 언어 모델을 실행할 수 있음을 시사합니다. 앞으로의 과제는 이 설계를 확장하여 더 큰 모델과 더 복잡한 언어 작업을 처리하는 것이지만, 기초는 마련되었습니다. 즉, 슈퍼컴퓨터의 정밀도와 배터리 구동 장치의 효율성을 갖추고 세상의 언어들을 번역할 수 있는, 작고 검증되었으며 제조 가능한 칩의 토대가 세워진 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →