← 최신 논문
💻 computer science

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard는 깨끗한 교사 모델을 사용하여 특징 정렬과 지식 증류를 통해 오염된 타겟 모델을 유도하고 정화함으로써, 기능적 정확성을 유지하면서 공격 성공률을 효과적으로 낮추어 AI가 생성한 RTL 코드의 백도어 위협을 완화하는 경량화된 교사-학생 방어 프레임워크이다.

원저자: Mahshid Rezakhani, Kimia Azar, Hadi Kamali

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mahshid Rezakhani, Kimia Azar, Hadi Kamali

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 전자 공학의 세계에서 컴퓨터 칩의 설계도는 레지스터 전송 레벨(Register Transfer Level, RTL)이라 불리는 특수 언어로 작성됩니다. 수십 년 동안 엔지니어들은 하드웨어가 데이터를 어떻게 처리할지 정확하게 지시하기 위해 이 복잡한 명령들을 수동으로 만들어 왔습니다. 최근에는 대규모 언어 모델로 알려진 새로운 종류의 인공지능이 이 코드를 자동으로 작성하기 시작했습니다. 이러한 모델들은 하드웨어 기능을 설명하는 간단한 문장을 입력받아, 이를 구축하는 데 필요한 복잡하고 합성 가능한 코드를 생성할 수 있으며, 이는 스마트폰에서 위성까지 모든 것의 제작 속도를 높일 것으로 기대됩니다. 그러나 이러한 편리함은 숨겨진 위험을 동반합니다. 마치 인간 견습생이 결함이 있는 스승으로부터 나쁜 습관을 배울 수 있듯이, 이 AI 모델들은 훈련 과정에서 은밀하게 오염될 수 있습니다. 공격자는 모델의 학습 데이터에 악의적인 명령을 주입하여, 대부분의 시간에는 정상적으로 작동하다가도 특정하고 겉보기에 무해한 문구가 사용될 때마다 숨겨진 결함, 즉 하드웨어 트로잔(Hardware Trojan)을 삽입하도록 만들 수 있습니다. 이는 칩이 특정 트리거에 의해 비밀스럽고 파괴적인 기능이 활성화될 때까지 완벽하게 작동하는 것처럼 보이게 만드는 공급망의 침묵하는 위협을 창출합니다.

방어자들에게 어려운 점은 이러한 모델들이 종종 거대하고 복잡하며, 단 하나의 기업도 완전히 검증할 수 없는 데이터로 훈련된다는 것입니다. 오염된 모델을 수정하는 전통적인 방법들은 대개 시스템 전체를 처음부터 다시 훈련시켜야 하는데, 이 과정은 계산 비용이 너무 많이 들고 데이터 집약적이어서 설계 팀이 수행하는 것이 거의 불가능합니다. 더욱이, 단순히 모델이 나쁜 데이터를 '망각'하도록 시도하는 것은 모델이 좋은 코드를 쓰는 능력을 망가뜨려 하드웨어를 쓸모없게 만들기도 합니다. 센트럴 플로리다 대학교의 연구진은 이 딜레마를 해결하기 위해 RTLGuard라고 불리는 새로운 접근 방식을 개발했습니다. 모델 전체를 다시 구축하는 대신, 그들은 작고 신뢰할 수 있는 '스승(teacher)' 모델과 크고 잠재적으로 오염된 '학생(student)' 모델을 결합한 가벼운 기법을 사용합니다. 소량의 깨끗하고 검증된 데이터로 훈련된 스승 모델은 학생 모델이 올바른 하드웨어 코드를 작성하는 능력을 유지하면서도 악의적인 행동을 학습하지 않도록 안내합니다.

연구진은 먼저 자신들만의 오염된 모델을 만드는 방식으로 이 방법을 테스트했습니다. 그들은 표준 오픈 소스 AI 모델을 가져와서, 하드웨어 트로잔을 숨기도록 설계된 악의적인 샘플과 깨끗한 데이터를 혼합하여 미세 조정(fine-tuning)했습니다. 이러한 트로잔은 매우 정교했습니다. 모델은 정상적인 조건에서는 여전히 올바르게 보이고 예상대로 작동하는 코드를 생성하지만, 특정 트리거 문구가 사용될 때 데이터를 유출하거나, 시스템을 종료하거나, 성능을 저하시키는 숨겨진 결함을 심어 넣었습니다. 실험에서 이 오염된 모델들은 트리거 문구로 테스트했을 때 약 91%의 확률로 보안이 취약한 코드를 생성했으며, 동시에 올바르고 기능적인 코드를 생성하는 능력도 크게 떨어졌습니다. 연구진은 동일한 모델 제품군의 훨씬 더 작고 깨끗한 버전을 스승으로 사용하여 RTLGuard를 적용했습니다. 이 스승 모델은 구체적인 악의적 트리거가 무엇인지 알 필요가 없었습니다. 그것은 단지 올바르고 안전한 코드가 어떤 모습이어야 하는지에 대한 신뢰할 수 있는 기준만을 제공했습니다.

결과는 이 스승-학생 접근 방식이 모델의 유용성을 파괴하지 않으면서 위협을 성공적으로 무력화했음을 보여주었습니다. 연구진이 오염된 학생 모델과 동일한 크기의 스승 모델을 사용했을 때, 공격 성공률은 91%에서 단 16%로 떨어졌습니다. 스승이 학생보다 현저히 작더라도 방어 효과는 유지되어 공격 성공률을 20~30% 사이로 낮추었습니다. 결정적으로, 모델들은 자신의 본래 임무를 수행하는 능력을 잃지 않았습니다. 방어 전 오염된 모델들은 기능적이고 올바른 코드를 약 19%의 확률로만 생성할 수 있었습니다. 그러나 RTLGuard에 의해 정화된 후, 작동하는 코드를 생성하는 성공률은 45% 이상으로 급증했습니다. 이러한 개선은 다양한 유형의 AI 아키텍처와 서로 다른 모델 제품군 사이에서도 나타났으며, 이는 이 방법이 견고하고 적응력이 높음을 시사합니다.

또한 연구는 이 방법이 왜 잘 작동하는지를 세 부분으로 나누어 탐구했습니다. 시스템은 먼저 표준 감독(supervision)을 사용하여 학생이 올바른 코드를 다시 쓰도록 가르쳤습니다. 그다음으로는 지식 증류(knowledge distillation)라는 기법을 사용했는데, 여기서 학생은 자신이 생성하는 모든 단어에 대해 스승의 선택을 모방하며, 이를 통해 오염 단계에서 학습된 나쁜 습관을 효과적으로 덮어씁니다. 마지막으로 두 모델의 내부 표현(internal representations)을 정렬하여, 학생의 '사고 과정'이 스승의 깨끗한 논리와 일치하도록 했습니다. 연구진은 이 세 가지 구성 요소를 모두 함께 사용할 때 가장 좋은 결과를 얻었으며, 이는 단 하나의 기술에만 의존하는 방법보다 훨씬 뛰어난 성과를 냈습니다. 또한 RTLGuard를 모델이 특정 데이터를 잊게 하거나 어텐션 패턴(attention patterns)을 증류하도록 설계된 기존의 다른 방어 전략들과 비교했습니다. 이러한 비교에서 RTLGuard는 더 높은 코드 품질을 유지하면서도 지속적으로 더 낮은 공격 성공률을 달anim으로써, 표적화된 가벼운 복구가 광범위하고 무거운 수정보다 더 효과적임을 입증했습니다.

가장 중요한 발견 중 하나는 이 방어 기법이 모델이 한 번도 본 적 없는 데이터에 대해서도 효과적이었다는 점입니다. 연구진은 훈련에 사용된 것과는 다른 하드웨어 설계 문제 세트로 정화된 모델을 평가했으며, 모델은 공격에 저항하면서도 고품질의 코드를 계속 생성했습니다. 이는 이 방어가 단순히 피해야 할 나쁜 사례 목록을 암기하는 것이 아니라, 스승으로부터 안전한 설계 원칙에 대한 근본적인 이해를 학습한다는 것을 시사합니다. 연구진은 또한 독립적인 두 번째 AI 시스템이 출력을 검사하게 하고 코드를 수동으로 검사하는 등 다양한 방법을 통해 결과를 검증했습니다. 이러한 검증은 공격의 감소가 실제적이며, 남은 오류들이 단순히 테스트 과정의 부산물이 아님을 확인해 주었습니다.

이 연구는 하드웨어 설계의 미래를 어떻게 확보할 것인가에 대한 중요한 변화를 강조합니다. 모델이 완벽하게 안전하거나 혹은 완전히 망가졌다고 가정하는 대신, RTLGuard는 손상된 시스템도 효율적으로 복구될 수 있음을 보여줍니다. 이 접근 방식은 오직 소량의 신뢰할 수 있는 데이터와 전체 재훈련에 필요한 계산 능력의 극히 일부만을 필요로 하므로, 제3자 AI 모델에 의야하는 기업들에게 실질적인 솔루션이 됩니다. 신뢰할 수 있는 가이드를 사용하여 모델을 안전한 행동으로 되돌림으로써, 연구진은 최종 제품의 보안을 희생하지 않으면서도 자동화된 설계의 속도와 편의성을 유지하는 것이 가능하다는 것을 보여주었습니다. 연구는 이 스승-학생 프레임워크가 숨겨진 데이터 기반 위협으로부터 칩 공급망의 무결성을 보호하기 위한 실행 가능한 경로를 제공한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →