A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation
본 논문은 대규모 도메인 지식을 합성하고 IR 기반의 직접 선호 최적화(Direct Preference Optimization) 워크플로우를 활용하여, 반도체 TCAD 및 FEM 시뮬레이션과 같이 데이터가 부족한 과학 분야에서 범용 모델보다 뛰어난 성능을 보이는 컴팩트하고 실행 가능한 도메인 특화 LLM을 구축하는 스키마 우선 정렬 프레임워크를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 전자 공학의 보이지 않는 세계에서, 우리 휴대폰과 컴퓨터를 구동하는 칩은 더 이상 단순히 설계되는 것이 아니라 시뮬레이션됩니다. 단 하나의 실리콘 웨이퍼가 절단되기 전에, 엔지니어들은 강력한 소프트웨어를 사용하여 이 미세한 장치들의 디지털 트윈을 구축합니다. TCAD(Technology Computer-Aided Design)라고 알려진 이 시뮬레이션은 가상의 실험실 역할을 합니다. 이를 통해 과학자들은 불과 몇 개의 원자 층 두께에 불과한 재료를 통해 전기가 어떻게 흐를지 예측할 수 있으며, 물리적인 제조에 드는 비용이나 시간 없이 수백만 가지의 변형을 테스트할 수 있습니다. 하지만 이러한 시뮬레이션을 실행하는 것은 매우 까다로운 일로 알려져 있습니다. 이는 소프트웨어에 가상 장치를 어떻게 구축할지, 재료를 어디에 배치할지, 그리고 결과를 어떻게 측정할지를 정확하게 지시하는 복잡하고 컴퓨터가 읽을 수 있는 스크립트를 작성하는 것을 요구합니다. 이 스크립트들은 완벽해야 합니다. 단 하나의 잘못된 단어나 틀린 숫자만 있어도 전체 시뮬레이션이 실패하여 엔지니어가 처음부터 다시 시작해야 하기 때문입니다. 수년 동안 업계는 이러한 스크립트를 작성하기 위해 인간 전문가에게 의존해 왔으며, 이 과정은 느리고 오류가 발생하기 쉬우며 자동화하기 어렵습니다.
연구팀은 이제 데이터가 매우 적은 상황에서도 인공지능이 이러한 스크립트를 올바르게 작성하도록 가르치는 새로운 방법을 개발했습니다. 그들은 반도체 공학의 언어를 이해하도록 설계된 특화된 컴퓨터 모델인 TcadGPT라는 시스템을 만들었습니다. 시를 쓰거나 뉴스를 요약할 수는 있지만 정밀한 기술적 작업에서는 종종 실패하는 범용 AI 모델들과 달리, 이 새로운 모델은 시뮬레이션 소프트웨어가 실제로 실행할 수 있는 코드를 생성하도록 훈련되었습니다. 연구진은 방대한 양의 합성 질문과 답변을 독특한 오류 수정 방식과 결함 없이 결합함으로써, AI가 높은 신뢰도로 유효한 스크립트를 생성하도록 가르칠 수 있다는 것을 발견했습니다. 그들의 연구는 데이터가 부족하고 오류의 비용이 큰 고도로 전문화된 분야에서, 적절한 방식으로 교육된다면 세심하게 조정된 작은 AI 모델이 가장 진보된 범용 시스템보다 더 뛰어난 성능을 발휘할 수 있음을 시사합니다.
연구진이 직면한 과제는 독특했습니다. 많은 분야에서 AI는 기존의 방대한 텍스트와 코드를 읽으며 학습합니다. 하지만 반도체 설계에서 공장에서 사용되는 실제 스크립트는 대개 비밀이며, 학습을 위해 공개된 매뉴얼들은 컴퓨터가 읽을 수 있도록 작성되지 않았습니다. 이는 데이터 부족 현상을 야기했습니다. 이를 해결하기 위해 팀은 더 많은 데이터가 나타나기를 기다리는 대신, 직접 데이터를 만들었습니다. 그들은 기존의 사용자 가이드와 교과서를 가져와 강력한 AI를 사용하여 150만 개 이상의 새로운 질문-답변 쌍을 생성했습니다. 그들은 이 생성을 위해 두 가지 다른 방법을 설계했습니다. 한 방법은 일반적인 개념을 포착하기 위해 문서를 폭넓게 읽는 것이었고, 다른 한 방법은 재료 이름이나 물리 법칙과 같은 특정 키상어에 집중하여 깊은 정밀도를 확보하는 것이었습니다. 이 과정은 모델에 강력한 지식 기반을 제공하여, 시뮬레이션이 어떻게 작동하는지에 대한 질문에 85.6%의 정확도로 답할 수 있게 했으며, 이는 동일한 테스트에서 50% 미만의 점수를 받은 일반 AI 모델들을 크게 앞지른 수치입니다.
그러나 사실을 아는 것과 코드를 작성하는 것은 다릅니다. 연구진은 모델에게 질문에 답하는 법을 가르치는 것만으로는 소프트웨어가 실행할 수 있는 스크립트를 작성하게 하기에 충분하지 않다는 것을 발견했습니다. 모델은 종-종 물리학적 내용은 맞히지만 구문(syntax)에서 실패하여, 명령의 순서를 잘못 배치하거나 결정적인 단계를 누락하곤 했습니다. 이를 해결하기 위해 그들은 두 번째의 더 엄격한 훈련 단계를 도입했습니다. 그들은 검증된 작동 가능한 스크립트를 가져와서, 구체적인 어구는 제거하되 핵심 의미는 유지하면서 구조적이고 논리적인 형식으로 분해했습니다. 그런 다음 이 스크러립트들의 수천 가지 변형을 만들었는데, 여기에는 완벽한 것도 있고 의도적으로 작은 오류가 포함된 것도 있었습니다. 모델은 이 쌍들을 보고 올바른 것을 선택하도록 요청받았으며, 이를 통해 아주 작은 실수조차 인식하고 피하는 법을 배웠습니다. 연구진이 IR-to-DPO라고 부르는 이 과정은 모델이 지시 사항을 엄격하게 따르도록 가르쳤습니다.
이 두 단계 훈련의 결과는 놀라웠습니다. 모델이 본 적 없는 20개의 새로운 지침에 대해 테스트했을 때, 최종 버전의 TcadGPT는 시뮬레이션 소프트웨어가 오류 없이 수용하는 스크립트를 80%의 확률로 성공적으로 생성했습니다. 반면, 최고 수준의 범용 AI 모델은 이 20번의 시도 모두에서 실패했으며, 인간에게는 올바르게 보이는 코드를 생성했으나 기계에 의해 거부되었습니다. 이 연구는 전문화된 분야에서 AI가 어떻게 학습하는지에 대한 놀라운 통찰을 보여주었습니다. 연구진은 테스트 중에 모델이 문서 라이브러리에 접근할 수 있도록 하는 기술인 '검색(retrieval)'이 도움이 되는지 테스트했습니다. 이 기술은 일반 AI 모델에는 도움이 되었지만, 특화된 모델의 성능에는 오히려 해가 되었습니다. 연구진은 이미 특정 주제에 대해 깊이 훈련된 모델의 경우, 테스트 중에 외부 정보를 추가하면 모델이 혼란을 느껴 학습한 정밀한 규칙에 대한 집중력을 잃게 된다는 것을 발견했습니다.
그들의 접근 방식이 단지 한 종류의 소프트웨어에 국한된 운 좋은 우연이 아님을 증명하기 위해, 팀은 동일한 훈련 레시피를 공학의 복잡한 물리 문제를 해결하는 데 사용되는 Elmer라는 다른 종류의 시뮬레이션 도구에 적용했습니다. 이 도구는 반도체 소프트웨어와 완전히 달랐음에도 불구하고, 그들의 방식으로 훈련된 모델은 질문에 답하는 것과 작동하는 코드를 작성하는 것 모두에서 일반 AI 모델을 능가했습니다. 이는 그들이 구축한 프레임워크가 다른 어려운 데이터 부족 과학 분야에도 적용될 수 있는 견고한 방법임을 시사합니다. 이 연구는 단 하나의 오류가 수백만 달러의 비용을 초래할 수 있는 고위험 공학의 세계에서, 앞으로 나아갈 길은 반드시 더 크고 일반적인 모델이 아니라, 극도의 정밀함과 규율을 가지고 교육된 작고 고도로 전문화된 모델이라는 것을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.