← 최신 논문
💻 computer science

IndustryForge-27B: A Domain-Enhanced Multimodal Foundation Model for Industrial CAD

IndustryForge-27B는 52,000개의 산업용 CAD 샘플에 대한 통합 멀티태스크 학습을 통해 Qwen3.5-VL-27B를 기반으로 구축된 도메인 강화 멀티모달 파운데이션 모델로, 일반적인 능력을 유지하면서도 CAD 전용 벤치마크에서 베이스 모델과 폐쇄형 모델인 GPT-5.4를 모두 크게 능가하며 풀스택 산업용 에이전트를 위한 통합 기질로서 기능합니다.

원저자: Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nianchen Deng, Jiaxin Ai, Tao Hu, Shu Zou, Yurui Dong, Siqi Li, Xinyu Cai, Xuemeng Yang, Licheng Wen, Hongbin Zhou, Hairong Zhang, Pinlong Cai, Botian Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 세상에 존재하는 거의 모든 책을 읽은, 매우 재능 있고 박학다식한 사서와 같은 세상을 상상해 보십시오. 그들은 시를 쓰고, 수학 문제를 풀고, 간단한 비디오 게임을 위한 코드를 생성할 수도 있습니다. 하지만 여기에는 함정이 있습니다. 이 사서들은 공장에 발을 들여본 적도, 렌치를 잡아본 적도 없으며, 복잡한 엔지니어링 청사진을 본 적도 없습니다. 그들은 일반적인 지식에는 뛰어나지만, 특정 기계 부품을 설계하거나 거대한 산업용 로봇을 작동시키는 방법을 묻는다면 그들은 환각을 일으키기 시작합니다. 그들은 기어를 말로는 완벽하게 설명할 수 있지만 크기를 틀리게 말하거나, 엔지니어들이 소프트웨어와 대화할 때 사용하는 특수한 언어를 이해하지 못해 존재하지 않는 화면의 버튼을 "클릭"하려고 시도할 수도 있습니다.

이것이 바로 **컴퓨터 지원 설계(CAD)**의 과제입니다. CAD는 점토 대신 코드를 사용하여 아주 작은 나사부터 전체 비행기에 이르기까지 모든 것을 만드는 디지털 예술이자 과학입니다. 컴퓨터가 여기서 진정으로 유용해지려면 세 가지 까다로운 일을 동시에 수행해야 합니다. 즉, 2D 도면을 "보고" 그 안에 숨겨진 3D 형상을 이해해야 하고, 그 형상을 만들기 위한 정밀한 코드를 작성해야 하며, COM이라 불리는 매우 오래되고 특수한 언어를 사용하여 특정 산업용 소프트웨어(SolidWorks나 Inventor 등)와 대화하는 법을 알아야 합니다. 지금까지 최고의 범용 AI 모델들은 이론은 잘 알지만 직업 교육 시험에는 낙제한 우수한 학생과 같았습니다.

여기, 상하이와 여러 대학의 연구진이 만든 새로운 종류의 AI 모델인 IndustryForge-27B가 등장했습니다. 이 모델을 자동차를 만드는 완성된 로봇이 아니라, 대규모의 전문 훈련 캠프를 거친 "슈퍼 견습생"이라고 생각하십시오. 연구진은 강력한 범용 AI(Qwen3.5-VL-27B)를 가져와 약 52,000개의 산업 사례로 구성된 정교하게 선별된 라이브러리를 학습시켰습니다. 이 라이브러리에는 청사진을 읽는 것부터 단일 부품을 위한 코드를 작성하고, 복잡한 기계를 조립하며, 산업용 소프트웨어를 제어하는 것까지 모든 것이 포함되었습니다. 그 결과, 이 모델은 엔지니어링 세계의 "비밀 악수(secret handshake)"를 배우게 되었습니다.

논문에 따르면 이러한 특화된 훈련은 놀라울 정도로 효과적이었습니다. 네 가지 특정 엔지니어링 과제를 대상으로 테스트했을 때, 새 모델은 단순히 개선된 수준을 넘어 수직 상승했습니다. 단일 부품 코드를 작성하는 기본 점수가 약 **7.8%**에서 **77.8%**로 급증했으며, 거의 모든 테스트에서 최고 수준의 폐쇄형 경쟁 모델(gpt-5.4)을 압도했습니다. 아마도 가장 인상적인 점은, 이 모델이 여러 부품을 결합하는 조립(assemblies) 과정을 처리하는 법을 배웠다는 것입니다. 다른 모델들은 이 부분에서 거의 **0%**에 가까운 점수를 기록하며 거의 실패했던 반면 말입니다. 연구진은 또한 이러한 집중 훈련이 수학이나 독해력 같은 일반적인 작업을 수행하는 능력을 "망각"하게 만들지 않았는지 확인했습니다. 그렇지 않았습니다. 오히려 모델은 일반적인 작업에서도 약간 더 나아졌으며, 이는 엔지니어링 마스터가 되는 법을 배우는 것이 스마트한 비서로서의 능력을 무너뜨리지 않았음을 증명합니다.

하지만 논문은 기대치를 설정하는 데 신중을 기하고 있습니다. IndustryForge-27B는 하룻밤 사이에 새로운 아이폰을 설계해 주는 마법의 버튼이 아닙니다. 이것은 다른 도구들이 구축해 나갈 수 있는 공통의 출발점인 **기반(foundation)**입니다. 이 모델은 "AI가 도면을 읽고 코드를 쓸 수 있는가?"라는 어려운 문제를 해결함으로써, 다른 시스템들이 다음 단계에 집중할 수 있도록 해줍니다. 이는 엄청난 도약이지만, 저자들은 특히 복잡한 조립 과정과 설계 과정을 물리적 시뮬레이션에 연결하는 부분에서 여전히 할 일이 남아 있다고 인정합니다. 하지만 처음으로, 우리는 실제로 공장 현장의 언어를 구사하는 디지털 견습생을 갖게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →