← 최신 논문
⚡ electrical engineering

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

이 논문은 기존의 취약한 심볼 인식 및 규칙 기반 방식의 한계를 극복하기 위해, 화학 공학 지식을 활용하여 P&ID 도면으로부터 장비 태그를 정확하게 추출하고 공정 토폴로지를 추론하는 2단계 멀티모달 거대 언어 모델 워크플로를 제안한다.

원저자: Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

게시일 2026-07-23
📖 5 분 읽기🧠 심층 분석

원저자: Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 고대의 도서관을 걷고 있다고 상상해 보십시오. 그곳의 책들은 종이로 만들어진 것이 아니라, 빛나는 전선과 파이프들이 거대하게 뒤엉킨 웹(web) 형태로 되어 있습니다. 이것들은 단순한 장식이 아닙니다. 이것들은 공장이 어떻게 숨 쉬고, 움직이고, 생각하는지에 대한 설계도입니다. 공학의 세계에서 이 설계도들은 P&ID(배관 계장도)라고 불립니다. 이것들은 컴퓨터가 화학 공장, 발전소, 또는 수처리 시설을 어떻게 운영할지 알려주는 비밀스러운 언어입니다. 수십 년 동안 이 설계도들은 오래된 종이 위에 있거나 흐릿한 디지털 이미지 형태로 갇혀 있었습니다. 그것들은 마치 잠겨 있는 보물 상자와 같습니다. 금(가치 있는 데이터)으로 가득 차 있지만, 그 상자를 열 열쇠를 찾지 못한 상태인 것입니다. 엔지니어들은 이 지저한 도면들을 뚫어지게 쳐다보며 모든 연결 관계를 일일이 수동으로 타이핑해야 하는데, 이는 누군가 계속 글꼴을 바꾸는 와중에 소설 한 권을 손으로 베껴 쓰는 것과 같이 느리고 오류가 발생하기 쉬운 작업입니다.

최근, 새로운 종류의 "슈퍼 독자"가 등장했습니다: 바로 멀티모달 거대 언어 모델(MLLM)입니다. 이들을 AI 탐정이라고 생각해 보십시오. 이들은 이미지를 보면서 동시에 그 안의 텍스트를 읽을 수 있으며, 단순히 기호가 어떻게 생겼는지가 아니라 그것이 무엇을 의미하는지까지 이해합니다. 과학자들이 던진 큰 질문은 이것입니다: 우리가 이 AI 탐정들에게 지저분한 설계도를 건네주며 즉시 완벽한 디지털 지도로 변환하라고 요청할 수 있을까요? 아니면 이 작업이 단 한 번의 빠른 훑어보기로는 너무 복잡한 일일까요? 이것이 임페리얼 칼리지 런던(Imperial College London)의 연구팀이 해결하기로 결심한 퍼즐입니다. 그들은 이 AI 탐정들에게 모든 것을 한꺼번에 하려고 애쓰는 대신, 실제 공장이 어떻게 작동하는지에 대한 지식을 사용하여 작업을 더 작고 스마트한 단계로 나누도록 가르칠 수 있는지 알고 싶었습니다.

연구진은 AI에게 이 복잡한 공장 설계도를 디지털화하도록 요청하는 두 가지 서로 다른 방법을 테스트하기 위해 나섰습니다. 그들의 첫 번째 아이디어는 "스피드 런(Speed Run)" 접근법이었습니다. 그들은 전체 설계도 이미지(AI가 압도되지 않도록 조각으로 나눈 것)와 공정에 대한 짧은 설명을 AI에게 입력하고, 한 번에 완벽한 디지털 지도를 뱉어내라고 요청했습니다. 그들은 이를 "엔드 투 엔드(End-to-End)" 방식이라고 불렀습니다. 이것은 학생에게 교과서 전체를 읽고, 줄거리를 이해하고, 단 한 번의 앉은 자리에서 등장인물과 그들의 관계를 요약하여 쓰라고 시키는 것과 같습니다. 아무런 메모도 하지 않은 채 말이죠.

두 번째 아이디어는 "팀 허들(Team Huddle)" 접근법이었습니다. 여기서 그들은 작업을 두 개의 뚜렷한 단계로 나누었습니다. 먼저, 한 명의 AI 에이전트가 순수한 "스캐너" 역할을 하여, 설계도 조각들을 보고 연결 관계는 무시한 채 오직 눈에 보이는 모든 장비와 계기들을 목록으로 만드는 것입니다. 이것은 마치 사서가 이야기의 흐름은 신경 쓰지 않고 선반 위의 모든 책 제목을 단순히 나열하는 것과 같습니다. 그다음, 두 번째 AI 에이전트가 그 이름 목록과 결정적으로, "공장의 규칙"(예: "펌프에는 들어오는 파이프와 나가는 파이프가 필요하다")을 전달받습니다. 이 두 번째 에이전트는 원래 그림의 지저분한 선들을 추적하는 대신, 공학적 논리에 기반하여 이 부품들이 어떻게 연결되어야 하는지를 머리를 써서 파악합니다. 이것이 "분해된(Decomposed)" 방식입니다.

그들이 두 가지 실제 공장 도면—질소 흡착식 압력 변동 흡착(Nitrogen Pressure Swing Adsorption) 플랜트와 습식 배연 탈황(Wet Flue Gas Desulfurization) 플랜트—를 대상으로 이 방법들을 테스트했을 때, 결과는 명확했습니다. "스피드 런" 접근법은 고전했습니다. 공정 설명을 조금 도와주었음에도 불구하고, 연결 관계를 약 40%의 확률로 틀렸습니다. 그것은 마치 학생이 줄거리 반전을 추측하는 것과 같았습니다. 등장인물(장비)은 제대로 이름을 맞혔지만, 누가 누구와 대화하고 있는지 계속 헷갈려 했습니다. 그러나 "팀 허들" 접근법은 게임 체인저였습니다. "보는 것"과 "생각하는 것"을 분리하고, 두 번째 AI에게 공학 규칙이라는 치트 시트를 제공함으로써 정확도가 급상승했습니다.

질소 플랜트의 경우, "팀 허들" 방식은 단일 단계 방식의 68.56%와 비교하여 88.78%의 총 정확도를 달-성했습니다. 이 방식은 모든 장비를 정확하게 찾아냈으며(노드 정확도 100%), 연결 관계를 80.58%의 확률로 정확히 파악했습니다. 더 복잡한 슬라임 및 오프가스(Slime and Off-gas) 플랜트의 경우, 개선 효과는 더욱 극적이었습니다. 단일 단계 방식은 연결 관계를 약 59%만 맞혔지만, "팀 허들" 방식은 연결 정확도 74.12%, 전체 정확도 85.21%로 뛰어올랐습니다. 연구진은 AI가 저지른 실수(누락된 부품, 추가된 부품, 잘못된 연결)의 수를 세는 "단순 거리(Simple Distance)" 점수를 사용하여 이를 측정했습니다. "팀 허들" 방식은 질소 플랜트에서 단일 단계 방식의 45.6점에 비해 훨씬 적은 24.0점을 기록했습니다.

이 논문은 비결이 단순히 더 똑똑한 AI를 갖는 것이 아니라, 더 똑똑한 "워크플로우"를 갖는 데 있다고 제안합니다. AI에게 보는 것과 추론하는 것을 동시에 하도록 요구하는 것은, 특히 도면이 지저분하거나 선이 끊어져 있을 때 인지적 부하가 너무 크다는 것이 밝혀졌습니다. 한 부분의 시스템이 순수하게 텍text와 기호를 읽는 데 집중하게 하고, 다른 부분이 공학적 논리를 적용하여 연결 관계를 파악하는 데 집중하게 함으로써 시스템은 훨씬 더 신뢰할 수 있게 됩니다. 연구는 하나의 거대한 프롬프트가 작동할 수는 있지만, 구조화된 분해 워크플로우의 안내 없이 상세한 내용에 길을 잃기 쉬운 복잡한 도면에서는 성능이 현저히 떨어진다는 것을 보여줍니다.

결과가 유망하기는 하지만, 저자들은 이것이 모든 것을 즉시 해결하는 마법 지팡이가 아니라 측정된 개선 사항임을 주의 깊게 언급했습니다. 그들은 단순히 공정 설명을 추가하는 것이 약간의 도움이 되었지만, 과업을 나누는 것과 구체적인 화학 공학 규칙을 추가하는 것이 결합되었을 때 진정한 차이를 만들었다는 것을 발견했습니다. 또한 그들은 실질적인 장애물을 지적했습니다: 그들이 사용한 AI 모델들은 독점적(기업 소유)이며, 이는 비밀 설계도를 외부 서버와 공유하고 싶지 않은 공장들에게 개인정보 보호 문제를 제기합니다. 그러나 그들은 동일한 "팀 허들" 워크플로우가 향후 오픈 소스 모델에서도 작동할 수 있다고 제안했습니다.

결국, 이 연구는 우리 산업 세계를 디지털화하는 미래가 모든 것을 수행하는 단 하나의 슈퍼 브레인을 만드는 것이 아니라, 서로 대화하는 전문화된 전문가 팀을 구축하는 데 있다는 것을 시사합니다. AI에게 그림을 보는 행위와 그 뒤에 숨겨진 공학적 논리를 이해하는 행위를 분리하도록 가르침으로써, 우리는 먼지 쌓이고 뒤엉킨 블루프린트를 컴퓨터가 더 스마트하고 안전한 공장을 건설하는 데 실제로 사용할 수 있는 깨끗한 디지털 지도로 바꿀 수 있습니다. 이는 때때로 거대하고 지저분한 문제를 해결하는 가장 좋은 방법은 그것을 작고 관리 가능한 조각들로 나누고, 전문가들이 각자 잘하는 일을 하도록 내버려 두는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →