← 최신 논문
💻 computer science

TorchMorph: CUDA-accelerated Morphological Transforms

TorchMorph는 SciPy와 호환되는 API를 갖춘 22가지의 CUDA 가속 모폴로지 연산자와 거리 변환(distance transform)의 포괄적인 제품군을 제공하여, GPU 학습 루프 내에서 직접 효율적이고 높은 처리량의 형상 처리를 가능하게 하는 경량 MIT 라이선스 PyTorch 확장 기능입니다.

원저자: Kai Zhao

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kai Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 이미지 분석의 세계에서 컴퓨터는 형상을 이해하기 위해 오랫동안 고대의 신뢰할 수 있는 도구들에 의존해 왔습니다. 형태학적 변환(morphological transforms)이라고 알려진 이 도구들은 디지털 조각가의 정과 붓처럼 작동합니다. 이들은 거친 가장자리를 매끄럽게 다듬거나, 작은 구멍을 채우거나, 물체의 중심에서 가장자리까지의 거리를 측정할 수 있습니다. 수십 년 동안 컴퓨터 과학에서 이 도구들을 사용하는 표준적인 방법은 컴퓨터의 주 프로세서인 중앙 처리 장치(CPU)에서 실행하는 것이었습니다. 이 방식은 단순한 작업에는 잘 작동하지만, 현대의 인공지능이 방대한 양의 비디오나 3D 의료 스캔으로부터 학습하려고 할 때 커다란 벽에 부딪힙니다. 이러한 고급 시스템에서 데이터는 한 번에 수천 개의 계산을 처리하도록 설계된 장치인 특수 그래픽 프로세서(GPU)에 존재합니다. 이 오래된 도구들을 사용하려면 컴퓨터는 작업을 멈추고, 데이터를 메인 프로세서로 다시 복사하고, 느린 계산이 끝나기를 기다린 다음, 결과를 다시 복사해 와야 합니다. 이 끊임없는 정보의 이동은 마치 단 한 통의 편지를 전달하기 위해 도시를 가로질러 계속해서 왔다 갔다 하는 배달원과 같으며, 이는 시간과 에너지를 낭비하여 전체 학습 과정을 늦춥니다.

한 연구자가 이제 이 병목 현상을 제거하는 새로운 솔루션을 구축했습니다. 그들은 TorchMorph라는 소프트웨어 라이브러리를 만들었는데, 이는 이러한 형상 처리 도구들을 그래픽 프로세서로 직접 가져와, 데이터가 빠른 경로를 벗어나지 않고도 거대한 배치(batch) 데이터를 동시에 처리할 수 있도록 합니다. 연구자는 새로운 수학을 발명한 것이 아닙니다. 대신, 과학자들이 수년간 사용해 온 확립되고 신뢰할 수 있는 방법들을 가져와 그래픽 하드웨어에서 네이티브로 실행되도록 다시 작성한 것입니다. 그 결과, 이 시스템은 대규모 데이터 그룹을 처리할 때 기존 표준보다 최대 천 배 더 빠르게 이미지를 처리할 수 있으면서도, 원래의 방식과 극도로 정밀하게 일치하는 결과를 만들어냅니다. 이를 통해 인공지능 모델은 이러한 강력한 형상 도구들을 사후에 수행해야 하는 느리고 별개인 단계로 취급하는 대신, 학습의 정규적인 부분으로 사용할 수 있게 되었습니다.

이 성과의 핵심은 연구자가 작업을 어떻게 조직했느냐에 있습니다. 과거에 과학자가 노이즈가 있는 이미지를 정리하거나 특징 사이의 거리를 측정하고 싶을 때, 그들은 메인 프로세서용으로 설계된 코드 라이브러리를 사용했을 것입니다. 이 라이브러리는 단일 이미지를 처리하는 데는 탁월했지만, 현대의 AI 시스템이 작동하는 방식인 수십 개 또는 수백 개의 이미지를 한꺼번에 처리하는 데는 어려움을 겪었습니다. 새로운 라이브러리인 TorchMorph는 그래픽 프로세서가 단일한, 조정된 노력으로 이미지 전체의 배치를 처리할 수 있도록 함으로써 규칙을 바꿉니다. 이 라이브러리는 최대 8개의 서로 다른 공간 차원을 지원하며, 이는 복잡한 3D 볼륨, 타임랩스 비디오, 다채널 의료 스캔을 동시에 처리할 수 있음을 의미합니다. 연구자는 새 시스템이 기존의 것과 동일한 이름과 설정을 사용하여 같은 언어를 사용하도록 보장함으로써, 기존 컴퓨터 프로그램들이 단 한 줄의 코드 변경만으로 더 빠른 버전으로 전환할 수 있게 했습니다.

이러한 속도를 가능하게 하기 위해, 연구자는 그래픽 프로세서 내부에서 계산이 수행되는 방식을 재고해야 했습니다. 단순한 접근 방식은 프로세서가 이미지의 모든 지점을 이웃한 점들과 대조하는 방식인데, 이는 느리고 반복적인 방법입니다. 대신, 새 시스템은 메인 프로세서에서 "조각 도구"의 레이아웃을 미리 계산한 후 그래픽 칩에 명령을 보내는 영리한 전략을 사용합니다. 작업이 시작되면, 그래픽 프로세서는 계산이 단순하고 빠른 이미지의 내부 영역에만 집중하고, 복잡한 경계 체크는 오직 가장자리만을 위해 남겨둡니다. 이러한 분업을 통해 그래픽 프로세서는 풀 가동될 수 있으며, 불과 몇 천 개의 픽셀을 처리하는 데 걸렸던 시간 동안 수백만 개의 픽셀을 처리할 수 있습니다.

성능 향상은 상당하며 측정 가능합니다. 연구자가 강력한 그래픽 카드를 사용하여 새 시스템을 표준 방식과 테스트했을 때, 회색조(gray-scale) 이미지를 매끄럽게 만드는 것과 같은 특정 작업의 경우, 새 시스템이 이미지 배치를 처리할 때 최대 1,100배 더 빨랐음을 발견했습니다. 형상 내의 정확한 거리를 측정하는 데 있어서는 속도 향상이 더욱 극적이었으며, 표준 방식보다 350배 더 빨랐습니다. 두 가지 서로 다른 데이터 분포를 비교하는 가장 복잡한 계산의 경우에도 새 시스템은 최대 42배 더 빠르게 실행되었습니다. 이 수치들은 결과를 얻기 위해 몇 분을 기다리는 것에서부터 순식간에 결과를 얻는 것으로의 변화를 의미하며, 이러한 도구들을 학습 과정의 병목 현상에서 원활한 부분으로 변화시키는 변화입니다.

정확도 또한 속도만큼 중요했습니다. 연구자는 성능을 위해 정밀도를 희생하고 싶지 않았습니다. 그들은 새 시스템의 출력을 신뢰할 수 있는 표준과 비교하여 수천 번의 테스트를 수행했으며, 모든 단일 픽셀과 값을 확인했습니다. 결과는 새 시스템이 표준과 거의 완벽하게 일치함을 보여주었습니다. 흑백으로만 구성된 이진 이미지(binary images)의 경우 결과는 동일했습니다. 회색 음영이 있는 이미지의 경우, 차이는 너무 작아서 200만 분의 1 단위 미만이었으며, 이는 인간의 눈에는 사실상 보이지 않고 실무 적용에는 무의미한 오차 범위입니다. 이러한 엄격한 테스트는 새 시스템이 빠를 뿐만 아니라 신뢰할 수 있다는 것을 확인시켜 주며, 의료 진단이나 자율 주행과 같은 중요한 응용 분야에서도 안전하게 사용할 수 있음을 입증합니다.

이 라이브러리는 형상을 침식(erosion)하고 팽창(dilation)시키는 기본적인 작업부터, 어떤 지점에서 가장 가까운 가장자리까지의 정확한 거리를 찾는 것과 같은 더 고급 기능에 이르기까지 폭넓은 작업을 다룹니다. 또한 하나의 형상을 다른 형상으로 변형하는 데 드는 "작업량"을 기준으로 형상을 비교하는 특화된 도구도 포함하고 있는데, 이는 인공지능이 패턴을 인식하도록 가르치는 데 점점 더 많이 사용되는 기술입니다. 이 모든 도구는 이제 누구나 사용할 수 있는 단일 오픈 소스 패키지로 제공됩니다. 이러한 고전적인 이미지 처리 도구와 인공지능을 구동하는 현대적 하드웨어 사이의 장벽을 제거함으로써, 연구자는 더 정교하고 효율적인 학습 시스템을 위한 문을 열었습니다. 이 작업은 때때로 가장 중대한 진보가 새로운 물리 법칙을 발견하는 것이 아니라, 우리가 오늘날 가진 도구들에 기존의 법칙을 적용하는 더 나은 방법을 찾는 데서 온다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →