Enabling New Discoveries with Machine Learning
이 논문은 Astronomaly 프레임워크를 검토하고, 딥러닝과 능동적인 인간의 입력을 결합하는 것이 차세대 망원경에 의해 생성되는 방대한 데이터 세트에서 희귀하고 새로운 천문학적 천체를 식별함으로써 과학적 발견의 자동화를 어떻게 가능하게 하는지 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우주는 인간의 귀가 홀로 듣기에는 너무 시끄러워지고 있습니다. 향후 몇 년 안에, 거대한 새로운 망원경들이 하늘을 스캔하며 천문학자들이 지금까지 직면했던 것과는 비교도 안 될 만큼 빠른 속도로 이미지와 신호를 포착하기 시작할 것입니다. 베라 C. 루빈 천문대(Vera C. Rubin Observatory)라는 한 프로젝트는 결국 약 200억 개의 광학 은하를 목록화할 것이며, 매일 밤 1,000만 번 이상 하늘에서 변화하는 무언가를 포착할 것입니다. 또 다른 프로젝트인 스퀘어 킬로미터 어레이(Square Kilometre Array)는 10억 개 이상의 라디오 은하를 발견할 것입니다. 데이터가 이토록 압도적인 양으로 밀려들 때, 과학자가 자리에 앉아 모든 이미지나 신호를 하나하나 직접 살펴보던 기존의 방식은 불가능해집니다. 과제는 더 이상 데이터를 수집하는 것만이 아니라, 건초더미의 크기가 행성만 한 상황에서 그 안의 바늘을 찾아내는 것입니다.
이를 해결하기 위해 연구자들은 컴퓨터가 모든 규칙에 대해 명시적으로 프로그래밍되지 않고도 패턴을 인식하는 법을 배우는 분야인 머신러닝(기계 학습)으로 눈을 돌리고 있습니다. 그러나 단순히 특이한 것을 찾아내라고 설정된 단순한 컴퓨터 프로그램만으로는 충분하지 않습니다. 수십억 개의 객체로 가득 찬 데이터셋에서, 컴퓨터는 과학적 가치가 없는 카메라의 결함이나 렌즈의 얼룩을 '이상한 것'으로 분류할 수도 있기 때문입니다. 진정한 목표는 우리의 우주에 대한 이해를 새로 쓸 수 있는 진정으로 흥미로운 변칙체, 즉 희귀하고 새롭거나 예상치 못한 객체를 찾는 것입니다. 바로 이 지점에서 미셸 로크너(Michelle Lochner)와 그녀의 동료들의 연구가 빛을 발하며, 원시 컴퓨팅 능력과 인간의 호기심 사이의 간극을 메우는 새로운 방법을 제시합니다.
연구진은 과학자들이 이러한 방대한 데이터셋을 효율적으로 걸러낼 수 있도록 설계된 '아스트로노말리(astronomaly)'라는 도구를 개발했습니다. 컴퓨터에게 새로운 유형의 객체가 정확히 어떻게 생겼는지 가르치는 대신(새로운 것을 본 적이 없다면 이는 불가능한 일입니다), 이 시스템은 '능동 학습(active learning)'이라는 방법을 사용합니다. 이 과정에서 컴퓨터는 데이터를 스캔한 후 가장 유망한 후보들을 소량 선별하여 인간 과학자에게 제시합니다. 그러면 과학자는 이를 '흥미로운 것' 또는 '흥미롭지 않은 것'으로 분류합니다. 컴퓨터는 이러한 선택으로부터 학습하여 인간이 무엇을 가치 있게 여기는지에 대한 이해를 정교화하고, 그에 따라 나머지 데이터를 분류합니다. 이는 기계가 분류라는 힘든 작업을 처리하고, 인간은 진정으로 중요한 발견을 포착하는 직관을 제공하는 파트너십을 형성합니다.
이러한 접근 방식은 이미 실제적인 발견으로 이어졌습니다. 연구팀은 '아스트로노말리'를 사용하여 SAURON이라 불리는 새로운 유형의 라디오 신원을 식별해 냈는데, 이는 '비열적 복사(Nonthermal radiation)의 가파르고 불균일한 고리(Steep and Uneven Ring of Nonthermal radiation)'를 의미합니다. 미어캣(MeerKAT) 은하단 레거시 서베이 데이터에서 발견된 이 객체는 알려진 어떤 신호와도 닮지 않았으며, 두 개의 초거대 블랙홀이 병합되는 잔해일 가능성이 있습니다. 또한 이 시스템은 전통적인 방식으로는 놓쳤을 법한 특이한 변광성과 은하 병합 현상을 밝혀내는 데에도 도움을 주었습니다. 한 사례에서는 이 도구가 다크 에너지 카메라 레거시 서서베이(Dark Energy Camera Legacy Survey)의 광학 이미지 약 400만 장을 분석하여, 표준 분류를 벗어난 객체들을 포함해 인간 전문가들이 가장 흥미롭다고 느낀 12개의 특정 소스를 강조해 냈습니다.
이 성공의 핵심은 컴퓨터가 데이터를 이해하는 방식에 있습니다. 수십 년 동안 과학자들은 은하의 모양이나 시간에 따른 별의 밝기 변화와 같이 컴퓨터가 찾아야 할 특징(feature)을 수동으로 설계해야 했습니다. 이는 컴퓨터가 찾을 수 있는 범위를 제한하는 어려운 단계였습니다. 새로운 연구는 더 발전된 형태의 머신러닝인 딥러닝(심층 학습)을 사용하면 컴퓨터가 스스로 이러한 특징들을 찾아낼 수 있음을 보여줍니다. 이미지를 통해 복잡한 패턴을 인식하도록 컴퓨터를 훈련함으로써, 시스템은 데이터에 대한 풍부한 내부 지도를 생성할 수 있습니다. 연구진이 이 방법을 적용했을 때, 컴퓨터가 유사한 은하들을 그룹화하고 특이한 것들을 이전보다 훨씬 더 높은 정확도로 분리해 낼 수 있음을 발견했습니다.
그러나 연구진은 이러한 첨단 시스템이 작동하는 방식에서 미묘하지만 중요한 반전을 발견했습니다. 기존의 수동 설계된 특징을 사용할 때는 특이한 객체들이 데이터 지도 상의 아주 가장자리에 위치하여 이상치(outlier)로서 쉽게 눈에 띄었습니다. 하지만 새로운 딥러닝 방식을 사용하면, 특이한 객체들이 일반적인 것들과 섞여 데이터 지도 깊숙한 곳에서 발견되는 경우가 많았습니다. 오직 가장자리에 있는 것들만 찾는 컴퓨터는 이들을 놓칠 수밖에 없습니다. 이를 해결하기 위해 팀은 '아스트로노말리: 프로테제(astronomaly: protege)'라는 버전의 도구로 접근 방식을 개선했습니다. 이 버전은 단순히 통계적인 특이점을 찾는 대신, 인간 사용자가 흥미를 느끼는 것에 전적으로 집중하며, 사용자의 피드백으로부터 직접 학습하여 복잡한 데이터 지도를 탐색합니다.
논문은 데이터의 홍수 속에서 발견의 미래는 인간과 기계 사이의 이러한 구체적인 형태의 파트너십에 달려 있다고 결론짓습니다. 새로운 망원경으로부터 쏟아지는 데이터가 늘어남에 따라, 비범한 것을 찾는 과정을 자동화하는 능력은 필수적이 될 것입니다. 연구진은 '흥미롭다'는 특성은 과학자마다 다를 수 있는 주관적인 성질이기 때문에, 최선의 길은 그것을 코드로 완벽하게 정의하려는 것이 아니라, 우리로부터 그것을 배우는 시스템을 구축하는 것이라고 주장합니다. 기계의 속도와 인간 전문가의 직관을 결합함으로써, 천문학자들은 1967년 조슬린 벨 버넬(Jocelyn Bell Burnell)이 발견한 첫 번째 펄서만큼이나 놀라운 다음의 위대한 발견이 소음 속에 묻히지 않도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.