Position: AI for Science Should Treat Measurement-to-Dataset Pipelines as Inference Components
본 논문은 AI for Science 워크플로우가 숨겨진 가설 공간, 인증되지 않은 전이성, 통제되지 않은 다중성을 해결하고 정량화 가능한 파이프라인 적절성과 재현 가능한 과학적 증거를 가능하게 하기 위해 측정부터 데이터셋까지의 파이프라인을 고정된 데이터 소스가 아닌 능동적 추론 구성 요소로 취급해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"AI for Science 는 측정부터 데이터셋에 이르는 파이프라인을 추론 구성 요소로 취급해야 한다"는 논문의 내용을 일상적인 언어와 창의적인 비유로 풀어낸 설명입니다.
핵심 아이디어: "얼어붙은 렌즈" 문제
어두운 방에서 신비로운 물체를 이해하려고 한다고 상상해 보세요. 당신은 물체를 직접 볼 수 없습니다. 오직 특정 전구에서 비추어 벽에 드리워진 그림자만 볼 수 있을 뿐입니다.
AI for Science에서 연구자들은 마치 물체 자체를 연구하는 것처럼 행동합니다. 하지만 실제로는 그림자를 연구하고 있는 것입니다.
이 논문은 뇌 영상, 천문학, 신약 개발 등 많은 과학 분야에서 과학자들이 사용하는 데이터가 "있는 그대로의 현실"이 아니라고 주장합니다. 그것은 현실을 처리하고, 정제하며, 재구성한 버전일 뿐입니다. 이 처리 과정은 노이즈 제거, 누락된 부분 채우기, 신호 변환과 같은 긴 단계들의 사슬, 즉 파이프라인을 통해 이루어집니다.
현재 과학자들은 최종 데이터셋을 고정된 객관적 사실인 것처럼 취급합니다. "여기 데이터가 있으니 이제 모델을 만들자"라고 말합니다. 저자들은 이를 **"얼어붙은 렌즈 (Frozen Lens)"**라고 부릅니다. 그들은 이것이 실수라고 주장합니다. 데이터를 생성한 파이프라인은 실제로 과학적 추론의 거대한 부분인데, 이를 "얼려서 (무시해서)" 버림으로써 우리의 결론이 그 그림자를 드리우는 방식을 어떻게 선택했는지에 전적으로 의존한다는 사실을 숨기고 있는 것입니다.
이것이 잘못되는 세 가지 방법
저자들은 이 "얼어붙은 렌즈"가 과학을 실패하게 만드는 세 가지 구체적인 방식을 식별했습니다. 이것들을 세 가지 함정으로 생각하세요:
1. 숨겨진 메뉴 (숨겨진 가설 공간)
비유: 한 식당이 당신에게 버거를 서빙한다고 상상해 보세요. 당신은 그 버거가 셰프가 만든 것의 "진실"이라고 가정합니다. 하지만 셰프는 그 버거를 만드는 50 가지 다른 방법 (다른 빵, 다른 조리 시간, 다른 소스) 이 있는 메뉴를 가지고 있었습니다. 식당은 당신에게 그중 한 가지 특정 버전만 서빙했을 뿐, 나머지 49 가지에 대해서는 말해주지 않았습니다.
문제: 과학자들이 데이터셋을 공개할 때, 그들은 보통 원시 측정치를 처리하는 한 가지 방식을 선택합니다. 그들이 조금 다른 필터를 선택했거나 다른 정제 방법을 사용했다면, 그 "버거 (데이터)"가 완전히 다르게 보였을 수도 있다는 사실을 알려주지 않습니다.
결과: AI 모델은 그 버거의 한 가지 특정 버전만을 기반으로 예측하도록 학습합니다. 그것은 보편적인 진리를 발견한 것처럼 생각하지만, 실제로는 그 한 가지 특정 레시피의 기묘함만 외운 것입니다. 다른 가능한 현실들의 "메뉴"는 숨겨져 있습니다.
2. 깨진 지도 (인증되지 않은 이동성)
비유: 맑은 날을 위해 완벽하게 그려진 도시 지도가 있다고 상상해 보세요. 당신은 이 지도로 길을 찾습니다. 그런데 비가 오기 시작하고 거리가 침수됩니다. 그 지도는 맑은 날을 위해만 그려졌기 때문에 웅덩이를 보여주지 않습니다. 당신은 비 오는 날에 그 지도를 사용하려다 갇히고, 자신의 운전 실력을 탓합니다.
문제: 파이프라인은 데이터가 수집된 실험실 (맑은 날) 에서는 훌륭하게 작동할 수 있습니다. 하지만 같은 데이터 처리 방법을 다른 병원, 다른 국가, 또는 다른 기계에서 수집된 데이터 (비 오는 날) 에 적용하려고 하면, 파이프라인이 고장 나거나 데이터를 이상하게 왜곡할 수 있습니다.
결과: 과학자들은 종종 자신의 데이터 처리 방법이 언제 작동하지 않게 되는지 모릅니다. AI 모델이 새로운 데이터에서 실패할 때, AI 가 나쁜 것인지, 아니면 그 새로운 환경에는 "지도 (파이프라인)"가 무효였는지 알 수 없습니다.
3. 전문가들의 군중 (통제되지 않은 다중성)
비유: 100 명의 전문가로 구성된 배심원이 같은 범죄 현장 사진을 보고 있다고 상상해 보세요. 그들은 사실에 대해 모두 동의하지만, 모두 약간 다른 돋보기를 사용합니다. 90 명은 용의자가 유죄라고 결론 내리고, 10 명은 무죄라고 결론 내립니다. 뉴스는 "전문가들은 용의자가 유죄라고 말한다"라고 보도하며, 반대한 10 명은 무시합니다.
문제: 과학에서는 데이터를 처리하는 많은 "방어 가능한" 방법들이 종종 존재합니다. 노이즈를 제거하는 다섯 가지 다른 유효한 방법을 선택할 수 있습니다. 하나를 선택하면 한 가지 결과가 나옵니다. 다른 하나를 선택하면 다른 결과가 나옵니다.
결과: 과학자들은 종종 가장 "멋지거나" 가장 유의미한 결과를 주는 한 가지 방법을 선택하고, 나머지 99 가지 유효한 방법들이 다른 답을 주었을 것이라는 사실을 무시합니다. 그들은 자신의 단일 선택을 절대적인 진실로 취급하며, "우리는 100 가지 방법을 시도했고, 답은 조금 불안정합니다"라고 인정하는 대신 말입니다.
"EEG 감사": 현실 점검
이것이 단순한 이론이 아님을 증명하기 위해, 저자들은 우울증과 관련된 뇌 데이터 (EEG) 로 대규모 실험을 수행했습니다.
- 설정: 그들은 원시 뇌파 데이터를 245,376개의 서로 다른 처리 파이프라인 조합을 통해 실행했습니다. (모든 가능한 필터, 정제 도구, 측정 규칙의 조합을 시도해 본다고 상상해 보세요).
- 목표: 그들은 우울증이 있는 사람과 건강한 사람 사이의 뇌 활동 차이라는 특정 신호를 찾고 있었습니다.
- 충격적인 결과:
- 245,000 개 이상의 파이프라인 중 많은 것들이 "유의미한" 차이를 발견했습니다.
- 하지만, 그들이 그 차이들이 다른 그룹 (다른 데이터셋) 에서도 유지되는지 확인했을 때, 245,376 개 중 단 하나의 파이프라인만이 살아남았습니다.
- 이는 **0.0004%**의 생존율입니다.
이것이 의미하는 바: 이 분야에서 과학자들이 "발견"을 했을 때 거의 매번, 그들이 우연히 선택한 특정 파이프라인의 산물일 가능성이 높았습니다. "진실"은 너무도 취약해서 처리 규칙을 조금만 변경해도 그 발견이 사라졌습니다.
해결책: "계산 가능한 관찰 프레임워크"
저자들은 우리가 과학을 그만둬야 한다고 말하는 것이 아닙니다. 우리는 데이터를 다루는 방식을 바꿔야 한다고 말합니다.
현재 방식:
- 원시 데이터 [블랙박스 파이프라인] "정제된 데이터" AI 모델.
- 우리는 "정제된 데이터"가 진실인 것처럼 가장합니다.
제안된 방식:
- 원시 데이터 변수로서의 파이프라인 AI 모델.
- 우리는 파이프라인을 과학적 가설처럼 취급합니다. "파이프라인을 변경해도 이 결론이 유지됩니까?"라고 묻습니다.
그들은 다음과 같은 시스템을 구축할 것을 제안합니다:
- 파이프라인은 "실행 가능한 객체"입니다: "우리는 방법 A 를 사용했습니다"라고 말하는 PDF 보고서 대신, 방법 A 의 코드 (및 모든 가능한 변형) 가 실행, 테스트, 변경될 수 있는 디지털 객체로 저장됩니다.
- 안정성이 목표입니다: 단순히 가장 잘 예측하는 모델을 찾는 대신, 어떤 유효한 파이프라인을 사용하더라도 동일한 답을 주는 모델을 찾습니다.
- 불확실성은 공유됩니다: 100 개의 파이프라인이 100 개의 다른 답을 주면, 우리는 그 불확실성을 보고합니다. 숨기지 않습니다.
요약
이 논문은 AI for Science에서 현실을 측정하는 도구가 측정 자체만큼이나 중요하다고 주장합니다. 도구 (파이프라인) 를 무시함으로써 과학자들은 종종 흔들리는 땅 위에 AI 모델을 구축하고 있습니다. 그들은 처리된 데이터를 고정된 사실로 취급하는 것을 멈추고, 그것을 과학 실험의 가변적인 부분으로 취급하기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.