Simulating is not always understanding: When model complexity obscures biology
이 논문은 진정한 생물학적 이해가 모델의 복잡성을 높이는 데서 오는 것이 아니라, 실험적 제약과 자유 매개변수 사이의 유리한 비율을 유지하고 세포의 행동이 기저 기제로부터 어떻게 발현되는지를 밝혀내는 체계적이고 해석 가능한 분석을 우선시하는 데서 온다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
자동차의 작동 원리를 이해하려고 노력한다고 상상해 보십시오. 당신은 엔진을 분해하여 모든 볼트, 피스톤, 스파크 플러그를 테이블 위에 늘어놓고 다시 조립할 수도 있습니다. 만약 자동차가 다시 작동한다면, 당신은 엔진을 성공적으로 시뮬레이션한 것입니다. 하지만 당신은 그것이 왜 작동하는지 실제로 이해했을까요? 어쩌면 부품을 다시 끼워 넣는 순서가 운 좋게 맞았을 수도 있습니다. 혹은 훨씬 적은 수의 부품만으로도 작동하는 엔진을 만들 수 있었을지도 모르지만, 볼트 개수를 세느라 너무 바빠서 그 사실을 몰랐을 수도 있습니다. 이것이 현대 세포 생물학이 직면한 딜레마입니다. 과학자들은 수천 개의 분자, 유전자, 화학 반응을 추적하는 디지털 트윈인, 매우 정교한 컴퓨터 세포 모델을 구축하고 있습니다. 이 모델들은 생명의 고해상도 비디오 게임과 같습니다. 하지만 우려의 목소리가 커지고 있습니다. 컴퓨터 시뮬레이션이 세포의 행동을 완벽하게 흉내 낼 수 있다고 해서, 그것이 우리가 게임의 규칙을 진정으로 이해했다는 뜻일까요? 당신이 읽게 될 논문은 이 문제를 다루며, 때로는 더 많은 세부 사항을 추가하는 것이 미스터리를 해결하기 쉽게 만드는 것이 아니라 오히려 더 어렵게 만든다고 주장합니다.
생물학자와 과학 철학자들로 구성된 이 논문의 저자들은 "모델 복잡성"에 대해 경종을 울리고 있습니다. 그들은 가장 상세한 "전세포(whole-cell)" 시뮬레이션을 구축하려는 서두름 속에서, 과학자들이 왜 그런 일이 일어나는지를 설명하는 능력을 잃어가고 있을지도 모른다고 주장합니다. 모델을 레시피라고 생각해 보십시오. 세 가지 재료가 들어간 간단한 레시피는 케이크가 왜 부풀어 오르는지(베이킹 소다가 식초와 반응하는 것) 정확히 알려줄 수 있습니다. 하지만 만약 당신이 "별가루 한 꼬집"과 "아침 이슬 세 방울"을 포함하여 5,000개의 재료가 들어간 레시피를 썼고, 그 케이크가 여전히 부풀어 올랐다면, 당신은 새로운 것을 배운 것이 아닙니다. 당신은 5,000개의 재료 중 실제로 어떤 것이 중요했는지 말할 수 없습니다. 논문은 진정한 이해가 더 많은 데이터를 쌓는 데서 오는 것이 아니라, 실세계의 실험에 의해 모델의 "노브(조절 가능한 숫자)"들이 엄격하게 통제되어, 어떤 노브가 기계를 움직이게 하는지 정확히 볼 수 있을 때 온다고 제안합니다.
"완벽한" 시뮬레이션의 함정
논문은 흔한 함정을 지적하며 시작합니다: 시뮬레이션은 이해와 같지 않습니다. 당신이 금고의 비밀번호를 맞추려고 한다고 상상해 보십시오. 만약 0000부터 9999까지 모든 조합을 시도하는 로봇이 있다면, 그 로봇은 결국 금고를 열 것입니다. 로봇은 금고를 "시뮬레이션"한 것입니다. 하지만 로봇는 비밀번호를 아는 것이 아닙니다. 단지 그 숫자 중 하나가 작동했다는 것을 알 뿐입니다. 세포 생물학에서 복잡한 모델은 실험실에서 관찰되는 데이터를 완벽하게 "맞출(fit)" 수 있습니다. 즉, 모델이 작동하게 만들기 위해 조정할 수 있는 자유로운 숫자(매개변수)가 너무 많다면, 그것은 마치 모든 조합을 시도하는 로봇과 같습니다. 그것은 모델이 작동할 수 있음을 증명하지만, 그 모델이 올바른 설명임을 증명하는 것은 아닙니다.
저자들은 모델이 우리에게 무언가를 가르쳐 주려면 단순히 우리가 이미 알고 있는 것을 복사하는 것 이상의 기능이 필요하다고 주장합니다. 모델은 다음과 같은 일을 해야 합니다:
- 우리가 아직 보지 못한 새로운 예측을 내놓아야 합니다.
- 우리가 서로 관련이 없다고 생각했던 두 가지 사이의 놀라운 연결 고리를 밝혀내야 합니다.
- 특정 부분을 변경했을 때 특정한 방식으로 실패함으로써, 그 부분이 필수적이었음을 보여주어야 합니다.
만약 모델이 너무 복잡해서 거의 무엇이든 맞출 수 있도록 조정될 수 있다면, 모델은 이 세 가지 모두에 실패합니다. 그것은 잘못된 이유로 정답을 내놓는 "블랙박스"가 됩니다.
"Sloppiness(무심함/느슨함)" 문제
여기서 논문은 **매개변수 슬로피니스(parameter sloppiness)**라는 개념과 함께 매우 흥м미로운 지점에 도달합니다. 당신이 라디오를 튜닝하고 있다고 상상해 보십시오. 볼륨 조절 노브가 하나뿐인 단순한 라디오라면 적절한 설정을 찾기 쉽습니다. 하지만 1,000개의 노브가 있고, 모든 노브를 서로 다른 설정으로 돌려도 똑같이 맑은 노래가 나온다면 어떨까요? 이것이 "슬로피니스"입니다. 이러한 복잡한 생물학적 모델에서 과학자들은 종 때때로 수십 개의 숫자를 크게 바꾸어도 모델이 여전히 정확히 똑같은 결과를 만들어내는 것을 발견합니다.
논문은 이것이 실제로 양날의 검이라고 설명합니다.
- 좋은 소식: 모델은 예측에 뛰어납니다. 숫자를 조정해도 결과가 크게 변하지 않기 때문에 모델은 견고(robust)합니다. 모든 부분의 정확한 값을 모르더라도 모델은 올ের 정답을 줄 가능성이 높습니다.
- 나쁜 소식: 모델은 설명에는 형편없습니다. 100개의 숫자를 바꿔도 동일한 결과를 얻을 수 있다면, 당신은 그 100개의 숫자 중 실제로 일을 하고 있는 것이 무엇인지 알 수 없습니다. "아, 이 특정 단백질이 원인이구나!"라고 말할 수 없습니다. 왜냐하면 모델은 "사실, 이 50개의 단백질 중 하나이거나 그들의 혼합체일 수도 있다"라고 말하기 때문입니다.
저자들은 세포 주기 모델(세포가 분열하는 과정)의 생생한 예를 사용합니다. 그들은 13개의 조절 가능한 숫자가 있는 "상세한" 모델과 단 3개만 있는 "최소한의" 모델을 비교했습니다. 두 모델 모두 세포가 적절한 시간에 분열하도록 만들 수 있었습니다. 그러나 숫자들이 얼마나 흔들릴 수 있는지 테스트했을 때:
- 상세한 모델은 "슬로피(sloppy)"했습니다. 약 **85%**의 모든 가능한 숫자 조합으로도 작동할 수 있었습니다. 어떤 숫자가 "진짜"인지 구별하는 것이 불가능했습니다.
- 최소한의 모델은 "타이트(tight)"했습니다. 오직 **2%**의 조합에서만 작동했습니다. 이 모델은 매우 제약되어 있었기 때문에, 과학자들이 시스템에 대해 실제로 무언가를 배울 수 있었습니다.
논문은 더 많은 실험 데이터로 그 숫자들을 고정하지 않은 채 더 많은 생물학적 세부 사항(더 많은 단백질, 더 많은 반응)을 추가하는 것은 모델을 더 "슬로피"하게 만들 뿐이라고 주장합니다. 그것은 마치 백만 개의 조각이 있는 퍼즐을 맞추려 하면서, 가이드로 삼을 수 있는 것은 상자에 그려진 그림뿐인 것과 같습니다. 조각들을 맞출 수는 있겠지만, 제대로 맞춘 것인지 알 방법은 없을 것입니다.
해결책: 벽이 아닌 사다리를 구축하라
그렇다면 과학자들은 무엇을 해야 할까요? 논문은 복잡한 모델을 구축하는 것을 최종 목표로 삼는 것을 멈춰야 한다고 제안합니다. 대신, 복잡한 모델을 발견의 여정을 위한 출발점으로 취급해야 합니다.
저자들은 시뮬레이션을 "이해"로 바꾸기 위한 두 가지 주요 전략을 제안합니다:
모델 계층 구조 구축 (사다리): 거대한 모델에서 시작하는 대신, 과학자들은 모델의 사다리를 구축해야 합니다. 가장 단순한 버전에서 시작하여 할 일을 수행하게 하십시오. 그다음, 단계별로 복잡성을 더하십시오. 각 단계에서 다음과 같이 물으십시오: "이 새로운 부분을 추가해야만 작동하는가?" 만약 단순한 모델이 똑같이 잘 작동한다면, 그 복합적인 부분은 필요하지 않았던 것입니다. 이는 "불필요한" 세부 사항을 제거하고 핵심 규칙을 찾는 데 도움을 줍니다. 논문은 조직 내에서 세포가 서로 달라붙는 방식을 모델링하는 것과 같은 일부 분야에서 이미 이 작업을 수행하고 있다고 지적합니다. 그들은 복잡한 행동(조직이 흐르거나 꽉 막히는 현상 등)을 설명하기 위해 몇 가지 규칙만을 가진 단순한 모델을 사용하며, 규칙이 단순하기 때문에 모든 가능성을 탐구하고 역학을 진정으로 이해할 수 있습니다.
"동역학적 분석" 수행 (지도): 과학자들은 단순히 시뮬레이션을 한 번 실행하고 그것이 맞는지 확인하는 것을 멈춰야 합니다. 그들은 "위상도(phase diagram)"를 그려내야 합니다. 시스템이 존재할 수 있는 모든 다른 상태를 보여주는 지도를 상상해 보십시오. 모델의 숫자들을 체계적으로 변경하면서 행동이 어떻게 변하는지 관찰함으로써, 과학자들은 "임계점(bifurcations)"을 찾아낼 수 있습니다. 이를 통해 무엇이 시스템을 제어하는지, 그리고 시스템을 너무 강하게 밀어붙이면 어떤 일이 발생하는지 알 수 있습니다 있습니다. 논문은 이러한 작업이 단순한 모델에서는 흔히 일어나지만, 거대한 "전세포" 모델에서는 계산 비용이 너무 많이 들기 때문에 드물게 수행된다고 언급합니다. 하지만 이 지도 없이는 모델은 단지 시연일 뿐, 설명이 아닙니다.
머신러닝의 반전
논문은 또한 생물학 분야에서 **머신러닝(AI)**의 부상을 다룹니다. AI 모델은 방대한 양의 데이터를 바탕으로 세포가 무엇을 할지 예측하는 데 매우 능숙해지고 있습니다. 하지만 저자들은 이러한 AI 모델들도 동일한 문제에 직면해 있다고 경고합니다. AI 모델은 종종 "정교한 보간기(interpolators)"입니다. 즉, 데이터의 패턴을 바탕으로 답을 추측하는 데는 매우 뛰어나지만, 왜 그 답이 나왔는지에 대해서는 반드시 알지 못합니다.
저자들은 만약 AI가 모델을 빠르고 저렴하게 구축할 수 있다면, 진짜 과제는 모델을 만드는 것에서 모델을 분석하는 것으로 전환된다고 제안합니다. 컴퓨터가 데이터에 맞는 모델을 생성할 수 있다고 해서 그 모델이 유용한 것은 아닙니다. 모델의 "노브"가 제약되어 있는지, 그리고 인과관계를 설명할 수 있는지 확인하는 힘든 작업은 여전히 우리에게 남아 있습니다.
결론
논문은 생물학적 모델링의 "정신(ethos)"을 변화시키라는 촉구로 끝을 맺습니다. 우리는 단지 그렇게 했다고 말하기 위해 세포의 모든 분자를 포함하는 것을 목표로 해서는 안 됩니다. 대신, 우리는 이해를 목표로 해야 합니다.
- 복잡성은 목표가 아닙니다: 수백만 개의 부품이 있는 모델이 자동으로 더 나은 것은 아닙니다.
- 제약이 핵심입니다: 모델 내부의 숫자들이 실제 실험에 의해 고정될 때만 유용합니다.
- 단순함이 진실을 드러냅니다: 때때로 복잡한 시스템을 이해하는 가장 좋은 방법은 여전히 작동하는 가장 단순한 버전을 찾고, 거기에 다시 무언가를 추가했을 때 어떤 일이 일어나는지 보는 것입니다.
저자들은 거대한 모델이 쓸모없다고 말하는 것이 아닙니다. 그들은 "전세포" 시뮬레이션을 구축하는 것은 케이크를 만들기 위한 모든 재료를 모으는 것과 같은 첫 번째 단계일 뿐이라고 말합니다. 진정한 작업—우리에게 이해를 주는 부분—은 케이크를 굽고, 맛을 보고, 정확히 어떤 재료가 케이크를 부풀게 했는지 알아낼 때 일어납니다. 그러한 분석을 수행하기 전까지, 우리는 세포를 이해하는 것이 아니라 단지 시뮬레이션하고 있을 뿐일지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.