← 최신 논문
🧬 biology

Is Retrieval All You Need? Assessment and Emergence of Novelty in Protein Structure Generation

이 논문은 도메인 검색율(Domain Retrieval Rate, DRR)을 도입하여 생성된 대부분의 백본이 이미 알려진 구조적 도메인을 포함하고 있음을 밝힘으로써 낮은 전체 체인 유사도가 새로운 단백질 폴드(fold)를 보장한다는 가설에 이의를 제기하며, 복잡한 생성 모델 없이도 그러한 결과를 달할 수 있음을 입증하기 위해 제로 트레이닝 기반의 검색 방식 베이스라인인 RetFold를 제안한다.

원저자: Tongyue Xu, Yijie Zhang, Mutian He, Lingdong Shen, Zhihong Liu, Tianlei Ying, Cheng Tan

게시일 2026-08-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tongyue Xu, Yijie Zhang, Mutian He, Lingdong Shen, Zhihong Liu, Tianlei Ying, Cheng Tan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

당신이 새로운 요리를 발명하려는 마스터 셰프라고 상상해 보십시오. 생물학의 세계에서 '재료'는 단백질, 즉 모든 생명체를 만들고 움직이게 하는 분자 기계입니다. 수십 년 동안 과학자들은 컴퓨터에게 자연계에는 존재하지 않았던 완전히 새로운 단백질 형태를 만들어내는 법을 가르치기 위해 노력해 왔습니다. 만약 컴퓨터가 기존의 알려진 단백질들이 모인 거대한 도서관에 있는 것들과 전혀 다르게 생긴 단백질 형태를 만들어낸다면, 우리는 보통 "와, 정말 완전히 새로운 발명품이야!"라며 환호합니다.

하지만 여기 함정이 있습니다. 전체 요리가 이상하다고 해서 재료까지 새로운 것은 아닙니다. 어쩌면 셰프가 이미 알고 있는 감자, 알고 있는 당근, 그리고 알고 있는 스테이크를 가져다가 이전에 본 적 없는 기묘한 더미로 배치했을 뿐일지도 모릅니다. 이것은 새로운 발명일까요, 아니면 그저 오래된 부품들을 새로운 방식으로 배열한 것뿐일까요? 이것이 바로 과학자들이 컴퓨터가 생성한 단백질에 대해 던지는 핵심적인 질문입니다. 그들은 컴퓨터가 진정으로 새로운 '폴드(fold, 단백질이 취하는 3차원 구조)'를 발견하고 있는 것인지, 아니면 그저 익숙한 구성 요소들을 섞고 있는 것인지를 알고 싶어 합니다. 만약 우리가 이 둘을 구분할 수 없다면, 우리는 실제로는 오래된 부품들을 새로운 순서로 배치했을 뿐인 것을 "새로운 발견"이라며 축하하고 있는 것일지도 모릅니다.

"Is Retrieval All You Need?"라는 제목의 이 논문은 그 재료를 확인하기 위해 바로 그 주방 속으로 뛰어듭니다. 저자들(중국, 캐나다, 미국의 대학 연구진)은 현재 우리가 '새로움'을 측정하는 방식이 실제로 우리를 속이고 있는지 테스트하기로 했습니다. 그들은 8가지의 서로 다른 컴퓨터 프로그램이 생성하는 단백질 형태를 조사했습니다. 이 프로그램들은 노이즈를 선명한 그림으로 천천히 바꾸는 '디퓨전(diffusion)'이나 '플로우 매칭(flow matching)'과 같은 정교한 수학적 기법을 사용하여 새로운 구조를 꿈꿔냅니다.

컴퓨터가 생성한 단백질이 '새로운지' 확인하는 표준적인 방법은 전체 구조를 알려진 단백질이 담긴 방대한 데이터베이스와 비교하는 것입니다. 만약 전체 모양이 데이터베이스의 그 무엇과도 일치하지 않는다면, 그것은 '새로운(novel)' 배지를 받게 됩니다. 하지만 저자들은 이것이 마치 샌드위치의 전체 무게만 보고 판단하는 것과 같다고 주장합니다. 만약 당신이 한 번도 본 적 없는 빵 두 조각 사이에, 수백만 번 본 데 익숙한 표준적인 햄 한 조각을 넣었다면, 전체 샌드위치는 독특해 보일지 몰라도 햄은 새로운 것이 아닙니다.

이를 해결하기 위해 연구진은 **도메인 검색률(Domain Retrieval Rate, DRR)**이라는 새로운 데이터 관찰 방식을 도입했습니다. 단백 el 체인을 하나의 거대한 덩어리로 보는 대신, 그들은 이를 '도메인(domain)'이라고 불리는 작고 독립적인 덩어리들로 나누었습니다. 이 도메인들을 성을 만드는 개별 레고 블록이라고 생각해 보십시오. 연구진은 다음과 같이 물었습니다. "설령 전체 성의 모습이 기이하더라도, 개별 블록들은 이미 우리가 가지고 있는 표준적인 레고 조각들인가?"

이 새로운 테스트를 8가지 컴퓨터 프로그램에 적용했을 때, 결과는 놀라웠습니다. 컴퓨터가 머리부터 발끝까지 완전히 새로운 단백질을 만들어냈을 때조차, 거의 모든 경우에 그것들은 사실 익숙한 레고 블록들로 만들어져 있었습니다. 실제로 대부분의 프로그램에서 생성된 단백질의 90% 이상이 데이터베이스에 있는 알려진 도메인 중 적어도 하나와 일치하는 조각을 포함하고 있었습니다. 그 '새로움'은 대부분 익숙한 조각들을 새로운 방식으로 접착한 것에 불과했습니다.

이것이 단순한 우연이 아님을 증명하기 위해, 연구팀은 RetFold라는 자신들만의 매우 단순한 컴퓨터 프로그램을 구축했습니다. 이 프로그램은 정교한 학습이나 AI 훈련을 사용하지 않았습니다. 이것은 '제로 트레이닝(zero-training)' 베이스라인으로, 즉 아무것도 '학습'하지 않고 단순히 기하학적 규칙을 사용하여 데이터베이스에서 알려진 레고 블로들을 가져와 결합하는 방식이었습니다. 결과는 어떠했을까요? RetFold는 기존의 '전체 체인(whole-chain)' 방식 하에서 놀라울 정도로 '새로운' 단백질 형태를 만들어냈지만, 이는 그저 알려진 부분들을 재조합한 것에 불과했습니다. 기존의 테스트 하에서, 화려한 AI 프로그램들은 매우 새로운 것처럼 보였지만(대부분의 AI 프로그램의 전체 체인 검색률은 0.0%에서 0.6% 사이였습니다), RetFold는 20%의 비율로 검색되었습니다. 이는 AI 프로그램들이 보고한 '새로움'의 범위가 학습 없이도 단순히 부품을 재배열함으로써 도달할 수 있는 수준임을 보여주었습니다.

또한, 논문은 단백질이 얼마나 '새로운지' 점수를 매기는 세 가지 다른 방법을 테스트했습니다. 연구진은 가장 흔하게 쓰이는 점수 방식, 즉 전체 체인을 보는 방식이 사실 약간의 속임수라는 것을 발견했습니다. 여기에는 숨겨진 결함이 있습니다. 만약 당신이 매우 긴 단백질 체인을 만든다면, 점수는 자동으로 낮아지며, 이는 그 체인이 실제로는 오래된 부품들의 긴 줄일 뿐임에도 불구하고 마치 '새로운' 것처럼 보이게 만듭니다. 저자들은 만약 전체 알려진 조각이 실제로 존재하는지를 확인하는 더 엄격하고 정직한 점수 방식을 사용한다면, 그림이 완전히 바뀐다는 것을 보여주었습니다. 더 엄격한 테스트 하에서, 화려한 AI 프로그램들은 훨씬 덜 '창의적'으로 보였던 반면, (우리가 알고 있듯 단순히 부품을 재조합하는 것뿐인) 단순한 RetFold 프로그램은 100% 검색되었습니다. 이는 RetFold가 실제로 알려진 부품들을 사용하고 있음을 확인해주었으며, 엄격한 점수 방식이 재조합된 베이스라인과 AI 생성기를 성공적으로 분리해냄으로써, AI 프로그램들이 기존의 점수들이 시사했던 것만큼 순수하게 '창의적'이지 않다는 것을 드러냈음을 입증했습니다.

저자들은 우리가 단백질 설계를 축하할 때 훨씬 더 주의를 기울여야 한다고 결론짓습니다. 컴퓨터가 머리부터 발끝까지 일치하는 알려진 단백질이 없는 모양을 내놓는다고 해서, 그것이 반드시 새로운 폴드를 발견했다는 뜻은 아닙니다. 그것은 그저 오래된 부품들을 영리하게 재배열한 것일 수도 있습니다. 그들은 향elle 연구들이 '새로움'을 어떻게 측정하는지 정확히 보고해야 하며, 최종 조립품뿐만 아니라 그 구성 요소들 자체가 정말로 새로운 것인지도 확인해야 한다고 제안합니다. 이는 과학에서 때때로 가장 흥미로운 발견은 그저 새로운 옷을 입은 오래된 친구일 수도 있다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →