← 최신 논문
💻 bioinformatics

ML4SD: Leveraging Machine Learning and High-Throughput Search Algorithms for an Iterative Growth-Coupled Design Innovation

이 논문은 머신러닝과 새로운 고처리량 알고리즘(gcSwarms)을 통합하여 성장 결합형 미생물 균주 설계를 효율적으로 식별함으로써, 전통적인 탐색 방법보다 훨씬 적은 실험 반복 횟수로도 탄소 수율을 현저히 높이는 능동 학습 기반의 설계-제작-테스트-학습(Design-Build-Test-Learn) 사이클인 ML4SD를 소개한다.

원저자: Gargantilla Becerra, A., Nogales Enrique, J.

게시일 2026-09-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gargantilla Becerra, A., Nogales Enrique, J.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

순환 경제를 구축하기 위한 경쟁 속에서, 과학자들은 미생물이 폐기물을 가치 있는 화학 물질로 전환하여 현재 우리 세상을 움직이는 석유 기반 공정을 대체하도록 가르치려 노력하고 있습니다. 박테리아가 작은 노동자로서 역할을 수행하며 버려진 식물성 물질이나 산업 부산물을 섭취하고 플라스틱, 연료 또는 의약품을 배출하는 공장 바닥을 상상해 보십시오. 문제는 이 미세한 노동자들이 인간을 위해 특정 제품을 만드는 데 에너지를 쓰는 것보다 성장과 분열을 우선시한다는 점입니다. 이를 해결하기 위해 엔지니어들은 원하는 제품을 만드는 것이 유기체 자체의 생존에 필수적이 되도록 박테리아의 내부 대사를 재설계하려고 시в합니다. 만약 박테리아가 화학 물질 생산을 멈추면 성장도 멈추게 됩니다. 이러한 '성장 결합(growth-coupled)' 전략은 미생물이 작업을 수행하도록 강제하지만, 적절한 유전적 스위치를 찾아내는 것은 수십억 개의 가능성이라는 건초더미 속에서 바늘을 찾는 것과 같습니다. 전통적인 방식은 한 번에 하나의 유전적 변화를 테스트하는 것으로, 매우 느리고 비용이 많이 들며 결과가 드문드문 나오는 경우가 많습니다.

연구팀은 이제 컴퓨터 모델링과 머신러닝을 결합하여 이 탐색 속도를 획기적으로 높이는 새로운 접근 방식을 개발했습니다. 그들은 설계된 박테리아를 위한 스마트 가이드 역할을 하는 ML4SD라는 시스템을 만들었습니다. 수천 가지의 유전적 조합을 맹목적으로 테스트하는 대신, 이 시스템은 박테리아 대사의 디지털 트윈을 사용하여 서로 다른 유전적 절단이 성장과 생산에 어떤 영향을 미치는지 시뮬레이션합니다. 그런 다음 머신러닝을 사용하여 이러한 시뮬레이션으로부터 학습하고, 성공으로 이어지는 패턴을 식별합니다. 연구진은 이 학습이 작동하기 위해서는 초기 시뮬레이션 설계 풀(pool)이 매우 방대하고 다양해야 하며, 실패하거나 성능이 낮은 설계도 많이 포함되어야 한다는 것을 발견했습니다. 만약 풀이 '최적의' 설계들로만 구성된다면, 컴퓨터 모델은 혼란에 빠져 새로운 상황에 일반화할 수 없게 됩니다. 다양한 데이터로 학습함으로써, 시스템은 어떤 유전적 변화가 가장 잘 작동할지 예측하는 법을 배웠으며, 결과적으로 탐색 범위를 효과적으로 좁혔습니다.

이 방법의 성능을 테스트하기 위해, 팀은 구체적이고 까다로운 과제에 집중했습니다. 바로 식물 폐기물에서 유래한 리그닌 성분인 4-하이드로벤조에이트를 나일론-6의 원료인 6-카프로락탐으로 전환하는 것입니다. 이는 화학적 경로가 복잡하고, 박테리아인 Pseudomonas putida가 자연적으로 이 작업을 효율적으로 수행하지 못하기 때문에 매우 어려운 전환 작업입니다. 연구진은 처음에 기존 알고리즘을 사용하여 잠재적인 유전적 설계 목록을 생성하려 했으나, 해당 알고리즘이 머신러닝 모델이 효과적으로 학습할 수 없는 작고 반복적인 옵션들을 생성한다는 것을 발견했습니다. 모델은 과적합(overfitting), 즉 주어진 몇 가지 사례를 암기만 할 뿐 새로운 설계에 대해서는 예측에 실패하는 현상을 보였습니다.

이를 해결하기 위해 팀은 gcSwarms라는 새로운 탐색 알고리즘을 구축했습니다. 이전 방식과 달리, 이 알고리즘은 설계 공간을 더 넓게 탐색하여 단 한 번의 실행으로 50,000개 이상의 고유한 유전적 설계를 생성했습니다. 여기에는 완벽하지 않은 설계들도 많이 포함되어 있어, 머신러닝 시스템이 대사의 근본적인 규칙을 학습하는 데 필요한 풍부하고 다양한 데이터를 제공했습니다. 이 다양한 라이브러리를 ML4SD 시스템에 입력했을 때 결과는 놀라웠습니다. 시스템은 초기 탐색만으로 찾은 최적의 설계들과 비교했을 때 탄소 수율을 최대 164%까지 향상시키는 유전적 결실(deletions) 세트를 성공적으로 식별해 냈습니다.

이 접근 방식의 힘은 효율성에 있습니다. 고성능 설계를 찾기 위해 ML4SD 시스템은 4,500개 미만의 설계만을 탐색했습니다. 반면, 전통적인 탐색 알고리즘은 유사한 수준의 성능에 도달하기 위해 10,000개에서 30,000개 사이의 설계를 검토해야 했습니다. 이는 새로운 방법이 2배에서 7배 적은 계산 노력만으로 동일한 결과를 달 수 있음을 의미합니다. 더욱이, 시스템은 최적의 설계들에서 일관되게 나타나는 최소한의 세 가지 유전적 변화 세트를 정확히 짚어낼 수 있었습니다. 이러한 변화들은 세포 내부의 에너지 흐로를 효과적으로 재지정하여, 세포가 자원을 나일론 전구체를 만드는 데 집중하도록 강제했습니다.

연구진은 이러한 결과가 현재 시뮬레이션 단계이며, 이 방법의 잠재력을 보여주는 개념 증명(proof of concept)임을 강조합니다. 다음 단계는 실제 박테리아를 실험실에서 배양하여 컴퓨터가 예측한 대로 수행되는지 테스트하는 것입니다. 만약 성공한다면, 이 접근 방식은 지속 가능한 바이오 제조의 발전을 크게 가속화하여, 현재의 방식보다 훨씬 적은 시간과 자원으로 폐기물을 가치 있는 재료로 전환할 수 있게 할 것입니다. 기계가 실패와 성공의 다양한 시도로부터 학습하도록 가르침으로써, 연구진은 복잡한 대사 공학의 지형을 항해하기 위한 로드맵을 구축했으며, 보다 순환적이고 지속 가능한 산업적 미래를 향한 실질적인 길을 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →