ArticleAnthony Costa·2026년 9월 24일·0

How Open Science Can Help Researchers Prepare for the Next Pandemic

Quick Summary

NVIDIA와 Google DeepMind, EMBL EBI 등이 2,800종이 넘는 바이러스의 단백질 복합체 3D 구조 예측을 AlphaFold Database에 공개해 미래 팬데믹 대비를 위한 연구 기반을 넓혔다.

How Open Science Can Help Researchers Prepare for the Next Pandemic 관련 대표 이미지

🖼️ 인포그래픽

How Open Science Can Help Researchers Prepare for the Next Pandemic 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How Open Science Can Help Researchers Prepare for the Next Pandemic의 핵심 내용을 4단계로 요약한 인포그래픽
How Open Science Can Help Researchers Prepare for the Next Pandemic 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

NVIDIA와 Google DeepMind, EMBL-EBI 등이 2,800종이 넘는 바이러스의 단백질 복합체 3D 구조 예측을 AlphaFold Database에 공개해 미래 팬데믹 대비를 위한 연구 기반을 넓혔다.

📌 핵심 요약

  • COVID-19 백신의 신속한 설계에는 수십 년간 축적된 코로나바이러스 연구가 기여했지만, 다음 팬데믹에서도 같은 지식 기반이 확보된다는 보장은 없다. Center for Global Development는 2050년까지 COVID-19만큼 심각한 팬데믹이 발생할 확률을 약 50%로 추정했다.
  • NVIDIA, Google DeepMind, EMBL-EBI 등이 참여한 국제 협력은 2,800종이 넘는 바이러스의 단백질 복합체 3D 구조 예측을 AlphaFold Database를 통해 전 세계 연구자에게 공개했다.
  • 연구진은 AlphaFold2와 NVIDIA BioNeMo Inference Runtime의 최적화를 활용해 수천 개 바이러스의 단백질체를 대상으로 복합체 구조를 예측했다. NVIDIA는 자체 표적의 단백질 서열에서 구조를 예측할 수 있는 BioNeMo Structure Prediction Pipeline도 공개한다.
  • 추가되는 단백질 상호작용의 약 30%는 실험으로 결정된 단백질 구조를 모은 Protein Data Bank에 기록되지 않은 새로운 상호작용 형태다. 이는 연구 가설을 만드는 기반이며, 공개된 예측에는 신뢰도가 표시되고 신뢰도가 높은 예측도 실험으로 검증할 수 있다.
  • 기존 구조 규명은 구조 하나에 수년과 수천 달러가 들 수 있지만, 최적화된 AlphaFold2는 수분 내 예측과 대량 처리가 가능하다. 공개 데이터는 연구가 부족한 바이러스와 자원이 제한된 환경의 연구를 지원하며, AlphaFold Database의 전체 단백질·복합체 예측은 2억 6천만 개를 넘는다.

🧩 주요 포인트

  1. COVID-19의 사전 연구 효과 → 미래 팬데믹에 대비하려면 알려지지 않은 바이러스에 관한 구조 지식을 미리 축적할 필요가 있다.
  2. 단백질 복합체 예측과 약 30%의 새로운 상호작용 형태 → 개별 단백질을 넘어 바이러스 기능과 백신·치료제 표적에 관한 가설 탐색을 확대한다.
  3. AlphaFold Database와 BioNeMo Structure Prediction Pipeline 공개 → 데이터 접근과 자체 표적 예측의 장벽을 낮추되, 신뢰도 해석과 실험 검증이 연구 활용의 핵심으로 남는다.

🧠 상세 정리

1. 다음 팬데믹을 위한 지식의 사전 축적

COVID-19가 등장했을 때 과학자들은 수십 년간 축적된 코로나바이러스 연구 덕분에 주요 단백질을 이해하고 있었고, 이는 매우 빠른 백신 설계를 가능하게 한 중요한 기반이었다. 그러나 다음 팬데믹을 일으킬 병원체에 대해서도 같은 수준의 사전 지식이 있으리라는 보장은 없다. Center for Global Development의 분석은 2050년까지 COVID-19만큼 심각한 팬데믹이 발생할 확률을 약 50%로 추정하며, 지금부터 준비해야 할 필요성을 뒷받침한다. 프로젝트 참여자인 글래스고대학교 바이러스 연구센터의 분자바이러스학 교수 Joe Grove는 예상치 못한 위협이 등장할 때의 지식 부족을 줄이기 위해 미리 지식을 비축하는 것이 이번 작업의 목적이라고 설명했다.

2. 2,800종 이상 바이러스의 구조 예측 공개

NVIDIA는 Google DeepMind와 유럽분자생물학연구소 산하 유럽생물정보학연구소인 EMBL-EBI 등을 포함한 국제 연구 연합에 참여해 2,800종이 넘는 바이러스의 단백질 복합체 3D 구조 예측을 공개했다. 데이터는 AlphaFold Database를 통해 위치에 관계없이 모든 과학자가 이용할 수 있다. 연구진은 단백질의 3D 접힘을 예측하는 Google DeepMind의 AlphaFold2에 NVIDIA BioNeMo Inference Runtime의 최적화를 적용했다. 이를 통해 수천 개 바이러스의 단백질체로 추론을 확장하고, 각 바이러스가 암호화하는 단백질들이 상호작용하며 이루는 복합체를 예측했다. Google DeepMind의 Risha Patel은 이러한 공개가 기초 생물학 정보에 대한 접근을 넓히고 미래 감염병 발생에 대비할 통찰을 제공하려는 목표에 부합한다고 밝혔다.

3. 새로운 상호작용 형태와 가설 생성

데이터베이스에 추가되는 단백질 상호작용의 약 30%는 과학계에 완전히 새로운 것으로 소개된다. 구체적으로는 실험으로 결정된 단백질 구조의 주요 저장소인 Protein Data Bank에 한 번도 기록되지 않은 상호작용 형태를 보여준다는 의미다. 이는 생물학 연구자들이 탐색하고 새로운 지식을 만드는 데 활용할 수 있는 단서를 제공하지만, 예측 자체가 실험으로 확정된 구조라는 뜻은 아니다. NVIDIA의 디지털 생물학 응용 연구 책임자 Chris Dallago는 이 데이터베이스를 가설 생성의 동력으로 설명했다. 그는 생물학자와 AI 연구자가 단백질을 개별 분자로만 보지 않고 복합체 안에서의 상호작용으로 조사할 수 있도록 하는 데 의의를 뒀다.

4. 복합체 구조의 중요성과 예측 속도

대부분의 단백질은 단독으로 작동하지 않고 여러 분자가 모인 복합체를 이루어 복잡한 기능을 수행하며, 바이러스 기능을 방해하려는 백신이나 약물은 이러한 구조를 표적으로 삼아야 하는 경우가 많다. COVID-19 바이러스의 스파이크 단백질 3D 구조에 대한 이해는 백신 설계의 토대였지만, 수천 종의 다른 바이러스에는 아직 그러한 구조 지식이 없다. 단백질을 결정화하고 X선을 조사하는 전통적인 구조 규명 방식은 구조 하나에 수년과 수천 달러가 들 수 있다. 반면 NVIDIA GPU에서 효율적으로 실행되도록 BioNeMo로 최적화한 AlphaFold2는 수분 내에 구조를 예측하고 대량으로 처리할 수 있으며, 과학자들은 신뢰도가 높은 예측을 실험 방법으로 검증할 수 있다. 이번 연구진은 일반 감기 바이러스부터 Mpox 같은 새롭게 부상하는 위협까지 사람을 감염시키는 것으로 알려진 바이러스 계열을 체계적으로 다뤘다.

5. 국제 협력과 연구 접근성 확대

이번 협력에는 감염병혁신연합, EMBL-EBI, Google DeepMind, NVIDIA, 서울대학교, 성균관대학교, 스위스 생물정보학연구소와 글래스고대학교가 참여했다. 데이터 공개는 원문 기준 이번 주 뉴욕에서 세계경제포럼이 소집한 팬데믹 예방·대비·대응 관련 유엔총회 회의에 맞춰 이뤄졌다. 데이터가 추가되는 AlphaFold Database는 과학계에 알려져 목록화된 거의 모든 단백질을 포괄하며, 단백질과 단백질 복합체 예측을 2억 6천만 개 이상 보유하고 있다. EMBL-EBI 임시 책임자 Jo McEntyre는 데이터 공개가 바이러스 진단을 이해하고 치료제와 백신을 개발하는 데 중요하다고 강조했다. 또한 연구가 부족한 바이러스도 포함함으로써 감염병 발생에 직접 대응하는 자원이 제한된 환경의 과학자들에게 연구 접근 장벽을 낮춰준다고 설명했다.

6. 신뢰도 표시와 연구자가 활용할 수 있는 도구

공개 데이터의 각 예측에는 신뢰도가 표시되어 있으며, 구조는 바이러스 복합체가 어떤 모습일 수 있는지와 바이러스 단백질체 안에서 개별 단백질이 어떻게 상호작용할 수 있는지를 제시한다. 따라서 연구자는 이를 가능한 구조와 상호작용에 관한 정보로 해석하면서 후속 연구에 활용할 수 있다. NVIDIA는 데이터 생성에 사용한 GPU 가속 작업 흐름인 BioNeMo Structure Prediction Pipeline도 공개해, 연구자가 자신의 표적 단백질 서열로부터 3D 구조를 예측할 수 있도록 한다. 데이터는 AlphaFold Database Pandemic Preparedness Portal에서 탐색할 수 있다. Grove는 자신의 박사과정 당시에는 연구하던 단백질의 구조가 전혀 없어 추측에 의존해야 했다며, 이번 데이터가 현재 연구자들에게 양질의 구조 정보를 제공해 기초과학 연구를 가속할 도구가 될 것이라고 평가했다.

🧾 핵심 주장 / 시사점

  • 팬데믹 대비의 한 축은 유행이 시작된 뒤 구조를 규명하는 데서, 다양한 바이러스의 구조 지식을 미리 축적하는 방향으로 확장된다.
  • 약 30%의 새로운 상호작용 형태가 주는 가치는 확정된 답을 제공하기보다, 복합체 수준에서 검증할 연구 가설의 범위를 넓히는 데 있다.
  • 예측 데이터와 생성 파이프라인을 함께 공개하면 기존 구조 정보를 이용하는 연구뿐 아니라 연구자가 선택한 표적의 구조를 직접 예측하는 작업도 지원할 수 있다.

✅ 액션 아이템

  • AlphaFold Database에서 연구 대상 바이러스의 단백질 복합체 예측과 신뢰도를 확인해 가설 탐색에 활용할 가능성을 검토한다.
  • BioNeMo Structure Prediction Pipeline을 활용한 자체 표적 단백질의 구조 예측 가능성을 검토한다.
  • 약 30%의 새로운 상호작용 형태 중 연구 목적과 관련된 예측을 검토하고, 신뢰도가 높은 예측의 실험 검증 필요성을 판단한다.

❓ 열린 질문

  • 2,800종이 넘는 바이러스의 단백질 복합체 예측은 미래 팬데믹에 대비한 구조 지식의 공백을 어느 정도 줄일 수 있을까?
  • 약 30%의 새로운 상호작용 형태 가운데 어떤 예측을 우선 실험 검증할 필요가 있을까?
  • AlphaFold Database와 BioNeMo Structure Prediction Pipeline의 공개는 자원이 제한된 환경의 연구 접근 장벽을 얼마나 낮출 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.