Articleopenai.com·2025년 8월 22일·5

Accelerating life sciences research

Quick Summary

오픈AI와 레트로 바이오사이언시스는 단백질 공학 특화 모델인 GPT‑4b 마이크로로 야마나카 인자 변형체를 설계해 줄기세포 재프로그래밍 표지자 발현을 야생형 대비 50배 이상 높이고, 다양한 세포·공여자·전달 방식에서 완전한 다능성과 유전체 안정성을 확인했다.

Accelerating life sciences research 관련 대표 이미지

🖼️ 인포그래픽

Accelerating life sciences research 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Accelerating life sciences research의 핵심 내용을 4단계로 요약한 인포그래픽
Accelerating life sciences research 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

오픈AI와 레트로 바이오사이언시스는 단백질 공학 특화 모델인 GPT‑4b 마이크로로 야마나카 인자 변형체를 설계해 줄기세포 재프로그래밍 표지자 발현을 야생형 대비 50배 이상 높이고, 다양한 세포·공여자·전달 방식에서 완전한 다능성과 유전체 안정성을 확인했다.

📌 핵심 요약

  • GPT‑4b 마이크로는 축소된 GPT‑4o를 기반으로 단백질 서열, 생물학 문헌, 토큰화된 3차원 구조, 진화·기능·상호작용 맥락을 추가 학습한 단백질 공학 특화 실험 모델이다.
  • 모델이 설계한 레트로SOX 후보의 30% 이상이 야생형 SOX2보다 우수했고, 평균적으로 100개가 넘는 아미노산이 달랐음에도 기존 변이 탐색보다 높은 적중률을 보였다.
  • KLF4 재설계에서도 모델 생성 후보 14개가 앞선 레트로SOX 실험의 최상위 조합보다 우수해 약 50%의 적중률을 기록했다.
  • 최상위 레트로SOX와 레트로KLF를 결합하자 초기·후기 다능성 표지자가 크게 증가하고 야생형 조합보다 며칠 일찍 나타났으며, 체외 실험에서 재프로그래밍 표지자 발현이 50배 이상 높아졌다.
  • 바이러스 벡터뿐 아니라 메신저 리보핵산 전달, 여러 세포 유형과 50세 이상 공여자에서도 효과가 재현됐고, 생성된 유도만능줄기세포는 세 배엽 분화 능력과 정상 핵형 및 유전체 안정성을 보였다.

🧩 주요 포인트

  1. GPT‑4b 마이크로는 축소된 GPT‑4o를 기반으로 단백질 서열, 생물학 문헌, 토큰화된 3차원 구조, 진화·기능·상호작용 맥락을 추가 학습한 단백질 공학 특화 실험 모델이다.
  2. 모델이 설계한 레트로SOX 후보의 30% 이상이 야생형 SOX2보다 우수했고, 평균적으로 100개가 넘는 아미노산이 달랐음에도 기존 변이 탐색보다 높은 적중률을 보였다.
  3. KLF4 재설계에서도 모델 생성 후보 14개가 앞선 레트로SOX 실험의 최상위 조합보다 우수해 약 50%의 적중률을 기록했다.
  4. 최상위 레트로SOX와 레트로KLF를 결합하자 초기·후기 다능성 표지자가 크게 증가하고 야생형 조합보다 며칠 일찍 나타났으며, 체외 실험에서 재프로그래밍 표지자 발현이 50배 이상 높아졌다.
  5. 바이러스 벡터뿐 아니라 메신저 리보핵산 전달, 여러 세포 유형과 50세 이상 공여자에서도 효과가 재현됐고, 생성된 유도만능줄기세포는 세 배엽 분화 능력과 정상 핵형 및 유전체 안정성을 보였다.

🧠 상세 정리

1. 생명과학 연구 가속을 위한 공동 실험

오픈AI는 인공지능이 생명과학 혁신을 실질적으로 앞당길 수 있는지 검증하기 위해 장수 생명공학 기업 레트로 바이오사이언시스의 응용 인공지능 팀과 협력했다. 연구진은 단백질 공학에 특화된 소형 실험 모델 GPT‑4b 마이크로를 만들고, 성체세포를 유도만능줄기세포로 되돌리는 야마나카 인자의 성능 개선에 적용했다. 모델이 설계한 새로운 단백질은 체외 실험에서 야생형 대조군보다 줄기세포 재프로그래밍 표지자 발현을 50배 이상 높였으며, 초기 관찰은 여러 공여자와 세포 유형 및 전달 방식에서 반복 검증됐다. 생성된 유도만능줄기세포주에서는 완전한 다능성과 유전체 안정성도 확인됐고, 본문 서두는 재설계 단백질이 기준선보다 향상된 디엔에이 손상 복구 능력도 보였다고 보고한다. 연구진은 이러한 결과를 생명과학 업계가 발견하고 재현할 수 있도록 모델의 연구·개발 과정과 실험 결과를 공개했다.

2. GPT‑4b 마이크로의 학습 구성

GPT‑4b 마이크로는 생물학 전반의 폭넓은 지식과 기술을 갖추면서도 단백질 공학처럼 요구 조건이 복잡한 작업에서 유연하게 지시할 수 있도록 설계됐다. 연구진은 GPT 계열이 이미 학습한 지식을 활용하기 위해 축소된 GPT‑4o에서 모델을 초기화한 뒤, 대부분 단백질 서열로 구성된 자료를 추가로 학습시켰다. 여기에 생물학 문헌과 토큰화된 3차원 구조 자료를 함께 포함했는데, 이는 구조 정보를 생략하는 경우가 많은 기존 단백질 언어 모델과 구별되는 구성이다. 단백질 설명, 공진화 관계를 가진 상동 서열, 상호작용이 알려진 단백질 집단도 추가 맥락으로 제공해 특정 속성을 요구하는 프롬프트에 맞춰 서열을 생성할 수 있도록 했다. 학습 자료 대부분이 특정 구조에 종속되지 않아 안정된 단일 구조가 없는 단백질 영역도 구조화된 단백질과 마찬가지로 다룰 수 있었다.

3. 긴 맥락과 실제 실험을 중시한 평가

야마나카 인자인 KLF4와 SOX2는 상당 부분이 비정형적이고 유연한 영역으로 이루어져 있으며, 하나의 고정된 구조보다 여러 결합 상대와 일시적으로 상호작용하는 성질이 기능에 중요하다. 연구진은 단백질 서열에 진화적·기능적 맥락을 결합함으로써 독립된 서열만 사용할 때보다 학습 예시의 실질적인 맥락 길이를 크게 확장했다. 그 결과 추론 단계에서 최대 6만4000토큰 규모의 프롬프트를 사용해도 제어 가능성과 출력 품질이 계속 개선되는 것을 관찰했으며, 본문은 이를 단백질 서열 모델에서 전례가 없는 맥락 규모라고 설명한다. 모델과 학습 자료가 커질수록 혼란도와 후속 단백질 평가 지표가 예측 가능한 방식으로 좋아지는 규모 확장 법칙도 나타나, 작은 규모에서 반복 실험한 뒤 최종 모델을 훈련할 수 있었다. 다만 계산상 평가 개선이 현실의 유용성으로 이어지는지는 불확실하므로, 연구진은 실제 치료제 개발과 연결된 세포 재프로그래밍 실험을 핵심 검증 수단으로 삼았다.

4. 야마나카 인자의 효율 한계와 거대한 탐색 공간

OCT4, SOX2, KLF4, MYC로 구성된 야마나카 인자는 성체세포를 다능성 줄기세포로 되돌릴 수 있어 재생생물학에서 중요한 역할을 한다. 그러나 표준 방식에서는 처리된 세포 중 보통 0.1% 미만만 전환되고 과정도 3주 이상 걸리며, 노령 또는 질환 공여자의 세포에서는 효율이 더 낮아진다. 단백질 서열을 직접 최적화하는 일도 어렵다. SOX2는 317개, KLF4는 513개의 아미노산으로 이루어져 가능한 변형 수가 약 10의 1000제곱에 달하므로, 몇 개 잔기만 바꾸는 전통적인 유도 진화 선별법으로는 극히 일부만 살필 수 있다. 기존의 대규모 SOX2 연구도 수천 개 변이를 시험해 성능이 소폭 개선된 삼중 변이체 몇 개를 찾는 데 그쳤고, 15년에 걸친 키메라 SOX 연구에서도 자연 단백질과 불과 다섯 잔기만 다른 수준의 변형체가 나왔다.

5. 레트로SOX 후보의 높은 적중률

레트로 연구진은 사람의 피부와 결합조직에서 유래한 섬유아세포를 이용해 습식 실험 선별 플랫폼을 구축했다. 먼저 표준 야마나카 인자 조합과 연구자들이 직접 설계한 SOX2 변형체로 예비 선별을 수행해 실험 체계를 검증한 뒤, GPT‑4b 마이크로에 다양한 레트로SOX 서열 생성을 요청했다. 선별에 포함된 모델 제안 중 30% 이상이 핵심 다능성 표지자 발현에서 야생형 SOX2를 능가했다. 이 후보들은 야생형과 평균 100개가 넘는 아미노산이 달라, 소수 잔기만 변경하는 기존 탐색 범위를 크게 넘어섰다. 본문이 비교 대상으로 든 전통적인 선별 실험에서는 적중률이 10% 미만인 경우가 일반적이므로, 이 결과는 모델이 넓은 서열 공간에서 기능을 유지하거나 개선한 후보를 높은 비율로 제안했음을 보여준다.

6. KLF4 재설계와 최상위 조합의 성능

연구진은 이어 야마나카 인자 가운데 가장 큰 KLF4를 재설계했다. KLF4는 다른 KLF 계열 인자로 대체할 수 있지만 기존 연구에서는 재프로그래밍 효율이 높아지지 않았고, 전문가가 단일 아미노산 치환을 설계한 실험에서도 19개 중 하나만 유효했다. GPT‑4b 마이크로가 생성한 레트로KLF 후보 가운데 14개는 앞선 레트로SOX 선별의 최상위 조합보다 우수해 약 50%의 적중률을 기록했다. 최상위 레트로SOX와 레트로KLF를 결합했을 때 세 차례의 독립 실험 모두에서 초기 표지자인 SSEA‑4와 후기 표지자인 TRA‑1‑60 및 NANOG가 크게 증가했다. 후기 표지자는 야생형 야마나카 인자 조합보다 며칠 먼저 나타났고, 10일째에는 야생형 처리 세포에서 검출되지 않던 후기 표지자가 재설계 조합에서 강하게 발현됐다.

7. 세포 수준에서 확인된 빠른 재프로그래밍

레트로SOX와 레트로KLF로 처리한 세포는 10일째 알칼리성 인산가수분해효소 염색에서도 다수의 진한 보라색 군집을 형성했다. 이는 세포가 후기 다능성 표지자를 발현하는 데 그치지 않고, 다능성과 연관된 강한 효소 활성을 보였다는 뜻이다. 현미경 관찰에서도 재설계 단백질을 사용한 조건에서 유도만능줄기세포로 진행할 때 나타나는 작고 둥글며 조밀한 형태의 군집이 표준 단백질 조건보다 많이 나타났다. 연구진은 서로 다른 표지자와 세포 형태 및 효소 활성을 함께 확인해 단일 측정값에만 의존하지 않고 재프로그래밍 진행을 평가했다. 이러한 결과는 최상위 변형체의 조합이 표준 야생형 조합보다 재프로그래밍 관련 신호를 더 빠르고 강하게 유도했다는 세포 수준의 근거를 제공한다.

8. 전달 방식·공여자·세포 유형을 넓힌 검증

연구진은 향상된 효율과 임상적 활용 가능성을 추가로 확인하기 위해 바이러스 벡터 대신 메신저 리보핵산 전달법을 사용하고, 섬유아세포와 다른 중간엽 기질세포에서도 시험했다. 세포는 50세가 넘는 중년 공여자 세 명에게서 얻었으며, 처리 후 불과 7일 만에 30%가 넘는 세포가 SSEA‑4와 TRA‑1‑60을 발현하기 시작했다. 12일째에는 전형적인 유도만능줄기세포와 유사한 형태의 군집이 다수 나타났고, 85%가 넘는 세포에서 OCT4, NANOG, SOX2, TRA‑1‑60을 포함한 핵심 줄기세포 표지자의 내인성 발현이 활성화됐다. 이는 재설계 인자의 효과가 특정 전달법이나 한 종류의 젊은 세포에만 국한되지 않았음을 보여준다. 본문은 서로 다른 전달 양식과 세포 유형에서 기존 표준 인자보다 강한 유도만능줄기세포 생성 결과가 일관되게 나타났다고 정리한다.

9. 완전한 다능성과 유전체 안정성 확인

레트로 인자로 생성한 유도만능줄기세포는 내배엽, 외배엽, 중배엽의 세 가지 일차 배엽으로 모두 분화할 수 있었다. 연구진은 여러 단일세포 유래 유도만능줄기세포주를 여러 계대에 걸쳐 증식시킨 뒤 정상적인 핵형과 유전체 안정성을 확인해, 표지자 발현만 증가한 불완전한 세포가 아님을 검증했다. 이 세포주들은 표준 인자를 사용해 위탁연구기관이 만든 기존 유도만능줄기세포주의 기준보다 일관되게 우수한 결과를 보였다고 보고됐다. 본문 서두에는 재설계 단백질이 기준선보다 향상된 디엔에이 손상 복구 능력과 더 높은 회춘 잠재력을 나타냈다는 결과도 제시된다. 다만 제공된 원문은 해당 손상 복구 실험의 구체적인 절차와 수치를 설명하는 부분에 도달하기 전에 끝나므로, 그 이상의 작동 원리나 효과 범위는 이 자료만으로 확정할 수 없다.

🧾 핵심 주장 / 시사점

  • 모델의 가치는 계산상 단백질 평가 점수보다 실제 습식 실험에서 드러났으며, 야생형과 크게 다른 서열을 높은 적중률로 제안해 전통적인 소수 잔기 변이 탐색의 범위를 확장했다.
  • 초기·후기 표지자, 세포 형태, 알칼리성 인산가수분해효소 활성, 세 배엽 분화, 정상 핵형을 단계적으로 확인함으로써 단순한 표지자 증가와 완전한 유도만능줄기세포 형성을 구분했다.
  • 여러 공여자와 세포 유형, 바이러스 벡터와 메신저 리보핵산 전달에서 결과가 재현됐다는 점은 성능 향상이 하나의 실험 조건에만 의존하지 않았음을 보여준다.

✅ 액션 아이템

  • GPT‑4b 마이크로의 학습 입력(단백질 서열, 문헌, 3차원 구조, 진화·상호작용 맥락)을 레트로SOX/레트로KLF 설계 기준으로 정비한다.
  • 야생형 SOX2 대비 30% 이상 우수한 레트로SOX 상위군에서 100개 이상 아미노산이 달라진 후보의 재현성 데이터만 선별해 성능 평가 체계를 정한다.
  • 최상위 레트로SOX·레트로KLF 결합이 표지자 발현 50배 이상 증가와 초기·후기 다능성 강화 효과를 바이러스 벡터·mRNA 전달·50세 이상 공여자에서 모두 확인한다.

❓ 열린 질문

  • KLF4 재설계에서 모델 생성 14개 중 약 50% 적중률이 다른 세포 유형에서도 동일하게 유지될 것으로 볼 수 있는가?
  • 아미노산 치환이 100개 이상인 후보에서 유전체 안정성 저하를 선제적으로 탐지할 분기점을 어떤 지표로 둘 것인가?
  • 바이러스 벡터와 mRNA 전달에서 며칠의 표지자 발현 선행 시점 차이가 실제 임상 전환성에 유의한 개선으로 해석될 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.